ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

31岁罗福莉,晋升小米最高职级22级

31岁罗福莉,晋升小米最高职级22级 大家好我是二哥呀。看到一则消息蛮感慨的小米 MiMo 大模型团队的负责人罗福莉晋升到 22 级。据说22 级是小米职级体系里的最高一级。公开的资料显示罗福莉毕业后去了阿里达摩院我也是那时候加的她微信主导跨语言预训练模型 VECO。2022 年她加入幻方量化后来到 DeepSeek 参与了 DeepSeek-V2 的研发。2025 年 11 月她在朋友圈官宣加入小米 MiMo。从官宣到这次晋升不到 11 个月。可能很多小伙伴想知道这 11 个月里 MiMo 做出了什么。于是我把 MiMo 从 2025 年 4 月到现在的技术报告、arXiv 论文、GitHub 仓库都翻了一遍。模型从 7B 的推理模型做到了万亿参数9 月 22 日开源的 MiMo-V2.6-Pro 在第三方评测机构 Artificial Analysis 的智能指数上拿了开源权重第一。并且这一版的 RL 训练是公开直播的另外 MiMo-V3 会换上 HySparse2 架构。模型之外小米还做了开源的终端编程 Agent MiMo Code 和桌面客户端 MiMo Desktop。我之前做过两期视频一期讲 MiMo 的 RL 训练一期讲 HySparse2播放量还挺高。接下来我会帮大家梳理一下一支国内大模型团队这一年是怎么把模型、训练、架构和产品一件件做出来的应该会对你很有帮助。如有错误都怪GPT-6.1 Sol哈哈都怪他调研不准确01、从 7B 开始MiMo 的第一个模型是 2025 年 4 月底开源的 MiMo-7B70 亿参数的稠密模型MIT 协议。技术报告arXiv 2505.07608里有写预训练用了约 25T token模型里还加了多 token 预测Multi-Token PredictionMTP模块让模型一次预测后面好几个 token。经过 RL 训练的 MiMo-7B-RL在美国数学邀请赛 AIME 2024 的题目上拿到 68.2 分AIME 2025 拿到 55.4 分数学题集 MATH-500 拿到 95.8 分。5 月 30 日更新的 0530 版本AIME 2024 提高到了 80.1 分。接下来半年团队在 7B 尺寸上延伸了多模态。5 月 30 日开源视觉语言模型 MiMo-VL-7B9 月 18 日开源 MiMo-Audio-7B预训练用了超过 1 亿小时的音频数据。11 月 19 日又发布了同时面向自动驾驶和具身智能的 MiMo-Embodied-7B。MiMo 模型第一次做到几百 B 的规模是 2025 年 12 月的 V2-Flash。02、V2-Flash 定下骨架2025 年 12 月 16 日小米开源了 MiMo-V2-Flash。第二天罗福莉在小米人车家全生态合作伙伴大会上做了演讲这是她第一次以 MiMo 负责人的身份公开亮相。V2-Flash 是一个混合专家Mixture of ExpertsMoE模型总参数 309B每处理一个 token 只激活其中 15B。上下文 256K预训练用了 27T token。在修复真实 GitHub issue 的编程评测 SWE-Bench Verified 上它拿到了 73.4AIME 2025 是 94.1。这一版最值得看的是注意力的排布。模型一共 48 层其中 39 层是滑动窗口注意力Sliding Window AttentionSWA每个 token 只看自己前面最近的 128 个 token。剩下 9 层是全注意力每个 token 要把前面所有内容看一遍。小米把这种排布称作混合滑动窗口注意力Hybrid SWA。全注意力看得全但上下文越长计算就越慢KV Cache 占的显存也越多。滑动窗口只看一小段又快又省。大部分层用滑窗、少数几层看全局是在速度和效果之间取的折中。这套结构后来一直用到了 V2.6。训练方法上V2-Flash 用的是多教师在线策略蒸馏Multi-Teacher On-Policy DistillationMOPD。做法分三步先做监督微调SFT再为代码、搜索等不同领域分别训练教师模型最后让学生模型自己生成回答由教师模型在每个 token 上打分作为学生的奖励。学生学的是自己生成的内容一个模型就能把几个领域教师的本事学到手。Agent 能力要靠 RL 环境来训练。真实环境里的代码 Agent 任务有 9 万个搜索任务 15 万个通用任务 5 万个。代码任务总数超过 10 万个跑在 Kubernetes 上同时运行的 podKubernetes 里最小的运行单元超过 1 万个环境搭建成功率 70%覆盖 8 种编程语言。03、V2-Pro 到 V2.52026 年 3 月 19 日小米发布了 MiMo-V2-Pro、MiMo-V2-Omni 和 MiMo-V2-TTS 三个模型。V2-Pro 总参数超过 1T激活 42B总参数是 V2-Flash 的三倍多。发布之前它用 Hunter Alpha 这个代号匿名挂在模型 API 聚合平台 OpenRouter 上全模态的 Omni 用的代号是 Healer Alpha。4 月 23 日 MiMo-V2.5 开始公测4 月 28 日开源还是 MIT 协议。V2.5 总参数 310B、激活 15B是原生全模态模型。V2.5-Pro 总参数 1.02T、激活 42B一共 70 层60 层滑窗、10 层全注意力。两个模型的上下文都做到了 1M。V2.5-Pro 在 SWE-bench Pro 上拿到了 57.2。Artificial Analysis 在它发布时给了 54 分和 Kimi K2.6 并列开源模型第一。从 V2-Flash 到 V2.5-Pro四个多月参数从 309B 做到了 1T 以上上下文从 256K 做到了 1M。然后 MiMo 安静了将近半年。04、V2.6 的 RL这半年在做什么罗福莉 9 月 17 日发文说团队在研究强化学习Reinforcement LearningRL到底能扩展到多远还把 V2.6 的 RL 训练做成了直播训练面板放在mimo.xiaomi.com/rl上。9 月 22 日 V2.6 发布直播面板上Pro 和 Flash 各训练了 75.3 万个样本。这里需要讲两件事。第一件是多任务混合。一次 RL 训练里同时混进多个 Harness 的任务模型在同一轮训练里既要在编程 Agent 的环境里改代码也要在其他 Agent 环境里完成任务。第二件是奖励怎么给。V2.6 的奖励同时看测试用例和评分细则rubric。只用测试用例的话所有通过的解法拿到的奖励都一样写得好的和勉强凑合的分不出来。小米的办法是分组 Agent 评分Groupwise Agentic Grading。离线阶段把同一道题的多条 rollout 放在一起对比自动生成评分细则。在线阶段对通过测试的轨迹排序重新分配优势值advantage也就是每条轨迹比同组平均水平好多少。通用 Agent 任务则拆成一条条原子化的二元评分项每一项只判断是或否。不同的任务V2.6 分开来练。代码这类能自动验证、难度适中的任务放在一起做混合 RLMixRL。难以验证的任务、步数特别长的任务还有游戏、3D 这类单独训练最后用 MOPD 合并到一个模型里。整套训练叫“You Only RL Once”训练时冻结 MoE 的路由器也就是决定每个 token 交给哪几个专家处理的模块。RL 前后的差距很明显编程 Agent 评测 DeepSWE 上 Flash 从 48.8 提到 65.7Pro 从 58.4 提到 72.6。Artificial Analysis 智能指数 v4.3.2 给 V2.6-Pro 打了 46 分是开源权重模型里的第一名。小米还开源了 7000 个 RL 环境以及一个蒸馏到 Qwen 上的 9B 模型 MiMo-V2.6-Distill-Qwen-9B。9 月 27 日小米又补发了 Pro-MOPD 和 Flash-MOPD 两个版本用来缓解工具调用重复的问题。05、HySparse29 月 23 日罗福莉发文说 MiMo-V3 会换上一套新架构核心组件是当天发布的 HySparse2。为什么要换Agent 场景里模型的动作很快但换回来的观察结果很长。模型输出一行命令工具可能返回几百行日志这几百行日志都要先读进去。读进去这一步叫 Prefill预填充模型把输入从头读一遍给每一层建好 KV Cache。KV Cache 存的是每个 token 在每一层算出来的 K 和 V后面每生成一个 token 都要回头查它。输入越长Prefill 越慢KV Cache 越占显存。上一代的 HySparsearXiv 2602.03560名字取自混合稀疏注意力Hybrid Sparse Attention。在 80B 的 MoE 模型上49 层里只保留 5 层全注意力KV Cache 减少了接近 10 倍。稀疏注意力除了看最近的一段还会从整段上下文里挑出最重要的一批 token 来看。HySparse2arXiv 2609.263689 月 22 日提交在这个基础上把模型切成了前后两段。前半段叫 Self-Decoder全注意力层和滑窗层混合和 V2 系列差不多。后半段叫 Cross-Decoder由一个个小模块组成每个小模块是一层全注意力后面跟几层稀疏注意力。切成两段是为了做两级 KV 共享。第一级在后半段的小模块内部叫 KV Reuse稀疏层直接复用本模块全注意力层的 KV Cache 和它挑出来的 token 名单自己不存 KV Cache。第二级跨越前后两段叫 KV Bridging后半段的全注意力层不用自己那一层的输入而是拿前半段某一层的隐藏状态来计算 K 和 V。KV Bridging 的思路来自微软研究院和清华 2024 年提出的 YOCOYou Only Cache Once。两级共享合在一起Prefill 跑完前半段就可以停。后半段的稀疏层不存 KV Cache后半段全注意力层的 K 和 V 又都能从前半段算出来。工具返回的一大段日志进来只要过完前半段整个模型需要的 KV Cache 就齐了。挑 token 的方式也改了。上一代以 64 个 token 为一块整块挑HySparse2 改成逐个 token 挑。上一代的稀疏层还外挂了一个单独的滑窗分支这个分支要用后半段自己算出来的结果Prefill 就得把后半段也跑一遍。HySparse2 取消了这个分支改成挑选时强制保留最近的 128 个 token。06、MiMo Code小米自己也做了一个 Harness就是 MiMo Code。2026 年 6 月 10 日MiMo Code V0.1 上线并开源MIT 协议一行 curl 命令就能安装。MiMo Code 是开源终端编程 Agent OpenCode 的 fork多 Provider、终端界面TUI、语言服务协议LSP、MCP 这些能力都保留了下来。MiMo Code 主打长程任务long horizon也就是任务跑到几十步、上百步之后还能不出错。上下文这块它在上下文预算用到约 20%、45%、70% 的时候各设一个检查点checkpoint派一个独立的 writer Sub-agent 把当前的工作状态写到磁盘上。上下文快满时执行一次 rebuild开一个新窗口用写好的文件重建上下文。记忆分四层。会话级是 checkpoint.md项目级是 MEMORY.md用户级是全局记忆最底下一层是用 SQLite 存下来的完整会话记录。另外还有两个定时任务dream 每 7 天合并一次重复的记忆distill 每 30 天把反复出现的流程整理成 Skill。Max Mode 每一步并行生成 5 个候选方案再由同一个模型当评委选一个执行SWE-Bench Pro 上比单次采样高 10% 到 20%token 消耗是 4 到 5 倍目前还是实验功能。任务再大一些Dynamic Workflow 让主 Agent 生成一段 JavaScript 脚本用 agent()、parallel()、pipeline() 三个函数派发 Sub-agent、控制并发在沙箱里按代码执行。9 月 22 日0.1.15 版把同一步里的多个工具调用改成了串行执行只有只读和检索类的工具可以并行还加了工具调用检测专门拦截短时间内大量涌出的工具调用。07、MiMo Desktop9 月 8 日小米开放了桌面客户端 MiMo Desktop 的邀测它的核心引擎就是 MiMo Code。MiMo Desktop 能接收表格、图片、视频、PDF、录音未解压的压缩包也能直接丢进去。交付的东西包括文档、表格、幻灯片、网页、图片、音频、视频还有 3D 模型、App 和软件工程项目。它可以让多个 Agent 协作通过 MCP 控制 Figma也能自主操作浏览器。缓存命中率在同一个会话里最高 99%跨会话最高 95%。ending今年 7 月小爱同学调整架构之后基础模型也交给了 MiMo 团队。不得不说AI 时代不仅模型进化得快Agent 迭代的快人的晋升也来得快。这可能就是 AI 时代赋予我们最大的红利了。我们下期见。
返回列表