
AI前沿 | 2026年9月22日小米 MiMo-V2.6 开源 AA 46 分开源第一 RL 训练账单透明首屏导读 · 本教程配套付费专栏《大模型工程师修炼手记》19.9 元AI 编程 · Agent 实战 · 本文同主题系统课程· 《AI时代程序员的自我提升》49.9 元AI 时代成长方法论单篇不过瘾订阅解锁全量源码、实战与答疑文末附资料包领取方式 ↓本期导读9 月 22 日凌晨小米官方发布MiMo-V2.6并全面开源——Pro 与 Flash 两个原生全模态模型Artificial Analysis 综合智能指数 46 分、登顶开源权重第一此前开源最强 Kimi K3 44 分较自家前代 MiMo-V2.5-Pro 的 26 分大涨 20 分。这一次最破圈的不是分数而是「把 RL 训练账单摊开给你看」Pro 训练成本 262 万美元、耗时 5 天 7 小时Flash 85 万美元、3 天 11 小时双模型各 30 步、累计约 75 万条训练轨迹。除了模型权重它还连锅端出了技术报告、Distill-Qwen-9B 蒸馏小模型、7k RL 任务环境、以及 verl/uni-agent/mini-swe-agent 端到端 RL 训练框架。本期拆五讲事件、账单、能力、开源生态、给创业者的判断。一、事件凌晨开源双模型AA 46 分登顶开源权重第一9 月 22 日凌晨小米官方在 mimo.mi.com 发布MiMo-V2.6Pro 与 Flash 两个版本同源原生全模态文本、图像、音频、视频。核心打点是 Artificial Analysis 综合智能指数MiMo-V2.6-Pro 46 分开源权重模型第一——超过此前的开源最强 Kimi K344 分与智谱 GLM-5.345 分。和闭源顶配对比46 分仍落后 Claude Fable 5.1 / GPT-6 Astra53 分但差距从 「前代开源顶配的 20 分级别」压缩到了「7 分级别」。官方将其定位为 RSI递归自我改进路径上的量产验证用公开可复现的 RL 做自我改进而非靠神秘算力堆出一个不可复现的模型。关键项MiMo-V2.6-ProMiMo-V2.6-FlashAA 智能指数46开源第一Slim前代V2.5-Pro26—DeepSWE v1.158.4 →72.5748.8 → 65.68训练任务平均通过率相对提升约 12%相对提升约 25%RL 成本$2.62M$0.85MRL 时长5 天 7 小时3 天 11 小时训练步数30 步30 步二、账单$3.47M 双模型、6 天、75 万条轨迹——RL 第一次被「定价」到分MiMo 团队从 9 月 16 日起公开了 RL 训练直播页把步数、奖励曲线、GPU 故障与累计成本实时展示——这不是营销彩排而是把训练的每一个「账目单位」都摆上了台面成本结构Pro $2.62M Flash $0.85M 总计约 $3.47M其中 Pro 训练到 9 月 20 日30 步停止Flash 到 9 月 19 日30 步停止总耗时不到 6 天数据规模双模型合计产生约75 万条训练轨迹通过分布式 RL 并行裁决器在任务期在线采样收益归因训练任务平均通过率 Flash 相对提升约 25%、Pro 约 12%样本外的 DeepSWE v1.1 长程软件工程评测Pro 从 58.4 提到 72.57、Flash 从 48.8 提到 65.68——即「训练的收益在没见过的新任务上也能泛化」。价值锚点当『一个 46 分开源模型的 RL 只要 347 万美元、6 天、75 万条轨迹』成为公开事实『大模型 天价算力赌局』的行业定价逻辑就被数字化击穿了——因为同样的成本闭源厂商不会公开而开源玩家正拿着这份账单抢企业客户。三、能力外延3D 空间推理、机械臂闭环、形式化证明、材料筛选MiMo-V2.6 的「全模态」不是图文混排那么简单官方重点演示了四个超出对话框的落地场景3D 空间推理与构建自然语言直接生成 3D 世界、在 Blender 里做 3D 建模——把「多模态」从平面像素推进到三维几何计算机操作具备类似桌面/软件操作的全栈 agentic 能力可执行复杂多步的界面与命令操作具身控制多视角相机 视觉反馈闭环控制Franka Panda 机械臂完成抓取——这是「原生全模态」最物理化的证明科研验证用 Lean 4 形式化了动力系统经典定理 Li-Yorke《周期三蕴含混沌》6000 余行 Lean 源码通过内核核验另在 PFAS 吸附 MOF 材料筛选中给出可验证的方案设计。这几项合起来意味着开源模型的能力边界正在从『语言/代码』扩到『三维建模 机器人控制 形式化证明 材料科学』——都是 Agent 能真正「干活」而非「聊天」的场景且每一项都给了可复现的评估口径。四、开源生态权重只是附件全栈交付才是重点MiMo-V2.6 的「开源」不是丢一个权重文件开源项内容模型权重Pro Flash全面开源技术报告训练配方、评估口径、消融细节蒸馏模型Distill-Qwen-9B 及配套小模型RL 任务环境7k 条任务环境RL 训练框架verl / uni-agent / mini-swe-agent 端到端链路桌面端MiMo DesktopWindows/MacUltraSpeed 最高 20 倍推理加速配合 API 定价Flash 输入 1 元 / 输出 2 元Pro 输入 3 元 / 输出 6 元每百万 Token缓存享 99% 折扣形成「开源权重 平价 API 自训框架 桌面端」四层交付——这正是云厂商最不想看到的组合。五、给创业者的判断清单选型视角AA 46 DeepSWE 72.57 的开源权重进入第一梯队「默认底座」选项里开源模型第一次可以替 Claude/GPT 走进生产环境——做 API 转售/Agent 产品的团队该把 MiMo-V2.6 加进路由的备选池实测了。算账视角RL 成本公开$3.47M / 6 天 / 75 万条轨迹做细分领域自训医疗、法律、工业的团队可以按这份行业公数重做预算——之前闭源厂商的「保密报价」不再是你唯一的行情参照。复现视角权重数据框架全给「能否在企业内网私有化 全栈复现」第一次在开源侧成立——政府、金融、军工类客户的采购门槛开源模型的通过率会系统性提升。工程视角1M 上下文 多模态 3D 计算机操作一体的原生全模态才是『通用 Agent 底座』的完整形态——别再按「文本双塔 / 多模态拼接」的旧架构做产品。启示MiMo-V2.6 最大的新闻不是 46 分而是把『RL 训练』从玄学变成了可定价的水电账。对创业者① 开源顶配模型的 AA 分已逼近闭源46 vs 53『成本 ÷ 可复现性』正在成为比『基准分』更硬的采购决策变量② 它连 7k RL 任务环境和训练框架一起开源『在开源底座上做垂域 RL 微调』的技术栈第一次是工厂级交付——这是做企业智能体的团队躺赢的窗口③ 注意 MiniMi 的 3D/机械臂/证明/材料四连全模态 agent 的下一个战场是『能操作物理世界』现在从模型层就开始押这个方向的公司会先填上跟应用层的真空。来源小米官方 mimo.mi.com2026-09-22/ IT之家2026-09-22/ 凤凰网科技2026-09-22/ 快科技2026-09-22/ 新浪科技2026-09-22。本文为 AI 辅助整理的前沿解读事实以官方与权威媒体口径为准不构成任何投资建议。 延伸阅读 · 我的付费专栏觉得这篇文章对你有帮助我把同类主题的系统化内容沉淀成了付费专栏欢迎订阅支持持续输出专栏定价内容大模型工程师修炼手记19.9 元AI 编程 / Agent 深度实战AI时代程序员的自我提升49.9 元AI 时代成长方法论觉得有用请一键三连点个收藏方便随时查转发给需要的同事朋友有问题评论区见—— 收藏的人越多越能帮到更多同路人你的每个赞都在为原创内容投票。本文配套代码 / 资料包欢迎在评论区留言「求代码」我会私信发送完整资源