ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

开源大模型每日追踪:小米 MiMo-V2.6-Pro,登顶开放权重第一(超过 GLM-5.3 、Kimi K3)

开源大模型每日追踪:小米 MiMo-V2.6-Pro,登顶开放权重第一(超过 GLM-5.3 、Kimi K3) 一、模型速览项目信息发布方小米大模型团队Xiaomi MiMo Team发布时间2026-09-21 HuggingFace 上权重09-22 正式公告参数量1.02T 总参每 token 激活 42B384 路由专家 MoE无共享专家70 层上下文长度原生 1M tokens最大输出 128K许可证MIT可商用、可修改、可自托管需署名模态原生全模态文本 图像 视频 音频MiMo ViT 681M / AudioTokenizer 308M定位开源权重第一的通用 Agent / 软件工程基座主打全模态 大规模 RL 后训练一句话定位MiMo-V2.6-Pro 是小米用规模化强化学习 全模态把开放权重模型第一次顶到 AA 综合智能指数第一的 1.02T MoE——能力对标闭源旗舰、协议最宽松的 MIT适合有集群资源、要做长程 Agent / 代码智能体的团队不适合个人本地跑。二、核心亮点AA 开放权重指数第一46 分登顶。Artificial Analysis Intelligence Index v4.3.2 上 Pro 拿 46超过 GLM-5.345、Kimi K344、Grok 4.644、Gemini 3.8 Flash41、DeepSeek V4.1 Flash39是当时 113 个同类模型里的开放权重第一来源Artificial Analysis / Fello AI / NewsBytes第三方指数。它赢的是能下载回家自己折腾这一栏不是总榜。70 层 SWA/GA 混合注意力把 1M 上下文的 KV 成本压下来。70 层里 60 层用 128-token 滑窗注意力SWA、仅 10 层全局注意力承载长程依赖——这意味着长上下文服务的 KV Cache 远比全全局的万亿模型友好来源CSDN 架构拆解 / HuggingFace bucket 配置。代价是 1M 窗口是容量声明而非质量保证86% 的层只看几百 token 窗口超长距离检索需自己测。DFlash 投机解码长文本生成加速可观。仓库dflash/里藏着一个 5 层 SWA 的 MTP 草稿模型约 1.2GB每次前向并行预测 7 个后续 token、主模型一次性验证写代码 / 跑 Agent 这类长输出场景几乎是 SGLang 部署的必选项来源CSDN 架构拆解 / HuggingFace bucket 部署命令。大规模 RL 后训练代码 Agent 跳一截。官方称 Pro 经 30 步大 RL、约 75 万条轨迹、不到 6 天训完成本约 262 万美元DeepSWE v1.1 上 Pro 从 48.8 升到 65.7、Flash 从 58.4 升到 72.6来源小米官方 / 新浪微博公告。同步开源 7000 RL 任务环境verl / uni-agent / mini-swe-agent是社区可复用的训练资产。三、部署实战先把一件事说清楚小米只开源权重不提供托管端点推理基础设施要自备。Pro 是机房级——官方给的是多节点 SGLang 配方Flash309B/15BFP8 ~310GB更适合单机多卡起步。两套命令均来自官方模型卡 / 社区整理。3.1 环境准备与模型下载# Pro约 3 倍 Flash 体量下载量半 TB 级先确认磁盘/带宽 pip install -U huggingface_hub[cli] hf download XiaomiMiMo/MiMo-V2.6-Pro-RL --local-dir ./mimo-v26-pro # FlashFP8 172.9GB65 个分片单机多卡起步更现实 hf download XiaomiMiMo/MiMo-V2.6-Flash-RL --local-dir ./mimo-v26-flash # 推理框架均 Day-0 支持需带 --trust-remote-code pip install vllm # vLLM 当天版 pip install sglang # SGLang权重已含 FP8 量化配置config.json 里quant_method: fp8、MXFP4 存储可直接降显存门槛Pro 没有单独 FP8 仓库靠权重内量化 多卡切分。3.2 启动本地推理服务# 方案一vLLM单机 8 卡起步Pro vllm serve XiaomiMiMo/MiMo-V2.6-Pro-RL \ --tensor-parallel-size 8 \ --trust-remote-code \ --gpu-memory-utilization 0.95 \ --max-model-len auto \ --reasoning-parser mimo \ --tool-call-parser mimo \ --enable-auto-tool-choice \ --port 8000 # Flash 更轻vLLM 4 卡即可 vllm serve XiaomiMiMo/MiMo-V2.6-Flash-RL \ --tensor-parallel-size 4 --trust-remote-code \ --reasoning-parser mimo --tool-call-parser mimo --port 8000 # 方案二SGLangPro 官方配方2 节点、tp16/dp2/ep16专家并行 DP-Attention sglang serve --trust-remote-code \ --model-path XiaomiMiMo/MiMo-V2.6-Pro-RL \ --tp 16 --dp 2 --enable-dp-attention --ep 16 \ --nnodes 2 --node-rank 0 --dist-init-addr 10.0.0.1:20000 \ --speculative-algorithm EAGLE --enable-multi-layer-eagle \ --reasoning-parser mimo --tool-call-parser mimo \ --host 0.0.0.0 --port 300003.3 推理代码复制即跑多模态 工具调用# pip install openai from openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) # 1) 多模态把一张架构图丢进去跨图文理解MiMo ViT 原生视觉 resp client.chat.completions.create( modelXiaomiMiMo/MiMo-V2.6-Pro-RL, messages[{ role: user, content: [ {type: text, text: 这张图里的推理加速方案核心机制是什么用三点说明。}, {type: image_url, image_url: {url: https://example.com/arch.png}}, ], }], temperature1.0, top_p0.95, max_tokens2048, ) print(resp.choices[0].message.content) # 2) 工具调用Agent 场景需服务端开 --tool-call-parser mimo tools [{ type: function, function: { name: run_tests, description: 运行指定路径的单元测试并返回结果, parameters: { type: object, properties: {path: {type: string}}, required: [path], }, }, }] resp2 client.chat.completions.create( modelXiaomiMiMo/MiMo-V2.6-Pro-RL, messages[{role: user, content: 帮我改一下 auth.py 的 token 校验逻辑改完跑测试验证。}], toolstools, tool_choiceauto, temperature1.0, top_p0.95, ) if resp2.choices[0].message.tool_calls: for c in resp2.choices[0].message.tool_calls: print(调用:, c.function.name, c.function.arguments) else: print(resp2.choices[0].message.content)3.4 效果验证curl -sS -X POST http://127.0.0.1:8000/v1/chat/completions \ -H Content-Type: application/json \ -d {model:XiaomiMiMo/MiMo-V2.6-Pro-RL, messages:[{role:user,content:用一句话解释什么是稀疏 MoE 的专家路由。}], max_tokens:256} # 成功标志HTTP 200choices[0].message.content 为连贯回答⚠️避坑提醒Pro 个人显卡跑不动FP8 权重约 1TB至少 8 卡 H10080GB才装得下权重、几乎无余量想本地折腾用 FlashFP8 ~310GB4×80GB 或 2×141GB H200或直接走官方 API / OpenRouter。必须带两个 parservLLM/SGLang 都要--reasoning-parser mimo --tool-call-parser mimo否则 CoT 与工具调用格式解析不了Agent 框架接不上。长上下文是容量不是质量60/70 层只有 128-token 滑窗1M 窗口依赖 10 层全局注意力用自己的文档在 100K / 500K / 1M 各测一遍 needle-in-haystack 再依赖。工具调用重复是已知故障小米自述 Agent 会反复发相似工具调用无进展已在 Flash 上用 MOPD2 缓解Pro 长任务建议加去重 / 步数上限。基准几乎全是厂商自测AA 指数是唯一独立锚点测的是综合不是你的 workloadRL 归因声明暂无独立复现选型前拿自己任务复测。四、性能测评4.1 推理速度与显存表指标数值来源Pro 总参 / 激活1.02T / 42B官方模型卡Pro 权重体量~0.5 TB 下载FP8 内量化约 1TBcnblogs 社区估算Pro 显存BF16 / FP8~2.0 TB / ~1.0 TBiotdigitaltwinplm 估算不含 KVFlash 权重FP8172.9 GB65 分片官方 / cnblogsFlash 显存BF16 / FP8~620 GB / ~310 GBiotdigitaltwinplm 估算并行度要求Pro 8–16 路Flash 至少 4 路Winbuzzer / 官方命令官方推荐采样temperature1.0, top_p0.95官方模型卡说明本机未实测上表显存为参数×字节的估算不含 KV Cache / 激活 / 框架开销真实占用以你的硬件与上下文为准。4.2 生成质量分维度维度指标MiMo-V2.6-Pro来源综合智能AA Intelligence Index v4.3.246开放权重第一Artificial Analysis第三方软件工程DeepSWE v1.165.748.8→65.7小米官方自测代码竞技Code Arena WebDevAutoEval1628开放权重第 3AutoEval训练规模RL 步数 / 轨迹30 步 / ~75 万条小米官方4.3 同档模型对比表AA 开放权重指数模型总参/激活上下文许可AA 指数 v4.3.2定位MiMo-V2.6-Pro1.02T / 42B1MMIT46全模态 AgentGLM-5.3— / —1M开放45通用开源旗舰Kimi K3— / —1M开放44长上下文DeepSeek V4.1-Flash552B / 13B1MMIT39高效性价比注AA 指数为第三方综合智能指数Elo 加权非单基准GLM-5.3 / Kimi K3 / DeepSeek 数值来自各模型发布报道。MiMo 胜在开放权重栏闭源旗舰GPT-5.6、Claude Opus 5 等综合分仍在它之前。结论选型看 workload——要开放权重里最能打 全模态 MIT 最松MiMo-V2.6-Pro 目前是这一栏的标杆但它吃集群、长上下文质量需自测纯比单任务成本它反而贵单任务 $0.13 vs 同档。中小团队先用 Flash 或 API 验证价值再决定是否上 Pro 集群。五、使用建议适用场景有集群资源的团队做长程软件工程 AgentDeepSWE v1.1 65.7 原生工具调用配 OpenCode / Claude Code 类框架直接接管代码库。全模态产品原型文本/图/音视频一把抓1M 上下文能吃整本手册适合文档智能体与多模态助手。RL 研究7000 开源 RL 环境 端到端训练框架verl / uni-agent / mini-swe-agent是社区稀缺的可复现资产。对协议敏感的企业MIT 可商用、可改、可自托管比很多看着开源其实藏限制的友好。不适用场景个人 / 消费级显卡Pro 装不下Flash 也需多卡真要本地用 9B 蒸馏版MiMo-V2.6-Distill-Qwen-9B实为 Qwen3.5-9B 监督微调仅研究用、非生产。追求最低推理成本单任务 $0.13 高于同档 DeepSeek预算敏感选 DeepSeek V4.1-FlashMIT、KV Cache 省 4×。超长文档精确检索1M 是容量声明长程质量先自测。替代选型全模态轻量选书生-S2本地小模型选 MiniCPM5-2B / Spark-X2.5-4B。调优提示并行度按型号定Pro 走 SGLang tp16/dp2/ep16 两节点或 vLLM tp8Flash 用 vLLM tp4 最省心。必开 DFlash/EAGLE 投机解码长输出加速明显SGLang 部署几乎必选。采样用官方值temperature1.0 / top_p0.95别套用其他模型的 0.7/0.8。长上下文先缩后扩max-model-len 先设 128K 验证稳定性再往 1M 推避免 prefill 超时与质量滑坡。Agent 加护栏工具调用重复是已知问题长任务务必加步数上限与去重逻辑。数据来源说明本文性能与部署数据来自小米官方模型卡HuggingFaceXiaomiMiMo/MiMo-V2.6-Pro-RL、-Flash-RL、Artificial Analysis 智能指数 v4.3.2、CSDN 架构拆解、cnblogs 部署实测、iotdigitaltwinplm 显存估算、HuggingFace bucket 部署命令及新浪/微博官方公告均已在正文标注来源AA 指数为第三方综合锚点其余基准多为厂商发布值第三方独立复测有限请以独立复测为准。本文未做本机实测所有速度/显存为官方与社区估算口径实际部署请以你的硬件为准。
返回列表