ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

1.6 万亿只激活 480 亿:美团 LongCat-2.5 的看点,是「适配 Claude Code」写进了官方日志

1.6 万亿只激活 480 亿:美团 LongCat-2.5 的看点,是「适配 Claude Code」写进了官方日志 一、发生了什么9 月 25 日美团旗下 LongCat API 开放平台上线新一代模型 LongCat-2.5-PreviewAPI 与网页端体验入口同步开放来源IT之家经凤凰网科技转述网易科技。官方更新日志列出的核心特性MoE 路线总参数量约 1.6 万亿每次推理激活约 480 亿原生 100 万 token 上下文官方点名的场景是超长文档、代码库、日志与多轮复杂任务新增图片理解跨模态问答、内容摘要、复杂视觉推理Coding 能力单列一项并明确写出「深度适配 Claude Code 等主流开发环境」点名 Claude Code、Hermes、OpenClaw、OpenCode、Kilo Code 五个工具。截至发稿暂无第三方基准跑分官方也未公布价格表。这两个空缺后面会再提。二、技术拆解参数是老故事工具层是新信号1. 两本账还是那两本账MoE 模型的总参数和激活参数要分开看激活参数大致决定单次推理的算力开销总参数决定能力上限和部署显存门槛。这套算法我上周写阶跃 Step 5 Preview 时拆过一次600B 只激活 27B、成本 1/8阶跃这步棋这次直接套公式模型总参数激活参数激活比上下文官方主打美团 LongCat-2.5-Preview~1.6 万亿~480 亿~3%100 万 token长程任务 多模态阶跃 Step 5 Preview600B27B4.5%100 万 token原生图文输入两家数字均为官方口径来源分别为 IT之家转述的官方更新日志与上证报等对 Step 5 发布的报道激活比为本表计算值。LongCat-2.5-Preview 缺第三方复现表中「缺点」栏先欠着无独立评测、无价格表、未公布权重开放计划——这三件事任何一件落地对比才有意义。激活比从 4.5% 压到 3%方向没变同样的能力分数把单 token 成本再往下压。这条效率线国内厂商已经卷了小一年单看参数意义在递减。2. 真正的新信号harness 进了官方更新日志过去两年模型厂商的兼容锚点是 OpenAI 的 chat completions 接口——兼容它的 URL 和报文格式就等于接入了所有现成客户端这是当年的事实标准。现在锚点在挪。这次官方把「深度适配 Claude Code 等主流开发环境」写成核心特性与多模态、Coding 并列点名五个工具。翻译一下Agent 工具层编辑器、CLI harness正在成为新的接口标准。模型厂商公开宣布适配某个 harness本质上是承认两件事开发者的日常工作入口在 harness 手里不在模型 API 手里谁控制 harness谁就决定默认模型、提示词模板和工具调用协议——模型只是这个插槽里可替换的组件。这和当年浏览器大战、后来 Kubernetes 的「一致性认证」是同一个剧本平台层定型之后下层组件的标准适配就成了入场券。区别只在于这次卷的是模型。3. 100 万上下文与成本的真账原生 100 万上下文对「长程任务」是硬件基础但它不是免费的上下文越长缓存命中与否对账单的影响越大。价格表没公布之前先把缓存这一行怎么读弄明白比猜价格有用GPT-6 Sol/Luna 与 Opus 5.5 同日降价价格表里最该看的是缓存那一行。三、我的判断**第一模型竞争的裁判权正在往工具层移而且没人喊停。**半年前「适配 OpenAI 接口格式」是厂商文档里的一行小字现在「适配 Claude Code」能进官方更新日志的核心特性列表。这个位置变化说明 harness 的网络效应已经强到模型厂商必须主动贴上去。对开发者是好事换模型会越来越像换电池。对模型厂商则是坏消息差异化被压缩到「插槽之外」的部分——价格、长任务稳定性、垂直能力。**第二选型重心该换了。**模型可替换性变强之后「哪个模型跑分高」的决策价值在下降「工具调用成功率、长任务不崩、缓存单价」这些工程指标的决策价值在上升。跑分是静态快照Agent 任务是几百步的长链路两者经常对不上——三元压缩那次的能力边界分析98.2% 是真的但先看它把 1.8% 藏在哪已经演示过套件内平均分很好看长程 agent 一项掉 25 分。**第三Preview 两个字要当真。**没有第三方跑分、没有价格表「内部任务表现不错」就无法独立验证头条「千机阁」的分析也指出外部基准暂时少见。另外 1.6 万亿总参对想自部署的团队意味着实打实的显存门槛API 用户倒是无感。等第三方复现和价格落地再决定要不要切流量不迟。四、对开发者的启示把模型当可替换组件接入任何 Agent 工具时顺手收敛一套固定的回归用例换模型先跑一遍再切。监控加一行除了回答质量把「工具调用成功率」单独立项——长链路任务里它比对话质量先崩。长上下文先算账再喂满100 万 token 的窗口是能力不是默认用法缓存策略决定它是福利还是账单。一个最小可用的换模型回归集20 行够用# golden_set.py — 换模型前的最小回归固定输入比对工具调用行为CASES[# (任务描述, 期望调用的工具, 期望产物特征)(读仓库根目录的 pyproject.toml 并总结依赖,read_file,包含依赖名列表),(把 utils.py 里的时间戳打印改成 ISO 格式,edit_file,diff 只动 1 处),(跑单测并报告失败用例,run_command,退出码 失败清单),]defrun(model_endpoint:str,casesCASES)-dict:results{}fortask,tool,_incases:# 伪代码向 model_endpoint 发任务记录实际工具调用序列calledcall_agent(model_endpoint,task)# 返回实际工具调用列表results[task]PASSiftoolincalledelseFAILreturnresults# 通过率低于基线模型 → 不切流量先查是提示词适配问题还是能力问题结尾多说三句。如果想看「大总参 低激活」这步棋的另一面上一篇阶跃 Step 5 的两本账是同一主题的另一半模型选型该看哪些工程指标98.2% 藏起来的那 1.8% 里有一份现成的踩坑清单而 Anthropic 用仪表盘量自家 Agent 参与研发的那篇26%、3 万 Agent、四万七分之一恰好是「工具层接管研发流程」的另一个视角。这个专栏每天一篇 AI 解读关注不迷路。你们的团队现在换一次模型的成本是多少——改一行配置还是重写一遍提示词评论区一句话说说。专注 AI 工程化实践与出海外贸技术
返回列表