ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

2B开源决策模型:113毫秒拍板,笔记本能跑

2B开源决策模型:113毫秒拍板,笔记本能跑 113 毫秒一个模型给出判断期间没有生成一个字。10 月 1 日亚马逊 Strands Agents 团队开源了 Strands Decider 2B。权重放在 Hugging Face代码、训练脚本和示例在 GitHubApache 2.0 协议能在自己的 CPU 或 GPU 上直接跑。它值得看一眼是因为它想省掉的不是算力而是写字这个动作本身。它不写字只在给定选项里挑一个一句话说清普通大模型是把答案写出来决策模型是把几个候选答案摆到它面前让它挑一个再附上置信度。它回答的是这类问题——急不急、继续还是停下、放行还是拦下都不需要一句漂亮话只需要一个判断。官方结构给得很直白底座是 Qwen3.5-2B原来的文本生成头换成一个约 100 万参数的指针头躯干用 rank-16 LoRA 微调选项喂进去一次前向出分数。这次开源的是 v20。113 毫秒是官方给出的中位决策延迟公开测试里RTX 3090 上跑 230 次请求的中位延迟是 106 毫秒、95 分位 296 毫秒含 HTTP 往返M3 笔记本上做小任务约 150 毫秒。拆开看把嘴换成打分器大模型当下做决定路径是先把判断写进一段话再从这段话里解析出结论。中间那段文字既花 token也花时间。决策模型把这一段删掉了不是先写再判断而是直接判断。代价也很清楚。它不会解释理由没有句子就没有能读的推理过程置信度成了唯一的体检指标。校准度好不好决定你敢不敢把它放进流程。放到场景里agent 的高频决定都很小一个 agent 跑任务大部分时间在反复问几个很小的问题要不要调这个工具、拿到的结果够不够好、要不要升级给更强的模型、要不要停下来问人。这些步骤不需要文采需要的是稳定、便宜、可预测。把这类判断搬到自己机器上跑省下的不只是 token 账单还有每次往返云端的等待。它的意义不在榜单第几而在判断这一步可以回到本地。常见误区纠偏误区一又一个 2B 小模型开源大模型要被替掉了。这个说法有它的道理。同样一个判断让大模型先写一段话再解析确实是浪费。但它解释不了复杂推理决策模型不会拆解问题也写不出一段解释遇到难的部分只能把活交回去。亚马逊给的方向是混合结构决策模型挑选项大模型负责推导。更准确的理解是它替代的是流程里的判断步骤不是模型本身。误区二开源加百毫秒延迟说明可以直接上生产了。有道理的地方在工程侧Apache 2.0、权重、训练脚本、示例全给了拿过来就能试这在这类模型里并不常见。但它解释不了准确率。公开榜单上这个模型的上一版大约72%准确率、Brier 分数 0.35而同尺寸的另一个开源决策模型约 76%、0.32。各家排名口径也不一样有按同尺寸公开模型算的第二也有只算不超过 2B 的第三。更准确的理解速度只是入场券校准度才是能不能用的门槛。挑这类模型别只盯毫秒先看它在你的选项集上会不会很自信地挑错。对开发者、普通读者和行业各改变了什么对做 agent 的开发者多了一个本地部署的路由部件一次判断压到百毫秒级不必每次都调云端大模型。对普通读者AI 变便宜的路径可能不是模型更强而是大部分步骤不再写字。对行业两个星期就凑齐了这条赛道先是 Jev 把概念带热接着 OpenAI 限量放出按选项决策的接口然后 Cloudflare 上线按百万 token 计费的两个版本现在是 AWS 直接开源连训练配方一起给出。项目作者说这个细分市场小做一个有竞争力的模型只要几百到几千美元。AI 的账单里最贵的往往不是思考而是把思考写成句子。如果觉得有用点个在看让我知道也欢迎转发给在学 AI 的朋友。关注我,每天陪你聪明看世界 —— 看懂热搜,玩懂AI。
返回列表