ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

0.6B 硬刚 8B/20B!Xiaothink-T17-RWKV5-MLA-Instruct-Pro 六领域盲测实录:指令遵循 90.7 全场第一

0.6B 硬刚 8B/20B!Xiaothink-T17-RWKV5-MLA-Instruct-Pro 六领域盲测实录:指令遵循 90.7 全场第一 一、0.6B 凭什么和 8B、20B 同台“参数量差两个数量级直接不用比了”——这是很多人的第一反应。但小思框架Xiaothink最新发布的Xiaothink-T17-RWKV5-MLA-Instruct-Pro≈0.6B却在一次 6 领域盲测中和 8B 的 llama、20B 的 gpt-oss 甚至云端旗舰同台竞技还在指令遵循这个硬指标上拿了全场第一。这篇文章把盲测实录完整摆出来用数据说话。模型在线Demo体验首次进入若跳转到主页请重进链接二、盲测是怎么做的裁判DeepSeek-V4-Flash开启深度思考负责对照评分评测领域6 个 1B 定制中文领域——古诗生成、古诗赏析、前端页面生成、通用知识、指令遵循、长文本处理题目数量每个领域 3 题共 18 题评分维度准确性 30% 关联性 30% 创造性 40%页面生成任务改用“样式艺术感 40% 内容与功能丰富度 40%”评分方式把本模型与所有静态模型对同一问题的回答匿名编号一次性交给裁判对照打分降低偏见本模型采样温度梯度 [0.68, 0.92] 共 2 个梯度点 × 3 次重复 每题 6 次对照评分取最高分静态模型取平均分对照模型Qwen3-0.6B、llama-3-8B-instruct、gpt-oss-20B、DeepSeek-V4-Flash三、分领域成绩单领域T17-Instruct-Pro0.6BQwen3-0.6Bllama-3-8Bgpt-oss-20BDeepSeek-V4-Flash古诗生成74.036.457.443.492.4古诗赏析67.072.671.671.891.7前端页面生成25.034.950.167.693.7通用知识85.069.583.690.687.7指令遵循90.778.289.780.677.5长文本处理50.085.076.593.089.6总体平均65.362.871.574.588.8四、亮点逐条看1. 指令遵循 90.7全场第一。这个领域考的是“会不会听指令”说输出一句话就一句话、说 30 字内就 30 字内。本模型 90.7 分超过了 llama-3-8B89.7、gpt-oss-20B80.6、Qwen3-0.6B78.2甚至超过云端 DeepSeek-V4-Flash77.5。指令微调带来的格式服从能力在 0.6B 上体现得相当扎实。2. 通用知识 85.0越过 8B。本模型 85.0比 llama-3-8B 的 83.6 还高逼近 20B 的 gpt-oss-20B90.6而 Qwen3-0.6B 只有 69.5。3. 古诗生成 74.00.6B 级断档领先。Qwen3-0.6B 只有 36.4差距明显本模型甚至超过 llama-3-8B57.4和 gpt-oss-20B43.4仅次于 DeepSeek92.4。中文韵律和意象的建模能力是它的强项。4. 总体 65.3反超同尺寸 Qwen3-0.6B62.8。在同参数量级内做到了更好的中文综合表现。五、也得实事求是一下前端页面生成 25.0 是全部模型里最低的——原因很明确这个模型是在 t17_rwkv5_mla_instruct_frontend 基础上继续微调的微调重心放在了中文自然语言上代价就是前端WF生成能力相比 frontend 版明显下降。需要前端页面生成请选用t17_rwkv5_mla_frontend需要自然语言对话、创作、指令任务本模型是更合适的选择。这也是一次清晰的“能力再分配”实验。六、总结T17-RWKV5-MLA-Instruct-Pro0.6B在 6 领域盲测中总体 65.3超过同尺寸 Qwen3-0.6B指令遵循 90.7 全场第一、通用知识 85.0 越过 8B、古诗生成 74.0 断档领先同尺寸前端生成 25.0 是微调取舍的代价选型时按任务场景二选一。数据来自真实的 DeepSeek-V4-Flash 对照盲测。欢迎交流讨论模型下载ModelScopeXiaothink-T17-RWKV5-MLA-0.6B-Instruct-Pro
返回列表