ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

一次“偏科”的微调实验:Xiaothink-T17-RWKV5-MLA-Instruct-Pro 为何中文更强、前端变弱?

一次“偏科”的微调实验:Xiaothink-T17-RWKV5-MLA-Instruct-Pro 为何中文更强、前端变弱?

一、一次刻意为之的“偏科”

上一篇文章《0.6B 硬刚 8B/20B》用数据证明了一件事:Xiaothink-T17-RWKV5-MLA-Instruct-Pro(≈0.6B)在中文自然语言任务上表现亮眼。但成绩单里也躺着一个刺眼的数字——前端页面生成 25.0,全场最低

这不是意外,而是一次刻意取舍的结果。本模型基于 t17_rwkv5_mla_instruct_frontend 继续微调,训练重心从“写前端”转向“写中文”,于是中文更强、前端变弱。这篇文章聊聊这个选择背后的架构逻辑与数据证据。

二、先复习:RWKV-v5 + MLA 是什么?

T17 系列的核心是自研的RWKV-v5 + MLA(DeepSeek V3 风格低秩压缩注意力)纯历史检索架构

  • RWKV-v5 时间混合:负责当前 token 的上下文建模,线性复杂度、可流式推理;
  • MLA 历史检索:把历史状态压缩成低秩 key/value 缓存,当前 token 通过注意力检索过往“快照”,实现长程记忆,而无需完整序列注意力;
  • 门控融合:把 RWKV 的当前输出与 MLA 检索到的历史信息按可学习权重融合,再喂给 FFN。

关键超参(instruct_pro):

参数
d_model1400
层数16
history_top_k6
save_every16(历史快照保存间隔,比基础版更密)
max_seq_len51200
max_cut2400

这套架构在“0.6B 锁住超长记忆”这件事上的优势,之前的多篇文章已经拆过,这里不展开。

三、从 frontend 到 instruct_pro:一次方向调整

模型脉络是这样的:

  • t17_rwkv5_mla_frontend:面向 WanlyFrontend(WF)声明式语言专项训练,擅长把一句需求编译成网页,前端生成能力强;
  • t17_rwkv5_mla_instruct:在 frontend 基础上补上通用中文指令能力(对话、创作、情感等);
  • t17_rwkv5_mla_instruct_pro:本模型,继续强化中文自然语言理解与指令遵循,覆盖古诗、知识问答、长文本等 6 领域。

也就是说,instruct_pro 是 frontend 版的“改行”之作——把原本花在前端语法上的容量,挪给了中文自然语言。改行有收益,也有代价。

四、数据怎么说?收益与代价

来自 DeepSeek-V4-Flash 对照盲测(6 领域 × 3 题,温度梯度 [0.68, 0.92] 采样,取最高分):

领域Instruct-Pro(0.6B)对比:Qwen3-0.6B对比:llama-3-8B
指令遵循90.778.289.7
通用知识85.069.583.6
古诗生成74.036.457.4
古诗赏析67.072.671.6
长文本处理50.085.076.5
前端页面生成25.034.950.1
总体平均65.362.871.5

收益侧:指令遵循 90.7 全场第一(含 8B/20B/云端);通用知识越过 llama-3-8B;古诗生成在同尺寸里断档领先;总体 65.3 反超 Qwen3-0.6B 的 62.8。

代价侧:前端页面生成 25.0,比 frontend 版明显下降,也不及 Qwen3-0.6B 的 34.9。长文本处理 50.0 同样偏弱。

一句话总结数据:把容量花在哪,成绩就长在哪。

五、怎么选型?

你要做的事选哪个模型
中文对话、创作、古诗、知识问答、指令任务t17_rwkv5_mla_instruct_pro(本模型)
前端页面生成(WF → HTML)t17_rwkv5_mla_frontend
纯架构研究、超长记忆基准t17_rwkv5_mla(基础版)

模型下载(ModelScope):Xiaothink-T17-RWKV5-MLA-0.6B-Instruct-Pro(本模型)、Xiaothink-T17-RWKV5-MLA-0.6B-Frontend(前端版)

配合 xiaothink ≥ 1.5.0 的深度思考(think=True 强制<think>),本模型在古诗创作、知识问答这类需要“先想再答”的任务上还有额外增益。

六、总结

  1. Instruct-Pro 是一次刻意偏科:把容量从 WF 前端语法转向中文自然语言;
  2. 盲测数据验证了取舍——指令遵循 90.7 全场第一、总体反超同尺寸 Qwen3-0.6B,代价是前端 25.0 明显下滑;
  3. 选型大于调参:做前端用 frontend 版,做中文用 instruct_pro 版,各司其职。

数据全部来自真实盲测,欢迎交流讨论!

返回列表