ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

微调数据工程:一千条好样本是怎么炼出来的

微调数据工程:一千条好样本是怎么炼出来的 微调圈有句话被反复验证数据质量大于数量大于训练技巧大于模型大小。上一篇算了 LoRA 的成本账这篇说清那「一千条高质量样本」到底怎么来——这是微调成败的真正分水岭。坏数据的四种死法第一种格式不统一。同样是问答对有的带标点有的不带、有的 markdown 有的纯文本、长度从五十到五千随机分布。模型学到的是「混乱本身」。规范统一输出格式模板长度分布要有意识地覆盖目标场景。第二种答案过拟合。一千条数据的答案全是同一种句式开头微调后模型对任何问题都用这个句式——你以为它学会了其实它只是会背。答案的措辞、结构需要多样性。第三种标注不一致。同一类问题标注者 A 给的答案详细、B 给的简略互相矛盾。模型收到的是噪声信号。多人标注必须先对齐标注规范抽样互审。第四种分布偏斜。八百条是某一类问题两百条覆盖剩下所有场景。模型在头部类型上表现良好长尾一塌糊涂。按真实业务的查询分布配比数据宁缺毋滥。高效的生产路径第一步从真实日志里捞。生产环境的用户提问脱敏后是最好的种子它们自带真实分布。没有线上数据就找业务同事做角色扮演批量生成问题。第二步用强模型起草人工终审。让最强的大模型对每个问题生成答案草稿业务专家只做「对不对、全不全、语气对不对」的判断和修改。纯人工从零写一千条要几周起草加审核模式几天能出活质量更高。第三步构建多样性检查清单问题类型覆盖度、答案长度分布、句式多样性、术语一致性每项做抽样统计。质量验收拿出一百条不参与训练的验证集微调前后各跑一遍从准确性、格式遵循、语气一致性三个维度打分。提升不达标的先查数据再查参数——八成的锅在数据。微调不是炼丹是数据工程。把数据当产品来做模型只是这个产品的输出端。
返回列表