ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

humanizer如何让改写不失真?SFT+DPO+GRPO训练流水线完整拆解(全程不用AI检测器)

humanizer如何让改写不失真?SFT+DPO+GRPO训练流水线完整拆解(全程不用AI检测器) humanizer如何让改写不失真SFTDPOGRPO训练流水线完整拆解全程不用AI检测器【免费下载链接】humanizer项目地址: https://ai.gitcode.com/hf_mirrors/jialinyyzz/humanizerhumanizer 是一个 12B 参数的本地 AI 文本改写模型输入一篇 AI 生成的草稿邮件、报告、帖子中英文皆可输出像人写的改写版本同时被训练成保留每一个数字、单位、日期、人名和引语绝不新增内容。本文完整拆解 humanizer 的训练流水线——SFT 监督微调、DPO 偏好对齐、GRPO 强化学习三个阶段如何层层把关让改写不失真以及为什么全程没有使用任何 AI 检测器。为什么 AI 改写容易失真先明确要守住的底线改写模型最常见的问题不是不够像人而是悄悄改错事实数字被改37 条投诉 → 37% 的投诉日期漂移本月20日前后 → 20号以前凭空新增多出一个原文根本不存在的百分比 humanizer 的设计目标因此非常克制事实必须原样存活只改变写起来的口感。整条训练流水线就是围绕这条底线搭建的。humanizer 训练流水线全景SFT → DPO → GRPO 三阶段humanizer 基于 gemma-4-12B 微调训练分三步走每一步解决一个具体问题阶段数据 / 步数解决的问题1️⃣ SFT 监督微调28,598 对样本学会AI 草稿 → 人话的基本改法2️⃣ DPO 偏好对齐3,918 个偏好对在保真与照抄之间做出正确取舍3️⃣ GRPO 强化学习3 轮共 500 步用严格评审持续压低事实风险完整训练记录见 README.md 的 Training 章节。阶段一SFT 监督微调——28,598 对AI 草稿 → 真人原文打底人的一侧全部是真实人类写作论文摘要、政府报告、学生作文、公司与邮件列表邮件、Reddit、Hacker News、知乎……AI 的一侧是前沿大模型从人话倒推写出的草稿模型由此学会把 AI 腔调套话、含糊其辞、铺垫句换成具体、节奏不均匀、更像人的写法同时事实不动这一步是打底让模型先具备像人一样改写的基础能力。阶段二DPO 偏好对齐——3,918 个偏好对只考两门✅ 偏好对的选择标准只有两条由 LLM 评审GLM-5.3打分事实保真度数字、日期、引语是否原样存活是否照抄改写是否过度复制原文关键细节偏好选择不看像不像人。这一步就把保真优先写进了模型的取舍里——宁可平淡不可改错。阶段三GRPO 强化学习——三轮 500 步精修奖励函数是核心GRPO 分三轮共 500 步每步 16 篇草稿 × 8 个采样温度 1.0第 1 轮 200 步严格的事实评审单票制第 2、3 轮各 150 步本次发布的 v2 就是最后一轮的最终检查点第 3 轮改用 8,268 篇文体均衡的草稿池奖励函数由两部分组成奖励来源设计LLM 评审通读整篇改写并逐句对照草稿严重错误、凭空捏造、改变原意、丢失格式都要扣分抄袭惩罚对 5-gram 与句法骨架复用率计罚低于 0.22 不罚超过后线性递增三轮强化学习累计生成41,600 篇改写每篇都对照草稿逐条评分——这是不失真最直接的来源。全程不用 AI 检测器为什么不检测反而更稳多数去 AI 味工具直接把检测器分数当奖励来优化。humanizer 的选择恰恰相反训练全程没有 AI 检测器——不当奖励、不当过滤器也不用它挑选检查点。原因很实际检测器算法会持续变化对着它优化等于追着移动的靶子打用 LLM 评审盯事实与抄袭率目标明确、可复现检测结果用外部检测器事后验收即可 事后验收Originality.ai2026-10-02210 篇英文改写最严格档位95% 被判为人类写作而上一代只有 88%被标记的比例不到一半。另有一组 60 篇高难度草稿的公开对照某个流行的humanizer 技能包60 篇全部被标记humanizer 只有 4 篇。需要强调检测器结果随时间变化这只是某一次测量不构成任何保证。改写完的事实保真度有多高逐项实测数据用严格 LLM 评审逐篇对照草稿420 篇英文改写Q8_0 量化文件实测指标本次 v2上一代 v1无事实问题376 / 420369 / 420丢失格式元素越低越好28 / 42035 / 420与草稿复用率中位数越低越好0.1650.19复用率 0.5 的输出越低越好0.2%1.0%评审找到的问题10 个里 9 个以上是单个词或短语级别的例如 37 complaints 变成 37% of complaints。中文仍在追赶204 篇中文改写中 149 篇无事实问题。所以项目方的建议很实在发出前读一遍重点核对数字、日期和人名完整核对清单见 USAGE.md 的质量核对章节。改写前后长什么样这是留出评估集中的一篇英文工作邮件Q8_0 文件生成 8 个采样人工选出读感最好且通过事实评审的那篇未做任何编辑更多示例论坛回答、知乎回答可在 README.md 的 Before and after 章节查看。模型文件与延伸阅读训练细节以仓库文档为准想动手体验仓库里已备好可直接本地运行的文件文件用途humanizer-12b-Q8_0.gguf32GB 内存推荐约 12.7 GBhumanizer-12b-Q6_K.gguf16GB 内存约 10 GBhumanizer-12b-Q4_K_M.gguf体积最小的 12B 文件约 7.6 GBmodel.safetensorsbf16 原始权重供 transformers / vLLM / MLX 使用prompt_format.json提示词指令与分隔符原文逐字节复现的关键config.json / generation_config.json模型结构与生成参数获取完整仓库git clone https://gitcode.com/hf_mirrors/jialinyyzz/humanizer各运行环境llama.cpp、MLX、transformers、vLLM、Ollama、LM Studio的完整配置与排错表见 USAGE.md给 AI 助手的安装手册见 AGENTS.md。【免费下载链接】humanizer项目地址: https://ai.gitcode.com/hf_mirrors/jialinyyzz/humanizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表