ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI 味去除技能研究公开 6 次测量失误:lieflat-less-ai-tone 如何修正错误结论,给量化写作研究的重要一课

AI 味去除技能研究公开 6 次测量失误:lieflat-less-ai-tone 如何修正错误结论,给量化写作研究的重要一课 AI 味去除技能研究公开 6 次测量失误lieflat-less-ai-tone 如何修正错误结论给量化写作研究的重要一课【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tonelieflat-less-ai-tone 是一个基于 283 万字语料统计的去 AI 味 skill它用 629 篇中文文本的对照实验量化什么是 AI 味并把 6 次公开承认的测量失误记录写进了最终规则。这篇文章带你拆解这项研究是怎么发现、承认并修正错误结论的——这对任何做量化写作分析的人都是一课。为什么量化 AI 味这么难流行在公共讨论里的 AI 味清单——破折号过密不是 A 而是 B 反复出现句长过于均匀——大多来自个案印象从未被系统检验过哪些有统计区分力哪些只是观察者偏差哪些方向甚至是反的这项研究给出了对照方案生成侧 5 个主流模型各 60 篇、共 300 篇人类侧 329 篇公开文本合计 2,826,972 汉字逐项检验 26 项候选特征计算生成侧与人类侧的频率比R。结果很有冲击力11 项通过检验区分力最强的是段首零回指评论4.4 倍而 15 项毫无区分力其中三项与流行认知方向相反——流行认知实测结果AI 爱用比喻包装概念人类比喻频率是生成文本的2.4 倍AI 靠设问撑结构正文设问句人类侧是 AI 的17 倍AI 句长极度均匀修正切分缺陷后比值为0.87无差异完整的特征对照与判定阈值见 RESEARCH.md。六次测量失误一张全公开的错误清单研究最有价值的部分是它主动公开了 6 次因算子设计缺陷导致的测量失误README.md 第 5 节、RESEARCH.md 文末记录。六次的结构完全相同正则算子的覆盖范围宽于规则定义且在检视命中实例之前就采信了频率结果。#初测结果缺陷修正后1过长前置定语 3.04/千字算子把普通句式算成长定语0.352并列连词 0.26规则定义为单句内两次以上算子只测单次0.003「的…的…的」嵌套 0.25跨顿号匹配把正常并列计为嵌套0.064提示性冒号无差异6431 条命中里 2700 条来自标题/列表等豁免对象R 3.85问句小标题 32 倍分母用字数未计 AI 小标题数量是人类的 5–10 倍无差异6比喻包装 0.000算子为 11 个词的固定表实际比喻一个都不在表里R 0.42人类更高后果不轻六项中有四项若未修正将直接进入改写规则集其中两项方向相反——按错误结论改写会让文章更不像人写的。错误结论如何被修正三个典型 句长均匀度从51 倍到无差异。早期切句只按。断句Markdown 表格和无句号的长列表被当成一整句某组句长标准差被算成均值的 27 倍于是得出AI 句长比人类均匀 51 倍。修正切分程序、剔除非正文行后重测比值为 0.87——差异根本不存在。 问句小标题分母陷阱。以每千汉字为分母比值高达 32 倍改以占小标题总数比例为分母后生成侧 2.7%、人类侧最高组 3.6%差异消失。前一分母实际测的是AI 小标题更多后者才是AI 爱用问句当小标题——分母选错结论方向直接反转。 比喻包装方向相反。原预设是生成文本倾向以比喻包装抽象概念但算子写死了一张 11 个词项的表实际比喻一个词都不在表内频率自然测出 0.000。改测构式后才发现人类用比喻多 2.4 倍。这也正是改写规则中比喻本身不作为 AI 痕迹这一硬约束的由来。一条操作规程先看样本再看数字六次失误换来一条写进方法链的操作规程RESEARCH.md任何算子在采信其频率结果前须先抽样检视 20 条命中实例涉及结构元素小标题、段落、列表的指标分母必须是同类元素总数。全部测量脚本随仓库公开算子定义位于脚本首部可直接复核与修改句层人机对比scripts/compare-human-ai.py段落层结构相邻句同构、段首零回指scripts/check-structure.py译文句式频率scripts/check-translationese.py替换为自有语料即可复算全部指标。给量化写作研究的四个启示频率数字本身不提示算子缺陷。错误的数字看起来干净表格看不出问题必须看命中内容。分母选择是方向性问题。分母与被测单位不匹配时得到的不是误差而是完全相反的结论。公开失误比结果本身更可信。研究明确承认语料不可核验是实质缺陷非免责说明RESEARCH.md可复用的是切分规程、分母选择、判定阈值与算子定义。单模型样本不代表生成文本共性。破折号在不同模型间极差达 40 倍DeepSeek 5.16/千字 vs GPT 0.11早期基于 2 个模型 30 篇的结论后来被推翻大半。最终通过检验的 11 项特征被转写为白名单式改写规则写入 SKILL.md每处改动只限于解决命中问题所需的最小范围未命中规则的文字逐字保留且明令不许补虚词、不许删设问、不许动比喻——这些不许正是被 6 次失误校准出来的边界。无论你是做文本风格测量还是只想给自己的文章清理生成痕迹这份六次翻车、一条规程的完整记录都值得反复读一遍概览见 README.md。【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表