ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

嘿,AI,你就不能给我一个「署名致谢」吗?

嘿,AI,你就不能给我一个「署名致谢」吗? 未来几个月的某个时候Anthropic 要给我寄一张支票。大约 9000 美元给我差不多同样数目给我长期合作的作者珍妮·格林Jenny Greene出版商 O’Reilly 大约能拿到 18000 美元。原因是珍妮和我写的书连同大量其他作者的作品被盗版后混进了训练 Claude 的数据集如今一项法庭和解正在向那些作品被这样使用过的作者和出版商支付赔偿。算下来每本书大约能分到 3000 多美元由所有相关方平分而且每一个版本都单独计算无论这本书卖得怎样、内容是什么。前提是这笔钱真的会到账——这项和解在 2026 年 7 月获得了终审批准但这种规模的赔付要走很长的行政流程所以我们还得看这张支票到底会不会真的寄来。我并不特别在意这张支票。好吧这么说不完全真实九千美元不是小数目但希望你能明白我的意思。珍妮和我写这些书从来不是为了发财任何见过职业作者真实生活的人都不会把这份工作和致富之路联系在一起。但有一件事我非常在意我猜几乎所有作者都会同意那就是让自己做的工作被承认。如果你问 ChatGPT、Claude 或 Gemini尤其是谷歌的 AI 概览一个问题而它的部分答案正是从我的某本书里学来的我真心希望它能说出来。类似这部分内容参考了安德鲁·斯泰尔曼Andrew Stellman的著作如果你想深入了解可以去看看原书这样的话。换句话说我想要的其实就是一个致谢。这一切都属于一个更大的问题通常被称为**“署名归属”attribution**。往宽泛了说署名归属指的是知道一件作品或一份知识是从哪里来的并能把它追溯回创造它的人。这听起来可能像是个狭窄的技术问题但眼下它其实是 AI 领域最活跃的议题之一。最近在 Foo Camp 上这个话题一直被反复提及很可能是整个周末讨论最多的主题几乎每个人都对此有话要说。这也是一个纠结的话题一部分是技术问题一部分是法律问题而比这两者更深的是情感问题。我想花点时间把这几条线分开来看。为什么这么多人感到愤怒在谈任何技术或法律问题之前先说一个更简单的原因解释为什么署名归属眼下会成为一根导火索人们感到愤怒而说实话他们有充分的理由愤怒。艺术家们眼看着模型从被未经许可抓取的作品中学会了模仿自己的风格。作家们发现自己的书出现在了我们从未同意加入的训练集里即便这并不是 Anthropic 要赔钱给我们的原因。很多人单纯就是害怕自己赖以谋生的工作正要被一台从他们身上学了部分技能的机器取代。他们的作品被拿走了——这或许属于合理使用fair use但几乎从没有人事先征求过作者的同意甚至常常连发生了什么都无从查证。这对我们许多人来说感觉真的很不舒服。这种愤怒很多时候最终会导向关于版权的法律争论而版权本身就是一个常被误解、常被误用的概念。人们出于可以理解的原因转向版权它比其他一切都显得更实在而尽管很多人觉得版权本来就是为了保护作者、艺术家和创作者而设立的但实际上它要微妙得多尤其涉及合理使用的时候。但我不认为对于真正想要署名归属的人来说版权是正确的抓手。我甚至想说得更直接一点我认为创作者与 AI 实验室合作能得到的收益会远比在法庭上和它们打官司多得多。在这一切之下我们大多数人真正想要的其实很简单我们希望这份工作依然属于我们并且希望这一点是可见的。这正是一个署名归属问题。而在讨论 AI 能不能解决这个问题之前最好先弄清楚署名归属到底是什么——因为这个词比表面看起来要滑溜得多。署名归属究竟是什么从最简单的层面说“署名归属就是一件事物与它来源之间的联系。当你在一本书里读到一个事实时这句话背后有一条链条能一路追溯回作者本人再往前追溯回作者所依据的材料。正是这条链条构成了credit”信用/功劳的运作方式也构成了信任的运作方式还决定了当某个东西打动你时你知道接下来该去读什么。只要人类还在创造东西你几乎总能顺着链条找到某个具体的人。一旦你开始留意就会发现署名归属随处可见。参考文献和引用书目是署名归属维基百科页面上的每一条脚注也是每次一篇新闻援引另一篇新闻——比如你会读到据《商业内幕》Business Insider报道……然后再由另一个网站转载——同样是署名归属当然前提是我们记得这么做。对作者来说这一点更是深入骨髓署名归属几乎支撑着我们做的一切整个学术出版体系也建立在这个基础之上因为它的全部意义就是清楚地展示每一项新成果是建立在谁的工作之上的。AI 是第一种几乎把所有东西——它能触及的每一本书、每一篇文章、每一个代码库——都吸纳进去却把这条链条彻底抹去、只给出答案的技术。而尽管这在技术上或许属于合理使用的范畴但这不应该是讨论的终点。知识被吐出来了但通向创造者的那条线却消失了。这种抹除才是那些诉讼背后人们真正在反应的东西。模型从他们的作品中学习却不留一丝痕迹那条曾经能追溯回他们的路径就这样断掉了。而署名归属说到底就是把这条线重新接上的名字。问题在于人们其实用这一个词指代了至少三种颇为不同的东西。最廉价的一种也是人们最先想到的一种是相似性resemblance这个答案看起来像不像我的作品这种判断容易检验却基本没什么意义因为两个人完全可以就同一个 for 循环写出几乎相同的一句话谁也没抄谁。真正投入产品的是引用citation——聊天机器人答案下面那些小小的来源链接它标注的是系统在回答过程中实时抓取的网页而不是模型几年前训练时学过的那些书。这些链接来自检索retrieval不是记忆memory系统是在回答的中途实时跑出去抓取了一个网页。给这类实时检索结果加上署名几乎没有任何技术障碍而 AI 实验室对这种署名方式表示接受恰恰给了它们一个可以照搬的模板——如果基于模型本身的署名归属在技术上真的可行的话。我们其实已经有一个非常好的现实案例可以说明这种方式是怎么运作的。O’Reilly 自家的学习平台上有一个 AI 引擎它能根据平台上的书籍回答问题告诉你它参考了哪些书并向这些书的作者和出版商支付费用。它之所以能做到这一点是因为语料库规模小而且其中每一份内容都是获得授权的——这恰恰是前沿大模型完全不具备的条件。因为真正重要的第三种版本是因果性causal我的作品是否真的塑造了产生这个答案的那部分模型这才是这个词最诚实的含义也是迄今为止最难计算的一种。请注意这一切都跟钱没有关系。要付钱给我意味着要算清楚某个具体答案值多少钱以及这份价值中有多少属于我——这是一个谁都没能真正解决的、极其困难的分配问题而且说实话最终大概会算出任何一个具体答案里属于我的那一份大概只有几分之一美分那么小。而署名归属要问的是一个更小的问题这个内容到底是不是来自我的作品致谢仅仅是一种身份确认未必需要伴随付款——而即便只是这样一件小事也依然被所有人认定为不可能做到。在一个微型模型上做实验我固然是个作者但同时也是个开发者当有人告诉我们某件事不可能时我们的第一反应永远是想去把它造出来。很多时候不可能只是意味着还没人搞清楚该怎么做而有些时候则意味着一旦有人搞清楚了会让某些人感到不便。在这件事上一些真正聪明的人已经把其中一些重要部分搞清楚了弄明白这个问题为什么难以及他们是怎么着手解决的是很值得的。先说它为什么难。当一个模型在你的书上训练时它并不会把这本书归档在某个你之后可以指认的地方因为模型不是存放书籍或其他源材料的数据库。它学到的东西被分散到数以十亿计的数字里和它读过的其他一切东西纠缠在一起没有哪一个权重会说这一部分来自斯泰尔曼。任何地方都不存在一张收据记录着哪个来源贡献了什么。想要检验你的书到底有没有起作用最直接的办法是把它抽走重新训练一次模型看看结果有什么变化——但没有人会为了这个把一个前沿大模型从零重新训练上十亿次。结论是知识确实还在模型里只是被涂抹在了整个模型上没有任何索引能指回它的来源这正是很多人称署名归属为不可能的原因。但从别的角度看它或许并没有看起来那么不可能。研究者们一直在啃这个难题方法从廉价粗糙到昂贵精确不一而足。最精确的一端是留一法leave-one-out拿掉一个来源重新训练看答案的变化幅度。这大概是最接近地面真相ground truth的方法了但在实际规模下完全没有可行性原因前面已经说过。真正有意思的工作是在寻找不需要那么多重新训练、又能逼近这个结果的廉价替代方法。我觉得最值得关注的是TracIn由四位谷歌研究员在 2020 年的论文《通过追踪梯度下降来估计训练数据的影响》Estimating Training Data Influence by Tracing Gradient Descent中提出模型在训练过程中会保存自己的快照TracIn 通过比较这些快照上的梯度来衡量每一条训练样本把模型推向某个具体答案的程度有多大而不需要真正重新训练。它属于一个更大的方法家族。**影响函数Influence functions**是这个家族里更古老、更重的一支由高庞伟Pang Wei Koh和梁佩西Percy Liang在 2017 年的论文《通过影响函数理解黑箱预测》Understanding Black-Box Predictions via Influence Functions中提出Anthropic 在 2023 年的论文《用影响函数研究大语言模型的泛化能力》Studying Large Language Model Generalization with Influence Functions中把这套方法扩展到了拥有数百亿参数的模型上。麻省理工 Madry 实验室提出的一种更新的方法TRAK则针对这些方法共有的一个弱点——近似重复的来源会搞乱统计结果——做了改进。这些方法都还没有定论TracIn 尤其在前沿模型规模下存在争议但这个方向是真实存在的而推动它的人手里的预算比我大得多。所以我想亲眼看看它是否真的能跑起来。我请一个 AI 帮我搭建了一个尽可能小、却仍是真正的语言模型好让它能跑通这些方法——大约 20 分钟后我就有了一个可以用的模型我把它叫作tiny-provenance一个只有大约 37000 个参数的语言模型小到我可以在几秒钟内把它从零重新训练一遍。这个规模正是关键所在因为它让我可以真正跑通那种昂贵的留一法检验把它当作地面真相再把廉价的 TracIn 近似方法摆在旁边看两者是否一致。结果确实一致。我给它出了一道陷阱题分析机Analytical Engine是谁设计的“在训练数据里一句关于巴贝奇Babbage和差分机”Difference Engine的、看起来很像的句子就紧挨着正确答案摆放。那种廉价的相似性检验方法——恰恰是真实产品目前依赖的那种方法——上钩了自信满满地把功劳归给了那句错误的话。而留一法和 TracIn 都没有被这句障眼法骗到而是准确指向了模型实际使用的那个来源。人人都习惯依赖的那种偷懒方法自信却错了而那些更诚实的方法是对的。整个过程在一台笔记本电脑上大约只花了两分钟。我是在一个我可以随意重新训练模型的规模上证明了这一点而这恰恰是没有人能在前沿模型规模上做到的事所以我不会假装自己证明了这套方法在那个规模上依然成立。署名归属在两个极端情况下效果最好——模型几乎把某段文字背下来了或者严重依赖了某一个单一来源——而在中间那片模糊地带情况仍然很难办那里可能有难以想象数量的书籍每一本都只往模型里添加了极其微小的一点点东西。公平地说署名归属并不是不可能的它只是目前成本高昂而更重要的是就现有技术而言实际操作起来相当不现实。整个代码库都是公开的而既然这是一篇讲如何追溯来源的文章那么对这个演示本身的来源保持透明似乎才是应该做的事。README 里详细记录了我是怎么搭建它的连提示词prompt都写在里面了。法律上的障碍我把自己的立场摆在明处我认为版权不是我们应该用来打这场 AI 之战的正确工具。我大学毕业后的第一份工作在 EMI 唱片公司负责跟踪音乐合同的系统所以我很早就知道版权、商标、机械录制版税等等这些东西能有多纠缠不清。这里有一个我一直忍不住会想起来的类比。如果一个学生一字不差地从维基百科抄一段话那是抄袭。如果这个学生读了这段话理解了内容再用自己的话重新写出来通常就不算抄袭了——虽然这也要看具体重写了什么因为抄袭针对的是想法而不仅仅是文字。一个物理系学生在论文里写下Fma即便这个公式是直接从教科书上抄来的也不算抄袭。但另一方面如果不注明出处只是换了措辞地转述某人研究论文里的某个具体结论那仍然是抄袭——即便你在技术上确实改写了文字。而事情还能更复杂如果你一字不差地照抄一段文字但注明了出处那你没有抄袭但仍然可能有版权问题。我们经常挂在嘴边的合理使用fair use实际上是一个非常棘手的法律领域。但更重要的是把这些问题简化成一场法律辩论并不能真正触及问题的核心因为法律往往并不完美而是由数十年有时相互矛盾的判例堆叠而成所以合法与应该怎么做之间未必是一回事。模型所做的事情比改写又向前走了一步它把文本变成了一大堆代表着概念的数字此后再也找不到任何一段可以称之为原文的东西。到目前为止审理过这类案件的法院——包括审理 Anthropic 这起和解案的法院——都把这种使用称为极度具有转换性“exceedingly transformative”这是那位 Anthropic 案主审法官的原话双方律师都认为这是相当重的措辞。他们的意思是这种使用把原作品改变成了一种足够新、目的也足够不同的东西因此它不再仅仅是原作品的一份复制品。我认为法院基本上判对了。说到底我拿到 Anthropic 的这张支票并不是因为他们未经许可使用了我的作品而是因为他们确实使用了一本从盗版网站下载的、被盗的书而没有花钱向 O’Reilly 购买正版或者从其他合法渠道获取。但我也不能把版权这件事完全撇到一边不谈因为的确存在一个站在另一面的、我个人也能感同身受的理由。一个想学 C# 或者准备项目管理考试的人现在完全可以去问 AI得到一个部分来自我写的书的答案而根本不需要买那本书。模型从我的书以及许多写同类主题的其他作者的书里学习如今却在这些书本来面向的那个市场里用从它们那里拿走的东西跟这些书直接竞争。“AI 工具会与它训练所用的材料展开竞争”这种担忧并非纸上谈兵。Stack Overflow——一代程序员曾经求助的问答网站——自 ChatGPT 上线以来问题提交量下降了大约四分之三因为开发者转而去问 AI 了。而 AI 之所以能答得好部分原因正是它训练时用过 Stack Overflow 上的答案。而即便是这整件事也依然极其微妙因为 Stack Overflow 上的内容本身是由用户撰写、并以知识共享许可协议Creative Commons license向公众开放的。这恰恰触及了版权本来要保护的核心问题。法院在判断合理使用时会权衡的一个因素就是对原作品市场的影响而一个基于原作品训练出来、又是免费的替代品几乎是能想到的最直接的市场影响。已经有一位法官直接点出了这一点。在一群作者包括萨拉·西尔弗曼〔Sarah Silverman〕起诉 Meta 的案件中法院判 Meta 在合理使用问题上暂时获胜。但那位法官在判决中特意提示原告方之所以输或许是因为他们的论证方式本身出了问题而这种市场稀释理论——即廉价替代品泛滥——恰恰是一个在更有力的证据基础上完全可能获胜的论点。这位法官在判决中还说这项技术的使用毫无疑问是高度具有转换性的“no serious question” that the use was “highly transformative”律师们同样认为这是相当重的措辞。我不是律师这只是我作为一个非专业人士对这个案子的理解但我认为这是对方目前拥有的最有力的论点。再加上盗版这一层这个更大的问题距离尘埃落定还很远。这就又回到了致谢以及我希望看到的能同时解决这些复杂而微妙问题的方案。在一个平静的世界里“给予信用本该是一件简单的礼节。但我们并不生活在一个平静的世界里。版权法规定蓄意侵权最高可判处每件作品 15 万美元的法定赔偿很多律师看到这个数字看到的其实是一笔赏金”他们的整个诉讼策略就是围绕不断升级的诉讼、想方设法把尽可能多的作品都卷进来从而抬高赔偿金额其中他们能拿到相当可观的一部分。换句话说他们有极强的经济动机去证明某家做 AI 模型的实验室明明知道自己用的是谁的作品、明明知道这是侵权却依然照做不误。现在再来看看什么是致谢。一家 AI 实验室一旦在文字里写下这个答案参考了安德鲁·斯泰尔曼的书就等于书面承认了我们知道自己用了安德鲁·斯泰尔曼的书而一个精明的原告律师完全可以把这句话反过来当作头号证据。法官会不会把这看作蓄意侵权我不知道。但我不确定自己愿意拿 Anthropic 或 OpenAI 这样的公司的整个未来去赌。如果给出信用几乎不花实验室一分钱却背负着远远超过什么都不说的法律风险那么理性的选择——任何律师都会给出的建议——就是什么都不说什么都不承认。潜在诉讼的威胁足以让一家实验室觉得自己根本不能安全地开启自愿署名归属这个话题因为它出于善意提供的任何东西都可能被反过来当作弹药。这对所有人来说都是最糟的结局作者们也不例外——因为这项唯一有可能最终告诉你一个想法从哪里来的技术最后却在法律上更安全地选择了对此保持沉默。如果你在用这些工具搭建东西或者像我一样每天都在依赖它们这正是关键原因所在你得到的答案几乎永远不会告诉你它从哪里来即便追溯来源的技术在不断进步。开发这些工具的人明天就可以加上一行这里的内容来自谁。真正拦住他们的是一个让告诉你这件事变得太危险、以至于不敢去尝试的法律体系。我真正想要的是什么其实还有一个更小的致谢版本完全不会触及我前面提到的那些法律或技术难题。即便一个模型无法说清楚某个答案到底出自哪本书——即便它老老实实地承认根本无法追溯——它依然可以指给你这个主题上最权威的资料那些真正值得深入阅读的书。严格来说这算不上署名归属没有人证明那些书真的塑造了这个具体的答案。但一个在某个主题上训练过的模型几乎肯定接触过这个主题的经典权威著作所以这种关联性是相当强的。对读者来说这样做同样有用因为它告诉了你接下来该往哪里去——而这正是 AI 实验室今天就能做到的事。这就又把我带回到那张我可能会、也可能不会兑现的 Anthropic 支票上。我是真心的我更想要的是信用而不是钱。我的写作为我的职业生涯带来的东西比它给我的银行账户带来的东西对我更重要而如果能让两倍的人因此找到我的作品我愿意把这笔和解金减半。致谢恰恰能做到这一点这也是我真正想要的——如果它能为我的作品打开新的曝光度为像我这样的作者带来新的机会。我反复琢磨的一点是这个致谢比那些说它不可能的人愿意承认的要更有可能实现得多。我做出了一个玩具版本而 AI 实验室里的研究者们正在把这些想法推进得远比我能做到的更远。眼下真正拦在路上的很大一部分是一个法律问题善意能不能在 15 万美元一件作品的赔偿数字面前存活下来我不知道答案会是什么。但我相当确定这不是数学问题——而数学原本才是应该最难的那一部分。背景解读与延伸说明为了帮助理解文章涉及的几个关键点我做了一些交叉核实1. Anthropic 版权和解案的真实背景文章提到的和解确有其事是美国历史上最大规模的版权集体诉讼和解即Bartz v. Anthropic案。据多方报道核实Anthropic 同意支付15 亿美元涉及约50 万部作品平均每部作品约3000 美元作者方与出版方各分一半纽约时报报道该和解在 2026 年 7 月获得法院终审批准超过 91% 的作者和出版商已提交索赔路透社报道和解的核心并非AI 训练本身违法而是 Anthropic使用了盗版渠道获取的书籍而非合法购买或授权这与文中作者反复强调的一点完全一致他之所以能拿到赔偿是因为书是被盗的而不是因为被 AI 学习了本身构成侵权Authors Guild 的说明也印证了这一分配比例和逻辑。2. 署名归属的三层含义是全文的理论骨架作者把 attribution 拆成三层这个区分很关键也是理解全文技术部分的钥匙相似性resemblance答案看起来像原作但容易误判两个人可能独立写出相似的句子引用citation目前 AI 产品实际能做到的是检索时标注网页来源而非训练时学到的书籍来源——这是检索增强生成RAG的机制不涉及模型权重本身因果性causal某个训练样本是否真的塑造了模型给出某个具体答案的能力这是最难也是文章重点讨论的技术难题。3. 文中提到的几项技术方法均为真实存在的学术研究可供进一步查证TracInarXiv:2002.08484Garima Pruthi 等四位 Google 研究者 2020 年提出通过训练过程中保存的模型快照比较梯度估算单条训练样本对最终输出的影响无需重新训练。影响函数Influence FunctionsKoh Liang, 2017更早、计算量更大的经典方法源自统计学中删除一个样本后参数如何变化的经典理论被 Anthropic 在 2023 年的论文arXiv:2308.03296中扩展到数百亿参数级别的大模型上这篇论文本身就是 Anthropic 内部对模型能否解释自己从哪里学到东西这一问题的正式研究尝试。TRAKarXiv:2303.14186MIT Madry Lab 提出针对影响函数和 TracIn 在处理近似重复来源时的弱点做了改进。这三者共同说明从纯技术角度看“模型级别的溯源并非天方夜谭而是一个有真实学术共识支撑、但计算成本极高、且在超大规模模型上仍存在争议的研究方向。作者自己动手做的tiny-provenanceGitHub 仓库用一个仅 3.7 万参数的玩具模型复现了这套逻辑本质上是用留一法”真正重新训练、作为地面真相去验证TracIn 近似法是否可靠——这是一种很聪明的、用小规模实验去逼近大规模不可行问题的研究思路也是这篇文章最有研究方法论价值的部分。4. 法律部分涉及的两个真实判例Anthropic 案中法官将其训练行为称为exceedingly transformative极度具有转换性这是合理使用四要素测试中使用目的与性质这一要素判断的核心措辞。文中提到的Sarah Silverman 等作者诉 Meta 案Meta 确实在合理使用问题上暂时胜诉但主审法官在判决书中明确暗示“市场稀释”market dilution理论——即 AI 生成内容作为免费替代品冲击原作品市场——如果论证得当未来完全可能推翻类似判决这一点在Authors Alliance 的分析文章中有详细解读与原文引用的表述一致。5. 全文的核心论点其实是一个法律逼退善意的悖论文章最有价值的洞见不在于技术细节而在于最后指出的一个结构性矛盾技术上可行、成本也不算高的致谢hat tip恰恰会因为法律风险每件作品最高 15 万美元的法定赔偿而变得不可行——因为一旦 AI 公司主动标注这段内容参考了某作者的书就等于自证明知是谁的作品仍然使用这反而会被原告律师用作蓄意侵权的证据。作者认为正是这种说了比不说更危险的激励结构而非技术瓶颈才是目前 AI 行业不愿意做署名归属的真正原因。这个论点把技术、法律和情感三条线索最终收束到了同一个结论上是全文结构上最巧妙的地方。
返回列表