ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【AI系列】印刷术没有让人变笨,Harness 也不会让模型变笨

【AI系列】印刷术没有让人变笨,Harness 也不会让模型变笨 文章目录0 背景1 核心观点2 Introduction3.从权重到上下文再到 Harness3.1 权重中的能力3.2 上下文中的能力3.3 Harness 中的能力3.4 外部化作为转型逻辑4 Externalized State: Memory架构如何演进记忆需要被管理5\. Externalized Expertise: Skills一个技能包含什么技能如何进入并运行与其他组件的关系局限与风险6 Externalized Interaction: Protocols协议规定什么协议的类型与例子协议在 Harness 中的作用核心观点与局限7.Unified Externalization: Harness Engineering统一外部化——Harness 工程Harness 的六个设计维度Harness 作为“认知环境”代价与风险8. 文献0 背景阅读本意找一篇Skills、MCP、Harness Engineering这些概念能够绘制在一张全景图中并且说清楚之间关系的文章。意外收获这篇论文很有趣的将agents这些技术与认识发展做了类比来阐释其关联性。人类外化过程想法→语言→书写→印刷→电脑编程每次进步没有因为外化而导致人类更加低能反而随着资源的外化大脑资源空出来人们可以有更多的时间做计划、抽象和创造AI agent 外化过程weight→memory→skill→Protocols→Harness1 核心观点LLM 智能体的能力不只取决于模型权重也取决于把状态、程序和交互规则放到模型外部管理的系统设计。作者把这种做法称为“外部化”将原本依赖模型临时记忆或即兴生成的内容转为可保存、检查、复用和治理的外部结构部分外部化的内容主要解决的问题记忆工作上下文、经历、知识、用户偏好如何跨任务或跨会话保持信息技能操作步骤、决策启发式、约束如何可靠复用程序性知识协议调用语法、交互流程、权限与发现机制如何规范智能体与工具、其他智能体及用户的交互Harness控制流、执行隔离、人工审批、观测、权限和上下文预算如何在运行时编排并治理以上组件关键区分是作者不把 Harness 看作与记忆、技能、协议并列的“第四种外部化”。它更像托管这些组件的运行环境负责控制它们如何被调用、执行和监督2 Introductiona人类一直在把认知活动外置。作者从口语、文字、印刷到数字计算的演进谈起人类会把原本依赖个体记忆和思考的工作交给外部媒介承载。外部工具的作用不只是“增强”个人而是重新组织整个认知过程。b 认知工具通过改变表征方式来改变任务。购物清单没有让人拥有更强的生物记忆它把“凭记忆想起要买什么”变成“看清单辨认还缺什么”。地图也不是让人突然更擅长空间推理而是把空间关系呈现出来让人可以直接查看。作者把这种变化称为“表征转换”目标大致不变但完成目标所需的步骤和认知负担变了。c 作者把这一思路引入 LLM Agent。论文认为智能体的可靠性不只来自更强的模型也来自模型周围的运行环境。记忆、技能、协议等外部结构可以承接原本需要模型临时记住、重新推导或即兴协调的工作。于是作者提出一个重要问题与其只问“模型有多强”不如问“哪些负担已经被外置模型因此不必每次从头处理3.从权重到上下文再到 Harness本节描述 LLM 智能体系统的演进模型权重提供基础能力上下文让开发者在运行时引导模型Harness运行时治理框架则把记忆、工具、执行流程和反馈机制组织成更完整的环境。作者强调这不是权重被上下文或 Harness 取代而是工程重心逐渐向模型外部扩展3.1 权重中的能力在这一阶段模型通过预训练和后训练把知识与行为模式编码在参数中。优势是能力集中、调用方便也能较广泛地泛化不足是权重不易更新、审计或按用户需求定制。若事实变化单靠修改模型参数往往不够灵活。3.2 上下文中的能力随后开发者发现不改模型权重也能通过提示、示例、推理步骤和检索到的信息影响模型行为。RAG 等方法把外部资料放进上下文让模型从“靠参数记住答案”转为“根据当前提供的信息识别并作答”。但上下文有长度和成本限制信息放进上下文也不等于模型就能稳定利用。此外上下文通常是临时的会话结束后难以自然保留。3.3 Harness 中的能力更复杂的智能体开始依赖持久的运行环境而不只是精心编写的提示词。Harness 负责组织模型与外部组件的协作例如管理任务循环、调用工具、保存状态、处理反馈及约束执行。作者提到的智能体框架和代码智能体等系统体现了关注点从“给模型什么输入”转向“让模型在什么样的环境中工作”。本节把记忆、技能和协议视为 Harness 所协调的关键外部结构记忆保存状态技能保存可复用的操作知识协议规定交互方式。3.4 外部化作为转型逻辑作者用“外部化”解释这三个阶段为何相连随着任务变复杂越来越多负担被交给模型外部的结构处理。记忆承接跨时间的信息技能帮助重复执行程序协议让交互遵循稳定规则Harness 再把这些部分编排和治理起来。核心结论 权重、上下文和 Harness 不是互斥的三种方案而是智能体系统中可以同时存在的层次。为后文分别讨论记忆、技能、协议及 Harness 工程作铺垫4 Externalized State: Memory把记忆视为解决智能体“时间负担”的机制它让系统不必只依赖有限、短暂的上下文而能把有用状态保存在外部并在后续任务中检索、更新和治理。重点不是“存下越多越好”而是让当前决策能取得恰当、可理解的信息。维度保存内容例子工作上下文当前任务的状态与进度已查看的文件、待办步骤情境经历过去任务中的行动、结果与教训某次工具调用失败及原因语义知识从多个经历中归纳出的通用事实或规则项目惯例、领域知识个性化记忆特定用户或团队的偏好用户的格式偏好、团队习惯架构如何演进作者梳理了从简单到复杂的几种设计单体上下文把大量历史直接放进提示词容易受上下文容量限制也难以长期积累经验。检索式存储把较长历史放在外部存储中需要时取回关键问题变成能否检索到正确内容。层级记忆区分当前常用的“热”状态与长期保存的“冷”信息并对记忆进行提取、合并或遗忘。自适应记忆系统根据使用经验调整记忆的存储、路由或检索方式。记忆需要被管理记忆系统不只是一个数据库。它要决定哪些信息值得保留、如何整理、何时检索以及何时更新或丢弃。它还会与其他组件配合执行轨迹可能被总结成可复用技能协议则有助于把外部交互规范化后写入记忆。若多个智能体共享记忆还要考虑读写权限与资源配额。5. Externalized Expertise: Skills本节把技能视为对程序性知识的外部化智能体不必每次都从头生成做事流程而可以发现、选择并执行一套可复用的指导。作者的核心转变是从“临时想出怎么做”转为“找到合适做法再按情境执行”。一个技能包含什么组成部分作用操作程序规定步骤、阶段、依赖关系和停止条件决策启发式在关键分支处提供选择建议规范性约束规定安全、合规或权限边界因此技能不只是工具调用说明也可以封装完成一类任务的流程、判断原则和约束。技能如何进入并运行作者描述的生命周期大致是获取技能可以由专家编写、从成功的任务轨迹中提炼、通过环境探索发现或由已有技能组合而成。描述与发现用技能说明或注册表描述其用途和适用条件再据任务需要进行检索和选择。渐进加载先呈现简要说明需要时再加载细节避免把过多指南塞进上下文。执行与组合将技能指南绑定到工具或具体操作复杂任务可由多个技能衔接完成。反馈与治理Harness 可在执行前检查权限、执行后记录结果并将经验反馈给记忆或用于修订技能。作者也用工具调用研究的发展作背景早期关注稳定调用单个工具之后关注从大量工具中选择再进一步转向封装完成复杂任务所需的专业流程。与其他组件的关系技能与记忆、协议和 Harness 配合工作记忆可提供选择技能所需的经历和环境信息协议连接技能与工具、文件或其他智能体Harness 则负责控制执行、权限和观测。换句话说技能提供“怎么做”的可复用知识其他组件帮助决定“何时用、如何连接、怎样监督”。局限与风险指南可能被字面执行却偏离实际目标。技能可能因环境变化或模型更新而过时、失去可移植性。单独安全的技能组合起来也可能产生不安全结果。加载太多细节会挤占上下文干扰智能体跟踪整体任务。一句话概括技能把反复临时生成的流程变成可发现、可复用、可治理的外部指南但它是否可靠取决于技能是否适用、更新及时并且能在运行时受到约束。6 Externalized Interaction: Protocols本节讨论协议如何把智能体与外部对象交互时的规则从提示词中抽离出来。没有明确协议时模型往往要临时猜测调用格式、交互顺序和权限边界协议则把这些要求写成可检查的结构让交互从“自由推断”转为“按规则交换”。[协议规定什么作者归纳出四类交互要素要素规定内容调用语法参数名称、类型和消息结构生命周期语义多步交互的状态及转换规则权限与信任边界谁能访问什么、哪些操作需要限制发现元数据可用工具或能力如何描述、查询和发现因此协议不只是告诉模型“有哪些工具”还规定如何调用、交互如何推进以及哪些操作受到约束。协议的类型与例子论文按交互对象区分协议智能体—工具以 MCP 为例规范工具能力的发现和调用。智能体—智能体以 A2A 为例规范代理发现、任务委派和状态更新。智能体—用户讨论 A2UI、AG-UI 等面向界面结构或交互状态传递的协议。这些例子展示了协议从工具调用扩展到代理协作和用户界面的趋势它们是论文中的案例不代表协议之间完全等价或适用于所有场景。协议在 Harness 中的作用在运行时Harness 可以把模型表达的意图转成可验证的命令按需提供可用能力并管理长流程中的会话状态。协议与记忆、技能分工不同**记忆保存跨时间的信息技能封装可复用的做法协议则规定这些能力如何被调用和协调。**权限是否真正生效还需要运行环境执行相应检查。核心观点与局限从“认知人工制品”的角度看协议把开放式的交互推断变成有结构的任务模型主要负责理解意图和判断协议提供格式、校验规则和流程约束。但协议也会带来额外的上下文、延迟和推理开销预设的接口可能限制表达方式伪造或恶意的协议信息也可能造成安全风险。一句话概括协议把“如何与外部世界交互”从模型临场猜测变成有格式、有状态、有边界的规则但规则需要由 Harness 落实和监督不能仅靠协议文本保证安全。7.Unified Externalization: Harness Engineering统一外部化——Harness 工程第 6 节把前面讨论的记忆、技能和协议放到一个运行时框架中理解。作者称这个框架为Harness它不是与记忆、技能、协议并列的“第四种外部化内容”而是负责协调这些组件、约束模型行动并监测执行过程的统一层。它的目标不是增加模型参数而是为模型安排一个更可靠的工作环境。[Zho26c]Harness 的六个设计维度维度主要作用智能体循环与控制流编排感知、检索、计划、行动、观察等步骤并管理何时继续或停止沙箱与执行隔离限制执行环境中的读写和操作范围降低错误或越权的影响人类监督与审批在关键步骤加入人工检查、批准或拒绝可观测性与结构化反馈记录执行轨迹和结果支持调试、审计与后续改进配置、权限与政策将工具访问、预算等治理规则明确化并交由运行时执行上下文预算管理在有限上下文中安排记忆、技能和其他信息的加载、摘要与取舍可以把它理解为一个持续的运行流程Harness 安排模型检索相关记忆、选择技能、通过协议调用工具同时执行权限检查、隔离操作、记录结果并决定任务是否继续。这个例子是对六个维度如何协同的概括而不是论文规定的唯一流程。Harness 作为“认知环境”作者进一步把 Harness 看作智能体的“认知环境”环境设计会影响哪些行动容易发生、哪些受到限制。因而智能体的实际能力不只在模型参数里也来自模型与记忆、技能、协议及运行时规则的协同。代价与风险Harness 层越多系统可能越可靠、可控但也会增加延迟和工程复杂度。记忆、技能说明和协议定义还会竞争有限的上下文与此同时外部记忆或技能本身也可能过时、被污染或遭恶意注入。因此Harness 不只是把组件接起来还要负责取舍、权限治理和监控。核心结论Harness 工程把问题从“怎样让模型单独更聪明”扩展为“怎样构造一个让模型更可靠地行动的运行环境”。8. 文献Zhou, Chenyu, Huacan Chai, Wenteng Chen, 等. 《Externalization in LLM Agents: A Unified Review of Memory, Skills, Protocols and Harness Engineering》. arXiv:2604.08224. 预印本, arXiv, 2026年4月9日. https://doi.org/10.48550/arXiv.2604.08224.
返回列表