ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Learn Harness Engineering 参考资料库:把模型当作功能性 Harness 而非零散文件集合

Learn Harness Engineering 参考资料库:把模型当作功能性 Harness 而非零散文件集合 Learn Harness Engineering 参考资料库把模型当作功能性 Harness 而非零散文件集合【免费下载链接】learn-harness-engineeringHarness engineering beginner tutorial, from 0 to 1项目地址: https://gitcode.com/gh_mirrors/le/learn-harness-engineeringLearn Harness Engineering 的docs/fr/resources/reference/参考资料库是一套面向实操的方法论索引它把课程中关于「长期运行 Agent」的经验压缩成四份可直接套用的参考笔记失败模式映射、初始化 playbook、固定启动流程、指令校准并维护一份经过严格筛选的 Harness Engineering 外部资料清单。读完本文你将掌握如何用最小工件如feature_list.json、claude-progress.md、init.sh把多会话 Agent 工作流从「每次重新发现环境」改造为「基于仓库系统记录稳定推进」并理解参考库为何刻意保持精简。参考资料库的定位与使用场景在整门课程中docs/fr/resources/是「把课程方法转化为可直接复制模板与紧凑参考」的一层其目录结构为docs/fr/resources/templates/可直接复制进真实仓库的模板文件docs/fr/resources/reference/index.md方法笔记、启动流程与失败模式映射docs/fr/resources/openai-advanced/进阶仓库骨架、system-of-record 文档与 agent-first 治理模板。参考库的核心论断是一句话这些笔记解释的是如何把模型当作一个功能性 harness 来使用而不是当作一组零散文件的简单集合。harness 指的是模型外围的执行系统——Agent 循环、工具执行、沙箱、状态、上下文、验证、终止、编排与可观测性。参考库的适用时机是当你希望 Codex、Claude Code 或其他编码 Agent 跨多个会话工作而不必反复重新发现 setup、状态与 scope 时——典型信号包括工作跨会话、功能众多且容易被留半截、Agent 习惯过早宣布胜利、启动步骤每次都要重新摸索见docs/fr/resources/index.md。内部参考笔记一失败模式映射method-mapdocs/fr/resources/reference/method-map.md是参考库的入口文件它把长期运行的编码 Agent 最常见的失败模式映射到「首先处理该问题」的工件或运行规则上。完整映射表如下失败模式实践中的表现主要修正支撑工件冷启动困惑新会话把大部分时间花在重新发现配置与状态上让仓库成为系统记录claude-progress.md范围漂移Agent 同时启动多个功能却没有一个正确完成限制活跃范围feature_list.json过早完成Agent 在修改代码后、可执行证据之前就宣称完成将完成与证据绑定clean-state-checklist.md启动脆弱每次会话都重新学习如何启动项目标准化配置与验证init.sh交接薄弱下一个会话无法判断什么已验证、什么坏了、什么待办以显式交接收尾session-handoff.md评审主观评审质量取决于品味或记忆用固定类别为输出打分evaluator-rubric.md该表背后是一条明确的工作原则添加能够直接处理所观察失败模式的最小工件而不是把每个可靠性问题都通过向单个全局指令文件倾倒更多文本来解决。这一点与课程中「为什么单个巨型指令文件会失败」的论点一脉相承对应docs/fr/lectures/lecture-04-why-one-giant-instruction-file-fails/index.md。仓库中的真实实现印证了这张映射projects/project-01/solution/下同时存在claude-progress.md、feature_list.json、init.sh、session-handoff.md、clean-state-checklist.md等工件projects/project-03/solution/则进一步加入了session-handoff.md与clean-state-checklist.md在docs/fr/resources/templates/index.md中每个工件的字段含义与使用方式都有逐项说明。也就是说这张表不是理论清单而是可以直接对照仓库实际产物验证的工程事实。内部参考笔记二初始化 Agent Playbookdocs/fr/resources/reference/initializer-agent-playbook.md面向「仓库中的第一次正式会话」——即在增量功能开发开始之前的那次会话。目标创建一个稳定的运行表面让后续会话可以在不必重新推导启动命令、当前状态或任务边界的情况下实现行为。初始化者必须至少留下这些工件一个根指令文件如AGENTS.md或CLAUDE.md一个机器可读的功能表面如feature_list.json一个持久化的进度工件如claude-progress.md一个标准启动辅助脚本init.sh一个捕获参考脚手架的安全初始提交。五步检查清单定义标准启动路径定义标准验证路径创建进度日志并记录起点状态将工作拆解为带状态的显式功能创建第一个干净的参考提交。成功测试一个没有此前对话上下文的全新会话必须能够回答——这个仓库是做什么的、如何启动它、如何验证它、什么还没完成、最佳下一步是什么。这一点与课程中「初始化需要自己的阶段」的论述对应docs/fr/lectures/lecture-06-why-initialization-needs-its-own-phase/index.md并可在仓库中得到实物印证projects/project-01/solution/与projects/project-06/solution/都包含init.sh与feature_list.jsonproject-06/solution/还具备完整的CLAUDE.md、claude-progress.md与session-handoff.md——这正是初始化阶段产物在真实项目中的完整形态。内部参考笔记三编码 Agent 的固定启动流程docs/fr/resources/reference/coding-agent-startup-flow.md规定初始化完成之后每个会话开始时都必须执行的固定流程。固定启动模板运行pwd并确认仓库根目录读取claude-progress.md读取feature_list.json用git log --oneline -5检查近期提交运行./init.sh运行一次冒烟测试或参考端到端测试如果参考基线损坏先修复它选择优先级最高的未完成功能只在该功能上工作直到它被验证或显式阻塞。为什么这个顺序重要pwd避免在错误目录中意外工作进度文件与功能文件在任何新修改开始之前恢复持久状态近期提交解释最近发生了什么变化init.sh标准化启动而不是依赖记忆参考基线验证能在新工作掩盖损坏的起始状态之前拦截它。会话结束的镜像收尾同一会话应以如下方式结束记录进度更新功能状态如有必要撰写交接提交安全工作保持一条干净的重新启动路径。仓库中的模板对这套流程给出了字段级支撑claude-progress.md的「会话记录」要求记录目标、已完成、执行的验证、记录的证据、提交、已知风险与最佳下一步见docs/fr/resources/templates/index.mdinit.sh通过顶部三个变量INSTALL_CMD、VERIFY_CMD、START_CMD把「安装依赖 → 执行验证 → 展示启动命令」压缩为一条命令。这些正是「启动路径与验证路径标准化」的具体实现也是课程「仓库必须成为系统记录」论点docs/fr/lectures/lecture-03-why-the-repository-must-become-the-system-of-record/index.md的直接落点。内部参考笔记四提示词校准docs/fr/resources/reference/prompt-calibration.md处理根指令文件如AGENTS.md/CLAUDE.md的膨胀问题核心原则是根指令应当定义运行框架而不是每一个可能的动作。留在根文件中的内容仓库的目标与范围启动路径验证路径不可协商的约束所需的状态工件会话结束规则。移出根文件的内容冗长的历史边界案例主题特定的实现细节应靠近代码存放的局部架构笔记只适用于单个子系统的示例。工作规则根文件应当帮助新会话快速定向。如果文件变成了每个过去失败的垃圾桶就把细节拆分到更小的文档中并改为链接引用。这一校准原则与课程「为什么单个巨型指令文件会失败」的教训一致也与harness-designs/中对真实产品 harness 的拆解互为印证如docs/fr/harness-designs/claude-code/index.md、docs/fr/harness-designs/codex/index.md等。主文章清单课程的方法论骨架参考库刻意将主文章列表保持精简——普通提示词工程文章或宽泛的 Agent 框架文章不属于主列表只有直接覆盖 Agent 循环、工具执行、沙箱、状态、上下文、验证、终止、编排与可观测性的文章才被收录。这些文章的外部原文属于课程参考文献不在本文内展开为外部链接仓库中对应的课程化解读见docs/fr/lectures/的十四讲与docs/fr/harness-designs/的产品拆解。主列表按以下主题组织三篇原始支柱文章课程主干OpenAIHarness engineering——在 agent-first 世界中利用 Codex2026-02-11agent-first 仓库、仓库本地上下文、自定义 lint 与结构性护栏。Anthropic面向长期运行 Agent 的有效 harness2025-11-26初始化 Agent、编码 Agent、功能列表、进度日志与跨上下文窗口的交接。Anthropic面向长期应用开发的 harness 设计2026-03-24规划者/生成者/评估者角色、上下文重置、harness 简化与过时假设。五篇 2026 年高相关补充文章OpenAI展开 Codex Agent 循环2026-01-23Codex 执行 harness、工具调用、上下文增长与循环终止。Anthropic揭开 AI Agent 评估evals的神秘面纱2026-01-09将模型与 harness 一起评估并区分评估 harness 与 Agent harness。LangChain用 harness engineering 改进 Deep Agents2026-02-17保持模型不变同时改进系统提示词、工具、中间件、追踪与自动验证。Thoughtworks / Martin Fowler面向编码 Agent 用户的 harness engineering2026-04-02把编码 Agent 的 harness 当作前瞻性指南与反馈传感器配合确定性控制与推断性控制。Cursor持续改进我们的 Agent harness2026-04-30把 harness 当作持续改进的产品系统配套离线评估、在线指标、工具错误分类、模型特定调优与会话中换模型。扩展参考 2026设计具体模块时的素材扩展参考不是课程的主要来源但在设计特定 harness 模块时有用。这一节只保留内容直接覆盖 Agent 循环、工具执行、上下文管理、验证、沙箱、控制层或回归治理的来源纯 Agent 产品、平台公告、团队案例研究与基准测试均被排除。其主题分布包括Codex 生态App Server 作为可复用 harness 协议线程生命周期、恢复、fork、diff、客户端集成用 Codex 运行长时程任务持久项目记忆、里程碑验证、完成标准示例Agents SDK 的下一代演进模型原生 harness、沙箱执行、文件/命令执行开源编排规范 Symphony把工单跟踪器或 Linear 看板变成多 Agent 控制平面。Anthropic 实践并行 Claude 团队构建 C 编译器并行 Agent 团队、任务锁、git 同步、容器隔离、自主循环Managed Agents 扩展把 session、harness、sandbox 拆成可互换接口的元 harness 视角Claude Code 质量报告更新推理级别、上下文剪枝、系统提示词作为需要回归治理的 harness 变更。上下文与模型调优LangChain 的深度 Agent 上下文管理文件系统卸载、工具调用截断、摘要、定向评估为不同模型调优 Deep Agents模型特定的提示词、工具名、中间件与子 Agent 配置LangChain 的 Agent 持续学习把改进拆分为模型层、harness 层与上下文层由轨迹驱动。框架与平台Microsoft Agent Framework 中的 Agent Harnessshell/文件系统 harness、审批流、托管 shell 执行、上下文压缩Google ADK for Java 1.0.0插件、事件压缩、HITL、session/记忆服务、A2A 作为可复用 harness 原语GitHub Agentic Workflows把 GitHub Actions 用作 Agentic 工作流执行器含安全输出、沙箱、权限与评审AWS Bedrock AgentCore 企业最佳实践Runtime、Memory、Gateway、Identity/Policy、Observability、Evaluations 等企业 harness 层。工程团队实录Stripe Minionsdevbox 隔离、自定义 Agent harness、蓝图状态机、规则文件、MCP 工具策划、安全检查、pre-push/CI 反馈循环Cognition 云端 Agent 经验VM 隔离、session 捕获/恢复、编排、治理、审计日志、集成与多 Agent 实践生成者-验证者循环、干净上下文评审者、智能路由、manager-child 协调、跨 Agent 通信限制Replit 决策时指导用轻量分类器在决策点注入简短情境建议而不是把所有规则塞进系统提示词Vercel 的 v0 实践动态系统提示词、流式重写层、确定性/模型驱动的自动纠正与 deepsec面向安全的编码 Agent harness扫描、调查、再验证、丰富、导出、插件、拒绝校验器Sourcegraph CodeScaleBench评估/工具 harness 基准MCP 工具采用、工具使用转录、基准 QA、验证者/可复现性门禁、prompt/前置迭代。排除规则严格限定于 2025 年的通用参考被排除在主列表之外Anthropic 2025 年的原始 harness 文章之所以保留是因为它是课程的基础来源。建议阅读顺序参考库给出了明确的递进路径前四步是仓库内笔记后八步对应主文章清单method-map.mdinitializer-agent-playbook.mdcoding-agent-startup-flow.mdprompt-calibration.mdOpenAI Harness engineeringAnthropic Effective harnessesAnthropic Harness design for long-running application developmentOpenAI Codex agent loopAnthropic agent evalsLangChain Improving Deep AgentsThoughtworks / Martin Fowler Harness engineering for coding agent usersCursor Continually improving our agent harness对应仓库路径为docs/fr/resources/reference/method-map.md、docs/fr/resources/reference/initializer-agent-playbook.md、docs/fr/resources/reference/coding-agent-startup-flow.md与docs/fr/resources/reference/prompt-calibration.md。把参考库落地到真实仓库参考库的价值在于与模板层和项目层联动。推荐的落地路径是从docs/fr/resources/templates/AGENTS.md或docs/fr/resources/templates/CLAUDE.md起步配以init.sh、claude-progress.md、feature_list.json组成最小包——这四件套即可让大多数 Agent 工作流显著更稳定项目成长后加入session-handoff.md、clean-state-checklist.md、evaluator-rubric.md当仓库演进为多领域持久系统活跃计划、质量评分、可靠性策略时迁移到docs/fr/resources/openai-advanced/index.md的进阶包而不是把最小包无限拉伸。真实的落地形态可以在项目的 solution 目录中直接观察例如projects/project-01/solution/feature_list.json、projects/project-01/solution/claude-progress.md、projects/project-01/solution/init.sh以及project-03/solution/session-handoff.md、project-06/solution/clean-state-checklist.md与project-06/solution/evaluator-rubric.md。这些文件就是参考库中方法笔记、playbook 与校准规则被完整执行后的产物。总而言之这份参考资料库回答的不是「如何写更好的提示词」而是「如何搭建模型外围的执行系统」用method-map定位失败模式用初始化 playbook 建立稳定表面用固定启动流程消除记忆依赖用提示词校准防止根指令膨胀再用经过筛选的行业资料持续校准自己的 harness 设计。它就是一套可以照着做、也可以在仓库源码中逐项核对的最小 harness 施工手册。【免费下载链接】learn-harness-engineeringHarness engineering beginner tutorial, from 0 to 1项目地址: https://gitcode.com/gh_mirrors/le/learn-harness-engineering创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表