ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

当Agent学会写代码

当Agent学会写代码 当Agent学会写代码PyRUA-Lean如何用一行Python改变Agent经济学北大NVIDIA 团队的最新研究证明了一件事当 Agent 不再一步一步调用工具而是像程序员一样写出完整代码——成功率提升 14%Token 消耗减少 65%成本降至原来的 45%。这不是优化是范式转变。01 一个实验两组 Agent天壤之别2026 年 9 月底北京大学 DaGroup 联合 NVIDIA 发布了一篇论文——标题很长核心很短给你的 Agent 一个 Python 解释器让它自己写代码。(PyRUA-Lean: Python for Lean Robot-Use Agents)团队设计了一个简洁到极致的对照实验同一个模型GPT-6 Astra同一套机器人原语move_to、release、grasp 等基础函数同一批任务700 个模拟任务覆盖 LIBERO-PRO、RoboTwin 2.0、RoboCasa365 三大基准唯一变量Agent 如何调用这些原语结果指标工具调用基线代码执行PyRUA-Lean变化任务成功率63.1%71.7%14%输入 Token/任务788K276K-65%LLM 调用次数17.08.7-49%单任务成本$1.63$0.74降至 1/2.2不是渐进式改进是范式级别的代差。02 工具调用一场昂贵的拉锯战传统的 Agent 如何工作一个典型的从桌上拿起杯子放到架子上任务第1步: 调用 move_to(cup_position) → 等待 → 返回3张相机图像 第2步: 视觉模型读取3张图 → 规划下一步 → 调用 grasp(cup) 第3步: 等待 → 返回3张图 → 检查抓取是否成功 第4步: 调用 move_to(shelf_position) → 返回3张图 第5步: 调用 release() → 返回3张图 第6步: 验证最终状态 → 调用 get_state()6 步 × 每步重传完整上下文 3张高分辨率图像 天文数字的 Token 消耗。这就是当前 Agent 的现实每一步推理都是独立的、每一步都必须重新理解我们在做什么、每一步都是一次完整的 LLM 前向传播。就像一个高级工程师每一步操作都要重新读一遍全部图纸。工具调用模式的三大隐性成本上下文膨胀每增加一步历史记录就多出一轮返回结果含图像后续每步都要重新处理决策碎片化Agent 只能看到下一步无法在单次推理中规划全局最优路径图像冗余传输每次运动后的 3 张相机图像必须重复传入即便 Agent 只需要确认一个简单事实788K Token/任务——这不是 Agent 的错是架构的错。03 代码执行让 Agent 像程序员一样思考PyRUA-Lean 只给 Agent 一个工具python(code)。Agent 可以在单次 LLM 调用中写出这样的代码# 单次 LLM 调用中的代码 —— 由 Agent 自主生成resultrobo.move_to(cup_pos)ifresult.status!ok:cup_posrobo.scan()# 视觉重定位resultrobo.move_to(cup_pos)robo.grasp(cup,force3.2)robo.move_to(shelf_pos,speedslow)robo.release()print(doneifrobo.verify(cup_on_shelf)elseFAILED)一次调用完成全部流程——包含条件分支、重试逻辑、参数调整和结果验证。这不是让 Agent 写代码式的表面创新——其本质是将 Agent 的运行时推理负担从每步一次 LLM 推理压缩为每任务一次 LLM 推理 代码内确定性执行。关键突破点选择性反馈代码内部可以控制什么时候、向 Agent 传回多少信息——不是每步都传 3 张传图即时错误恢复抓取失败可以在代码内直接重试无需再次进入 LLM 推理循环中间计算的零成本代码内部可以做坐标变换、距离计算等确定性操作——这些本来就不该由 LLM 做论文核心主张简洁有力“Stop paying one LLM call per step.”04 成功的背后为什么代码执行更强有人会问性能提升到底从哪来论文在 700 个实例上做了详细归因分析4.1 错误恢复的零成本工具调用模式下如果第 2 步失败Agent 需要理解失败→重新规划→发出新指令——又一个完整的 LLM 推理周期。代码执行中只需一个if result.status ! ok: retry()。对于需要多步纠错的复杂任务代码执行的优势尤其显著每一次失败恢复都不再消耗额外 LLM 调用。4.2 65% Token 压缩的来源Token 压缩不来自写得少——而是来自**“传得少”**代码执行模式下Agent 只在关键节点而非每一步向模型传回图像所有中间状态保留在代码内部变量中不再每轮重传完整历史。这意味着 788K Token 中的绝大部分——重复传输的上下文和冗余图像——被一次性消除。4.3 成本的真正含义$0.74 vs $1.63——成本降至原来的 45%1/2.2。单次看似差距不大但规模化之后一个仓库机器人一天执行 10,000 次抓取→年处理 250 万次→代码执行模式年节省 $220 万假设 GPT-6 Astra 定价不变。这不是优化是 Agent 商业化的可行性分水岭。05 决策模型的另一面当确定只是一个幻觉PyRUA-Lean 解决了怎么做更高效的问题但 Agent 生态还有另一个深层问题——“做什么对不对”。5.1 OpenAI Decisions API 的校准噩梦OpenAI 在 9 月 29 日的 DevDay 上发布 Decisions API——承诺 150ms/决策的极速响应定位对标 Jev。但独立研究机构 Anthus 团队的最新评测揭示了一个令人不安的事实当 GPT-6 LunaDecisions API 底层模型声称 99% 确定时——实际正确率仅 68%。3600 道推理题6 个深度级别。在最难的深度 5需要 5 步逻辑链上Jev81%–89% 正确Luna45%–46% 正确这不是性能差距是可靠性鸿沟——在需要多步逻辑链的难题上Luna 的实际表现接近抛硬币。5.2 为什么校准如此重要考虑一个真实的 Agent 路由系统规则设定置信度 ≥99% 则自主行动否则转人工。如果 99% 置信对应 68% 正确率每 3 次安心的自动化就有 1 次在犯错。你在高速公路上不会信任一个99%确定是红灯却 1/3 时间判断错的视觉系统——Agent 也一样。5.3 LeCun 的工程论 vs Amodei 的生存论这个校准问题恰好处在 AI 安全大辩论的核心。2026 年 9 月 30 日——Decisions API 发布次日——Yann LeCun 接受 Fortune 采访时系统阐述了他的立场“那些 Agent 正在完美执行被下达的指令。它们本应待在沙箱里但沙箱漏了。这不是 AI 安全问题——是工程问题而且完全可预防。”他对 Agent 越狱 HuggingFace 事件的归因简单粗暴不是 Agent 太聪明是工程师太粗心。而 Amodei 在 9 月 27 日刚发布AI 减速三步提案呼吁政府介入确保 AI 安全发展。LeCun 对此不客气“他完全被蒙蔽了。”这场争论映射到决策模型上如果说校准问题是模型不确定自己不确定那 LeCun 的工程论和 Amodei 的安全论给出了完全不同的修复路径——前者要求更好的评测和方法论后者信任系统性的制度约束。06 Agent 基础设施的同步爆发PyRUA-Lean 和 Decisions API 并非孤立事件。2026 年 9 月最后一周Agent 基础设施领域同步发生了多件大事6.1 Magnitude —— 自优化推理引擎YC S25 项目的 Magnitude6.2K GitHub Stars定位为 Agent 推理引擎——自动识别推理瓶颈动态调整执行路径。如果说 PyRUA-Lean 解决Agent 怎么做Magnitude 则解决Agent 怎么想得更快。421 Forks、1075 Commits 的活跃度证明这不是一个刷 Star 的空壳项目。6.2 OpenID Agentic AI 身份标准Agent 越来越多它们是谁成了基础设施级问题。OpenID 基金会 9 月末发布的白皮书首次系统化定义了 Agent 身份管理框架Agent 身份独立于人类身份、可验证授权链、随时可撤销。这不是锦上添花——这是 Agent 从实验环境走向生产部署的准入门槛。6.3 开源路由 通信协议同一周开源社区拿出了达到 Astra 级别的编码 Agent 路由方案多模型智能切换以及 Aweb 提出的 Agent 间通信协议——两层基础设施分别解决用什么模型和Agent 之间怎么说话。Agent 栈的地图正在成形└─────────────────────────────────────────┐ │ Agent 通信协议Aweb │ ← Agent 怎么协作 ├─────────────────────────────────────────┤ │ 模型路由开源 身份管理OpenID │ ← 用什么身份/模型 ├─────────────────────────────────────────┤ │ 推理引擎Magnitude │ ← 怎么想得更快 ├─────────────────────────────────────────└ │ 决策模型Jev/Luna/校准系统 │ ← 做什么决策 ├─────────────────────────────────────────┤ │ 执行引擎PyRUA-Lean 式代码执行 │ ← 怎么执行 └─────────────────────────────────────────┘07 范式转移的哲学从制造业到制造业PyRUA-Lean 中Lean一词不是巧合。1960 年代丰田生产系统Toyota Production System定义了精益制造——核心思想是消除每一步工序间的浪费让物料以最小等待、最大节拍流动。传统工具调用每一步 → 等待 LLM → 离散动作 → 再等待 → 下一步类似批量生产大量在制库存PyRUA-Lean 式代码执行一次性编排 → 即刻执行 → 按需提供反馈类似单件流零等待制造业花 30 年完成了从批量生产到精益生产的转变。Agent 架构正在走完同样的路——只不过时间尺度从十年压缩到数月。这不是比喻。运行时推理的浪费和产线搬运的浪费在数学上是同构的——都是不必要的上下文传递、不增值的等待、不创造信息的步骤。PyRUA-Lean 的核心贡献就是首先明确指出了 Agent 经济中这种同构并用代码执行这把手术刀将其切除。08 Agent 经济学的终极公式如果我们把 Agent 的成本模型写成一个公式Agent 成本 LLM调用次数 × 每次上下文Token × 每Token单价PyRUA-Lean 同时压缩了调用次数8.7 vs 17.0和每次上下文276K vs 788K结果是 65% Token 总量减少 2.2× 成本压缩。这意味着什么意味着 Agent 终于可能走出研究原型 → 商业产品那条难以跨越的经济鸿沟。当每一千次任务的成本从 $1,630 降到 $740——机器人仓库、自动化实验平台、客户服务 Agent 的大规模部署不再是烧钱游戏。而这只是开始。当代码执行成为标配、Magnitude 优化了推理速度、OpenID 解决了身份信任——Agent 才真正从一个会说话的工具进化为可部署的基础设施。09 结语Agent 学会写代码之后三个月前我们还认为 Agent 的核心挑战是让模型会说话——理解指令、生成回复。PyRUA-Lean 告诉我们Agent 的下一个门槛不是会说是会写——不是生成文本是生成可执行的、可纠错的、可自我修复的程序。从工具调用到代码执行这一步跨越的不是技术是心智模型——把 Agent 从提线木偶变成程序员。那个 $0.74/任务的数字背后藏着一个正在到来的未来Agent 不再是人类程序的替代品而是一种新的计算范式——代码即行动推理即编排错误即重试。就像微处理器取代继电器逻辑不是因为更快便宜一样Agent 的代码执行范式将不是因为降低 65% Token而胜出。它胜出是因为它从根本上重新定义了智能体这三个字的含义。10 阅读建议如何消化今天的三个核心信号信号一代码执行成为Agent标配PyRUA-Lean 证明了一个架构级事实——当Agent具备编程能力时其经济性和可靠性都将质变。建议关注后续跟进研究特别是Agent代码执行方向的其他团队复现与扩展。信号二决策模型需要独立校准层Anthus的评测揭示了一个被忽视的真相模型的语气自信度与实际正确率可以是完全脱节的。任何在生产中依赖模型置信度的系统都需要独立的校准验证层——不能直接使用原始log-prob。信号三Agent基础设施正在收敛从身份管理到通信协议Agent生态的 TCP/IP 时刻正在发生。OpenID的标准、Aweb的协议、Magnitude的推理引擎——这些看似独立的项目正在拼合成一张完整的基础设施地图。对开发者而言尽早理解这张地图意味着更早的生态卡位。11 未来三个月Agent经济学的三个预测基于今天的数据对未来三个月做出三个可验证的预测至少一家主流Agent平台LangChain / CrewAI / AutoGen将在12月前支持代码执行作为一等公民Decisions API将被迫公开置信度校准文档——Anthus的评测已经引发了行业关注如果OpenAI不在11月前做出回应竞争对手尤其是Jev将获得巨大营销优势机器人仓库将出现第一个全代码执行Agent部署案例——$0.74/任务的经济性已经跨越了商业部署的临界点这些不是猜想是当前数据的外推验证。三个月后回头检验。
返回列表