你写了一个 Agent。它跑着跑着,开始原地打转——同一个工具调用重复第七次;或者更糟,它从某个工具那里拿到了一个被污染的结果,安静地吞下去,然后用这个错误数据编出了一个看起来完全合理的答案。等任务跑完你才发现:预算烧光了,答案错了,而你甚至不知道它是从哪一步开始坏的。
这是 2026 年 Agent 工程最疼的那个问题。不是"模型不够聪明",而是你根本不知道它什么时候开始坏了。
现有的标准答案很直接:用一个 LLM 当裁判,每一步都打分。问题是,这个裁判每一步都要跑一次 7B 模型的 forward pass,算下来比 Agent 本身还贵。Sunny Dubey 在 8 月 3 日挂到 arXiv 的这篇论文(2608.02464)问了一个看起来很傻的问题:
如果我只看 Agent 每一步"留下的脚印"——它说了什么、token 有多不确定、调了什么工具、工具返回了什么——我能用 200 微秒一步的成本,在它彻底翻车之前就拉响警报吗?
答案是可以,但故事比"可以"有意思得多。
一、核心设定:只看健康样本,不问失败长什么样
这篇论文最反直觉的设计选择是:监控器只见过健康的运行轨迹,从来没见过失败长什么样。
这听起来像是在故意给自己挖坑。常规的故障