回归代价:拆解大模型智能体中技能的增益与损害机制

回归代价:拆解大模型智能体中技能的增益与损害机制

论文原链接:https://arxiv.org/html/2607.22520v1

摘要

现有大模型智能体技能的评估仅依靠任务平均通过率提升这一单一指标,该指标存在严重信息缺失:新增技能不仅能解决更多任务,同时也会让原本能完成的任务失效。本文在2套办公自动化基准、3套模型-运行环境组合下完成近6000组对照实验(有无技能库成对对比),定义两类核心样本:

  1. 增益样本:无技能时失败,加入技能后成功;
  2. 回归样本:无技能时成功,加入技能后失败;
    实验统计显示回归样本会抵消59%的总增益。进一步拆解出三类导致回归的底层机制:
  3. 技能描述渗透效应:技能仅停留在上下文提示词、全程未被调用,仍改变智能体行为;
  4. 输入定位偏移:技能规定的操作流程覆盖了智能原本正确读取输入的逻辑;
  5. 校验抑制偏移:技能流程压制模型原生输出校验步骤。
    对持续未解决的残差失败样本分析发现:现有技能过度侧重中间推理流程,对输入定位、输出校验两大关键环节支撑严重不足;通过优化输入读取与输出校验逻辑,大量回归与残差失败问题可被修复。本文提出核心评估改进方案:技能效果不能仅看平均通过率提升,必须拆分为增益、回归双向指标;智能体可靠性更多取决于输入读取、输出校验能力,而非推理流程本身。

1 引言

智能体技能是可复用的流程化指导单元,包含描述文本、自然语言操作步骤,部分配套可执行代码,会加载进模型上下文控制任务执行逻辑。Trace2Skill、EvoSkill、SkillOpt等工具均基于执行轨迹自动生成优化技能,行业通用评估方式仅统计任务平均成功率提升。
仅依靠平均提升指标存在重大缺陷:两套技能库总提升幅度相同时,其破坏的原有正确任务数量可能天差地别。
现有相关工作(ASSAY、GRASP等)可识别有害技能并过滤,但仅能处理被检索调用的技能,无法检测仅存在于上下文、从未执行但干扰模型的渗透效应;同时现有方案只筛选技能,不分析技能导致任务失效的底层机理。

本文采用成对对照实验:同一套智能体、相同任务,分别运行「无技能」「加载不同技能库」两组,共计5832次实验,覆盖两套办公基准、三套模型运行栈。核心创新:将通过率变化拆解为增益、回归两类成对指标,通过执行轨迹定位三类回归产生机制,证明绝大多数失效集中在输入读取、输出校验阶段(而非中间推理步骤)。

核心贡献

  1. 提出双向分解评估范式:将通过率变化拆分为增益、回归样本,实验证明回归抵消59%的总增益;
  2. 定义并完整验证三类回归产生机制,覆盖技能未调用时的渗透干扰效应;
  3. 定位智能体失效核心区间:输入定位、输出校验环节;修正基准打分工具,重新人工复核226组打分错误任务。

图1 智能任务三段式执行流水线:输入定位(grounding)→推理流程(method)→输出校验(verification)。现有技能过度优化中间推理环节,输入、校验环节支撑不足,绝大多数回归与残差失败产生于两端。

2 相关工作

2.1 轨迹自动生成技能框架

Trace2Skill、EvoSkill、SkillOpt、SkillOS等系统基于失败轨迹自动提炼流程技能,全部以平均任务提升作为唯一评价标准,忽略技能带来的任务退化损失。Anthropic、OpenAI官方技能生成工具进一步支持「用技能生成新技能」,同样仅关注正向收益,无退化分析。
Huang(2026)针对数据科学任务实验,发现技能带来增益与退化数量接近,但仅作为现象观测,未基于执行轨迹拆解底层机理。

2.2 上下文干扰相关研究

长上下文领域证明无关文本会稀释模型注意力、干扰推理;技能描述常驻系统提示词,即便从未调用也持续存在,天然具备干扰条件,但现有技能评估体系完全忽略该现象。

2.3 有害技能筛选方案

ASSAY、GRASP、RSEA、SkillGraph等方法通过掩码、预留集约束筛选负面技能,但全部依赖技能被检索调用的前提,无法检测仅存在于上下文、未执行却产生干扰的渗透效应;本文不只是筛选坏技能,而是完整拆解退化成因。

3 实验设置

固定控制变量:同一智能、同一任务,仅更换上下文内技能库,成对对比有无技能的执行结果。

3.1 两套办公自动化评测基准

  1. OfficeQA-Pro 金融文档问答基准
    素材为美国财政部真实长PDF报表,任务包含多表格数值提取、跨年度对比、百分比/均值多步计算;核心难点是精准定位表格、指标、时间维度(输入定位环节)。标准答案允许1%数值误差。
  2. SpreadsheetBench 表格操作基准
    基于真实Excel论坛任务,分为单元格局部操作、整张表格批量操作两类;要求修改单元格、筛选、公式编写、多表联动。

基准打分缺陷说明

表格基准原生打分工具仅对比单元格最终数值,无法解析AGGREGATE等高级函数,正确新式公式会被判定失败;后文5.3小节使用完整表格引擎重打分,同时提供原始/修正两套结果。

3.2 三套模型-运行环境组合栈

实验全程使用三套耦合栈,模型与运行环境绑定,用于验证结论普适性:

运行框架基座大模型
OpenCodeMiniMax-M2.7
CodexGPT-5.4-mini
Claude CodeClaude Sonnet 4.6

3.3 三类技能生成流水线

统一基线无技能执行轨迹提取失败信号,分别采用三套生成器产出独立技能库:

  1. Anthropic生成器:迭代评测优化,仅保留正向提升的技能;
  2. OpenAI生成器:单次结构化生成,无迭代效果校验;
  3. 本文自研生成器:生成前检索重复技能避免冗余,内置自批判改写逻辑,无需外部API。
    同一失败信号集,三套工具产出技能数量差异巨大(OpenCode栈:OpenAI产出23个,自研仅7个);所有技能分为常驻描述(全程在提示词)、执行体(调用时加载)两部分,用于区分渗透/调用两类干扰。

3.4 实验对照条件

每套栈、每个基准分4组实验:无技能、Anthropic库、OpenAI库、自研库;仅技能库为变量,模型、任务、失败信号完全固定。
两类对比方式:

  1. 有无技能成对对比:计算净增益(增益数-回归数);
  2. 不同技能库横向对比:用于定位退化对应技能文本特征。

3.5 四类任务结果定义

对同一任务,「无技能」vs「加载技能」成对结果分为四类:

  • 增益Gain:无技能失败,加载后成功;
  • 回归Regression:无技能成功,加载后失败;
  • 残差失败Residual failure:有无技能均失败;
  • 保留成功Retained:有无技能均成功。
    净效果 = 增益任务数量 - 回归任务数量

3.6 实验规模与统计方法

单栈单基准486个任务,3栈×4条件=5832次完整运行;
统计检验采用麦克内马尔精确二项检验,仅增益/回归不一致样本参与计算,报告95%置信区间;多重比较采用Bonferroni校正(α=0.0028)。

表2 全实验成对统计结果

分两套基准、三套栈展示各组通过率、增益/回归数量、净提升、置信区间与p值(加粗为p<0.05显著结果)

OfficeQA-Pro(任务总数94)
运行栈技能库无技能通过率带技能通过率增益回归净效果百分点差值(95%CI)p值
OpenCode-MiniMaxAnthropic51.1%52.1%1413+1+1.1 (-9.8,11.9)1.000
OpenCode-MiniMaxOpenAI51.1%55.3%1612+4+4.3 (-6.7,15.3)0.572
OpenCode-MiniMax自研51.1%60.6%156+9+9.6 (0.2,18.9)0.078
Codex-GPT5.4Anthropic54.3%56.4%1715+2+2.1 (-9.7,13.9)0.860
Codex-GPT5.4OpenAI54.3%56.4%119+2+2.1 (-7.2,11.4)0.824
Codex-GPT5.4自研54.3%57.4%1613+3+3.2 (-8.0,14.4)0.711
Claude-SonnetAnthropic72.3%80.9%102+8+8.5 (1.5,15.5)0.039
Claude-SonnetOpenAI72.3%77.7%127+5+5.3 (-3.7,14.3)0.359
Claude-Sonnet自研72.3%79.8%114+7+7.4 (-0.5,15.4)0.118
SpreadsheetBench(任务总数392)
运行栈技能库无技能通过率带技能通过率增益回归净效果百分点差值(95%CI)p值
OpenCode-MiniMaxAnthropic63.3%70.2%6235+27+6.9 (2.0,11.8)0.008
OpenCode-MiniMaxOpenAI63.3%64.3%4541+4+1.0 (-3.6,5.7)0.747
OpenCode-MiniMax自研63.3%65.6%4839+9+2.3 (-2.4,7.0)0.391
Codex-GPT5.4Anthropic65.8%67.6%3023+7+1.8 (-1.9,5.4)0.410
Codex-GPT5.4OpenAI65.8%66.6%3027+3+0.8 (-3.0,4.5)0.791
Codex-GPT5.4自研65.8%67.1%2823+5+1.3 (-2.3,4.8)0.576
Claude-SonnetAnthropic70.2%81.1%5916+43+11.0 (6.8,15.2)<0.001
Claude-SonnetOpenAI70.2%81.1%6320+43+11.0 (6.5,15.4)<0.001
Claude-Sonnet自研70.2%82.1%6619+47+12.0 (7.5,16.4)<0.001

4 回归代价:技能带来的性能抵消

4.1 回归样本整体规模

全部18组实验条件均存在回归样本,无零退化情况;汇总全部任务:总增益553例,总回归324例,回归抵消59%的正向收益
分基准统计:

  1. OfficeQA:增益122,回归81,抵消66%;
  2. SpreadsheetBench:增益431,回归243,抵消56%。
    即便整体通过率提升明显,退化样本数量依然接近增益,仅统计平均提升会完全掩盖该代价,本文将其命名为回归代价(Regression Tax)

4.2 双向分解改变评估结论

仅举一例:OfficeQA-Claude栈三套库增益分别为10、12、11,但回归数2、7、4;仅看净收益,Anthropic库效果最优,仅统计总提升会得出完全相反排名。
两套基准均存在大量此类反向案例,证明单向指标具备极强误导性。

4.3 统计显著性校正

原始18组检验仅5组未校正p<0.05;Bonferroni多重校正后,仅Claude栈表格基准三组结果显著(p<0.001),其余全部失去统计意义。
说明绝大多数表面提升是随机波动,回归代价是核心干扰因素。

5 三类回归底层作用机制

基于成对执行轨迹人工标注回归成因,OfficeQA任务逻辑清晰,完整细分4类机制;表格基准因打分工具缺陷仅做粗分类。
回归判定标准:

  1. 技能描述渗透(Osmosis):技能全程未调用,仅提示词描述干扰模型,同一任务多套库出现相同偏移;
  2. 输入定位偏移(Grounding displacement):技能被调用,流程强制覆盖原本正确的文档/表格读取逻辑;
  3. 校验抑制偏移(Verification displacement):技能流程取消模型原生输出检查步骤,计算正确但结论出错;
  4. 其他:轨迹无明确干扰特征、随机波动。

表3 OfficeQA全部81例回归机制统计

机制分类MiniMax栈GPT5.4栈Claude栈总计占比
输入定位偏移233425972.8%
技能描述渗透5091417.3%
输入+校验混合偏移12033.7%
其他随机波动21256.2%

表4 SpreadsheetBench全部243例回归粗分类

机制MiniMaxGPT5.4Claude总计占比
描述渗透452507028.8%
调用后流程干扰60404613.2%
打分工具缺陷101753213.2%
其他5431109539.1%

5.1 技能描述渗透效应(未调用仍干扰)

核心发现:技能常驻提示词描述,即便从未执行,也会改变模型判断;现有基于检索掩码的筛选工具完全无法捕获该类退化。
执行调用率跨栈差异极大:MiniMax表格任务仅5%-14%调用技能,但仍出现大量渗透型回归;Claude栈调用率高,渗透退化占比极低。
典型案例UID0096:无技能时输出37.7%正确;三套库均未调用技能,但描述包含revised关键词,模型全部算出38.757%错误值,完全复现偏移。
同时渗透效应双向作用:表格MiniMax栈大量增益样本也未调用技能,仅描述带来正向引导,证明该机制兼具好坏双向影响。

5.2 输入定位偏移(最主要退化成因)

OfficeQA中72.8%回归来自该机制:技能引导模型切换文档检索路径,覆盖无技能时精准读取的表格/指标。
案例UID0025:无技能正确读取1934、1946数值差142;调用导航技能后读取错误区间,算出542。推理计算步骤完全无误,仅输入读取环节被技能干扰。
同时存在正向案例:部分技能补充指标筛选逻辑,修复原生读取错误。

5.3 输出校验抑制偏移

技能流程省略模型原生结果校验,计算逻辑正确但最终答案出错;OfficeQA中单独该类退化极少,表格基准中是核心优化突破口。
原生打分工具仅对比数值,无法识别AGGREGATE等新式函数,大量正确公式被判失败;使用完整表格引擎重打分后,226个任务恢复正确判定。

表5 SpreadsheetBench修正前后通过率对比

运行栈技能库原始打分完整引擎重打分恢复任务数
OpenCodeAnthropic70.2%74.7%18
OpenCodeOpenAI64.3%68.4%16
OpenCode自研65.6%69.6%16
CodexAnthropic67.6%78.643
CodexOpenAI66.679.149
Codex自研67.177.842
ClaudeAnthropic81.184.915
ClaudeOpenAI81.185.216
Claude自研82.184.911

表格场景证明:补充输出校验步骤可大规模修复失败,现有技能完全缺失该类逻辑支撑。

5.4 残差失败样本成因(有无技能均失败)

Office全部残差失败集中在输入定位:模型始终读取错误指标区间,中间计算流程无误;
表格基准残差失败集中在输出校验:公式逻辑正确,但无校验步骤、打分工具无法识别新式函数;
结论:现有技能过度优化中间推理步骤,两端输入读取、输出校验支撑缺失,是持续失败的根本原因。

6 讨论

6.1 技能评估与设计规范

  1. 评估标准必须双向化:同时统计增益、回归数量,不能仅看单一平均通过率;
  2. 消融实验需要区分「仅提示词描述」「完整可调用技能」两组,分离渗透效应;
  3. 技能设计优先补充精准输入定位、标准化输出校验逻辑,而非堆砌中间推理流程。

6.2 实验局限性

  1. 实验场景仅限办公文档/表格,结论不一定通用到纯推理类任务;
  2. 模型与运行环境耦合,无法拆分模型、环境独立变量;
  3. 回归机制人工单标注,无多人一致性校验;
  4. 仅少量栈与基准,样本覆盖有限。

7 结论

在5832组成对对照实验中,新增技能带来的回归样本抵消59%正向增益,单一平均通过率指标具备极强误导性。
回归分为三类可观测机制:仅描述存在的渗透干扰、技能调用后输入读取偏移、技能抑制原生输出校验;绝大多数退化与持续失败集中在输入、输出两端,而非传统技能聚焦的中间推理流程。
本文提出两项标准化改进方案:

  1. 智能体技能评估必须同时报告增益、回归双向任务数量;
  2. 技能开发优先补充输入定位、结果校验逻辑,大幅降低回归代价,提升整体可靠性。

附录A 实验复现配置

1 模型调用地址

OpenCode:minimax/minimax-m2.7
Codex:openai/gpt-5.4-mini
Claude Code:anthropic/claude-sonnet-4.6

2 实验运行完整脚本

实验调度、轨迹提取、回归标注、打分重计算脚本随开源artifact包提供;
运行启动命令:

# 完整对照实验批量执行python run_benchmark.py--bench[OfficeQA/Spreadsheet]--stack[opencode/codex/claude]--skill_lib[anthropic/openai/ours/none]# 回归样本自动标注工具python regression_label.py--trajectory_dir./run_logs# 表格完整引擎重打分脚本python recalc_spreadsheet.py--workbook_path./task_files

3 数据集获取

OfficeQA-Pro、SpreadsheetBench完整任务文件:项目开源仓库data目录

4 统计计算代码

麦克内马尔检验、Bonferroni校正、置信区间计算脚本:analysis/stat_test.py

附录B 典型完整回归案例

B1 输入定位偏移案例(UID0025)

任务:1934与1946公共工程支出绝对差值,真值142
无技能执行:读取549、407,差值142(正确)
加载技能调用导航流程:读取949、407,差值542(错误)
计算逻辑完全一致,仅输入表格区间被技能干扰。

B2 校验抑制偏移案例(UID0086)

任务:季度环比绝对变化率,真值4.815
无技能:输出+4.815(匹配绝对值要求)
调用技能:输出-4.816,数值精度一致但忽略「绝对」校验规则。

B3 表格打分缺陷案例(任务10452)

无技能使用INDEX/MATCH函数,打分工具可解析判定正确;
加载技能使用AGGREGATE函数,原生打分无法解析判错;
完整gnumeric引擎重算后结果完全匹配标准答案。

附录C 技能描述渗透典型案例

C1 Office UID0096

任务:1939-1941关税移动平均值,真值37.708%
三套技能库全程未调用技能,仅提示词包含revised描述;
全部模型输出38.757%,统一偏移。

C2 表格任务31628

要求提取日期当月数字,标准答案10;
无技能直接输出10;
加载技能但从未调用,描述包含数字格式化关键词,全部输出Excel序列号45301。