ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models 论文完整整理一、论文核心内容总览1. 研究背景当前代码智能体(SWE Agent)的性能提升完全依赖**后训练(post-training)**阶段合成工具交互轨迹数据,但基座代码大模型仅通过普通从左到右预训练+随机片段FIM填充,缺少适配智能体「动作→工具观测→后续推理」循环的结构先验;普通随机FIM存在三大缺陷:掩码边界语法无规则、无推理监督、预训练阶段信号被海量无关token稀释,导致后训练后模型通用编码、工具调用能力大幅退化。2. 核心核心假设(核心立论)代码智能体单步推理循环与函数调用结构同构,均分为四段:智能体:历史上下文 → 执行动作 → 工具返回观测 → 后续推理函数调用:调用前置代码 → 函数调用 → 被调函数返回值 → 下游消费返回值代码海量开源代码天然包含这种结构,可通过函数粒度感知的FIM中间训练,提前给模型植入适配智能体的结构归纳偏置,弥补预训练与智能体后训练之间的训练断层。
返回列表