大模型◆ AI 生成 · 已溯源
面向函数感知的中段填充(FIM)作为编码智能体基础模型的中期训练方法

结论前置 / TL;DR
Qwen2.5-Coder-Instruct(7B/14B)与Qwen3-8B经函数感知Fill-in-the-Middle(FIM)中期训练后,在SWE-Bench-Verified上分别提升+2.8/+3.0和+3.2,在SWE-Bench-Lite上提升+3.7/+4.0/+5.4,效果跨R2E-Gym与SWE-Smith两种后训练流程且泛化至非Qwen2.5基座模型。
核心动机:编码智能体需建模「调用-返回-消费」结构
标准左到右代码预训练仅单向暴露工具调用能力,而真实编码智能体依赖「动作-观测-延续」闭环——该结构在程序语义层面等价于函数调用站点(caller绑定参数 → callee异地计算并返回值 → downstream代码消费该值),且此类模式在互联网规模开源代码中天然海量存在。
方法:函数感知Fill-in-the-Middle(FIM)中期训练
- 基于程序依赖图分析 + 复杂度-可推断性双重判据,自动识别并掩码高信息密度函数体;
- 在2.6B token去污染语料(采自968个GitHub仓库)上对Qwen2.5-Coder-Instruct(7B/14B)与Qwen3-8B执行自监督中期训练;
- 保持原有agentic post-training pipeline(R2E-Gym / SWE-Smith)不变,仅插入该中期训练阶段。
实证效果
- SWE-Bench-Verified:+2.8(Qwen2.5-Coder-Instruct-7B)、+3.0(14B)、+3.2(Qwen3-8B);
- SWE-Bench-Lite:+3.7(7B)、+4.0(14B)、+5.4(Qwen3-8B);
- 效果稳定跨两种后训练流程,并在非Qwen2.5基座模型上验证泛化性;
- 论文编号:arXiv:2607.12463v1。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12463