大模型◆ AI 生成 · 已溯源

面向函数感知的中段填充(FIM)作为编码智能体基础模型的中期训练方法

面向函数感知的中段填充(FIM)作为编码智能体基础模型的中期训练方法
结论前置 / TL;DR

Qwen2.5-Coder-Instruct(7B/14B)与Qwen3-8B经函数感知Fill-in-the-Middle(FIM)中期训练后,在SWE-Bench-Verified上分别提升+2.8/+3.0和+3.2,在SWE-Bench-Lite上提升+3.7/+4.0/+5.4,效果跨R2E-Gym与SWE-Smith两种后训练流程且泛化至非Qwen2.5基座模型。

核心动机:编码智能体需建模「调用-返回-消费」结构

标准左到右代码预训练仅单向暴露工具调用能力,而真实编码智能体依赖「动作-观测-延续」闭环——该结构在程序语义层面等价于函数调用站点(caller绑定参数 → callee异地计算并返回值 → downstream代码消费该值),且此类模式在互联网规模开源代码中天然海量存在。

方法:函数感知Fill-in-the-Middle(FIM)中期训练

  • 基于程序依赖图分析 + 复杂度-可推断性双重判据,自动识别并掩码高信息密度函数体;
  • 在2.6B token去污染语料(采自968个GitHub仓库)上对Qwen2.5-Coder-Instruct(7B/14B)与Qwen3-8B执行自监督中期训练;
  • 保持原有agentic post-training pipeline(R2E-Gym / SWE-Smith)不变,仅插入该中期训练阶段。

实证效果

  • SWE-Bench-Verified:+2.8(Qwen2.5-Coder-Instruct-7B)、+3.0(14B)、+3.2(Qwen3-8B);
  • SWE-Bench-Lite:+3.7(7B)、+4.0(14B)、+5.4(Qwen3-8B);
  • 效果稳定跨两种后训练流程,并在非Qwen2.5基座模型上验证泛化性;
  • 论文编号:arXiv:2607.12463v1。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12463
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。