大模型◆ AI 生成 · 已溯源

多少任务量足以支撑智能体基准测试的决策?——对 SWE-bench、AppWorld 和 tau-bench 的重放分析

多少任务量足以支撑智能体基准测试的决策?——对 SWE-bench、AppWorld 和 tau-bench 的重放分析
结论前置 / TL;DR

在 LLM 智能体基准测试中,仅靠任务完成比例无法保证部分评估结果与全量评估结论一致;重放分析显示:AppWorld 在 15% 任务量下即可满足严格决策一致性要求,tau-bench 需 25%,而 SWE-bench Verified 需高达 90%,SWE-bench Lite 即使在 95% 任务量下仍不满足主覆盖规则。

核心问题:部分评估能否替代全量基准测试?

LLM 智能体基准测试(如 SWE-bench、AppWorld、tau-bench)常需运行全部任务后才进行模型间 pairwise 比较,但评估成本高昂,促使研究者采用部分任务子集。本文指出:单纯报告‘已完成 X% 任务’无法说明该子集是否支持与全量基准相同的统计决策结论。

方法论:基于真实任务级日志的重放分析

  • 使用已公开的完整任务级执行记录(task-level records),对三个主流基准进行系统性重放:SWE-bench(含 Verified 和 Lite 两个变体)、AppWorld、tau-bench;
  • 定义‘足够任务量’为同时满足三项条件:
  • 支持与全量基准完全一致的 pairwise 决策(即排序/胜出关系不变);
  • 覆盖所有必需的任务组(required task groups);
  • 未决比较(unresolved comparisons)占比 ≤ 目标阈值(本文设为 0%);
  • 评估网格采用 5 个百分点步长(5% budget grid),并在 0% 严格阈值下判定首次达标点。

关键发现:任务效率差异巨大,无通用压缩比

  • AppWorld:首个满足全部条件的任务比例为 15%
  • tau-bench:需 25%
  • SWE-bench Verified:需 90%
  • SWE-bench Lite:即使运行至 95%,仍无法满足主覆盖规则(primary coverage rule)下的全部目标。

实践建议:部分评估报告必须明确五要素

任何 partial-evaluation 报告应清晰声明:

  • 一代理需比另一代理高出的最小性能差(e.g., accuracy gap);
  • 任务采样策略(如随机、分层、难度加权);
  • 所采用的覆盖规则(coverage rule);
  • 决策规则(decision rule),如 majority vote / statistical significance threshold;
  • 允许残留的未决比较数量或比例。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12338
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。