大模型◆ AI 生成 · 已溯源
多少任务量足以支撑智能体基准测试的决策?——对 SWE-bench、AppWorld 和 tau-bench 的重放分析

结论前置 / TL;DR
在 LLM 智能体基准测试中,仅靠任务完成比例无法保证部分评估结果与全量评估结论一致;重放分析显示:AppWorld 在 15% 任务量下即可满足严格决策一致性要求,tau-bench 需 25%,而 SWE-bench Verified 需高达 90%,SWE-bench Lite 即使在 95% 任务量下仍不满足主覆盖规则。
核心问题:部分评估能否替代全量基准测试?
LLM 智能体基准测试(如 SWE-bench、AppWorld、tau-bench)常需运行全部任务后才进行模型间 pairwise 比较,但评估成本高昂,促使研究者采用部分任务子集。本文指出:单纯报告‘已完成 X% 任务’无法说明该子集是否支持与全量基准相同的统计决策结论。
方法论:基于真实任务级日志的重放分析
- 使用已公开的完整任务级执行记录(task-level records),对三个主流基准进行系统性重放:SWE-bench(含 Verified 和 Lite 两个变体)、AppWorld、tau-bench;
- 定义‘足够任务量’为同时满足三项条件:
- 支持与全量基准完全一致的 pairwise 决策(即排序/胜出关系不变);
- 覆盖所有必需的任务组(required task groups);
- 未决比较(unresolved comparisons)占比 ≤ 目标阈值(本文设为 0%);
- 评估网格采用 5 个百分点步长(5% budget grid),并在 0% 严格阈值下判定首次达标点。
关键发现:任务效率差异巨大,无通用压缩比
- AppWorld:首个满足全部条件的任务比例为 15%;
- tau-bench:需 25%;
- SWE-bench Verified:需 90%;
- SWE-bench Lite:即使运行至 95%,仍无法满足主覆盖规则(primary coverage rule)下的全部目标。
实践建议:部分评估报告必须明确五要素
任何 partial-evaluation 报告应清晰声明:
- 一代理需比另一代理高出的最小性能差(e.g., accuracy gap);
- 任务采样策略(如随机、分层、难度加权);
- 所采用的覆盖规则(coverage rule);
- 决策规则(decision rule),如 majority vote / statistical significance threshold;
- 允许残留的未决比较数量或比例。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12338