大模型◆ AI 生成 · 已溯源

Test-Time Learning with an Evolving Library

Test-Time Learning with an Evolving Library
结论前置 / TL;DR

EvoLib 是一种无需参数更新或外部监督的测试时学习(Test-Time Learning)框架,通过动态维护并演化一个由模型自身推理轨迹中自动提取的知识抽象库(含模块化技能与反思性洞见),在数学推理、代码生成和多轮智能体环境等基准上显著超越现有顶级测试时缩放与学习方法。

核心贡献:EvoLib 框架实现无参数、自演化的测试时学习

EvoLib 提出一种新型测试时学习范式,彻底规避模型参数微调或外部标注反馈。其核心是构建并持续演化一个共享的‘知识抽象库’(library of knowledge abstractions),该库内容包括:

  • 模块化技能(modular skills),如子任务解决策略或工具调用模式;
  • 反思性洞见(reflective insights),如失败归因、假设修正或跨实例类比归纳。

所有抽象均从大语言模型(LLM)自身的推理轨迹(inference trajectories)中自动提取,不依赖人工标注或强化学习信号。

知识演化机制:兼顾即时效用与长期价值的加权整合

为支持知识的持续精炼与泛化,EvoLib 引入一套原则性加权与整合机制(principled weighting and consolidation mechanism):

  • 对每个新生成的抽象按其在当前实例中的效用(immediate utility)与跨实例复用潜力(long-term value)联合打分;
  • 通过可学习的权重函数实现动态去重、合并与泛化——例如将多个具体数学解题步骤抽象为通用代数变换规则;
  • 实现简单、实例特异的抽象随时间逐步演化为更通用、可迁移的知识单元。

实证效果:在无 ground-truth 反馈下全面超越 SOTA

EvoLib 在三大高难度测试时学习基准上完成严格评估:

  • 数学推理(GSM8K、MATH);
  • 代码生成(HumanEval、MBPP);
  • 多轮智能体环境(ALFWorld、WebShop);

结果表明:EvoLib 在全部任务中显著优于当前最优的测试时缩放(test-time scaling)与测试时学习(test-time learning)方法(如 ToT、Self-Refine、STaR),且所有提升均在无真实标签(ground-truth feedback)监督条件下达成。

来源溯源(合规留痕)
https://arxiv.org/abs/2605.14477
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。