大模型◆ AI 生成 · 已溯源
论文 VISTA:让工具智能体“看见自己的上下文”——不训练也能自管理记忆

结论前置 / TL;DR
arXiv:2606.30005 提出 VISTA:长程工具智能体受限于上下文膨胀,而模型对自身上下文“本体盲视”。VISTA 用免训练、模型无关的接口把工作记忆表示为可寻址块,让模型自己做保留/丢弃决策。
问题:模型对自己的上下文“本体盲视”
长程工具智能体的瓶颈,在于上下文不断膨胀逼近窗口上限。近来的系统把上下文管理交给智能体或系统层,但要么学一个会“丢证据”的压缩策略,要么在智能体看不见的层里管理。这篇论文(arXiv:2606.30005)指出一个更基础的缺口:前沿模型对自己的上下文是“本体盲视(proprioceptively blind)”的——仅从 prompt,它看不到每一块上下文有多大、多旧、被用过几次,而这些正是“保留还是丢弃”所需的信号。
假设:能力已在,缺的是“接口”
作者的核心假设是:称职的上下文管理能力其实已潜藏在强模型里,缺的不是一个学出来的策略,而是一个把这些状态暴露出来的接口。
方法:VISTA——可见的内部状态
VISTA(Visible Internal State for Tool Agents)是一个免训练、模型无关的层:
- 把工作记忆表示为有类型、可寻址的块(typed, addressable blocks);
- 给出一个运行时仪表盘,展示每块的 token 用量、新近度、访问历史;
- 把块归档为可完整恢复的载荷(丢弃后仍可找回,不丢证据)。
在 LOCA-Bench、BrowseComp-Plus、GAIA 三个基准上,这套同一个未经训练的接口就能让模型自行做出更好的上下文取舍。VISTA 的意义在于:把“上下文管理”从“再训一个策略”降维成“给模型一块可见的状态仪表盘”,让模型用自己已有的能力去管理记忆——对做长程 Agent 的工程实践很有借鉴。
来源溯源(合规留痕)
https://arxiv.org/abs/2606.30005