大模型◆ AI 生成 · 已溯源

PM-Bench:面向大语言模型智能体的前瞻性记忆评测基准

PM-Bench:面向大语言模型智能体的前瞻性记忆评测基准
结论前置 / TL;DR

arXiv 论文 arXiv:2607.12385v1 提出 PM-Bench —— 首个基于认知科学 Virtual Week 范式构建的文本型前瞻性记忆(prospective memory)评测基准,用于系统评估 LLM 智能体在持续任务中维持、延迟执行与环境监控意图的能力;GPT-5.4 在该基准上最高仅达 65.1% F1,且无通用优化策略普适于所有模型。

前瞻性记忆:智能体可靠性的关键缺口

前瞻性记忆(prospective memory)指智能体在执行主任务的同时,记住并适时响应未来特定线索或状态的能力——这是现实世界中自主智能体(如个人助理、自动化运维代理)可靠运行的核心前提,但长期缺乏标准化评测手段。

PM-Bench 设计:模拟七日认知负荷场景

  • 基于认知心理学经典 Virtual Week 范式构建,模拟连续七天的文本化日常环境;
  • 要求 LLM 智能体在持续进行主线活动(如邮件处理、日程协调)过程中,动态判断预设延迟任务(如‘当收到 CEO 邮件时提醒会议’)是否触发;
  • 显式测试三类能力:意图保持(intention maintenance)、延迟执行(delayed execution)、潜在线索监测(latent cue monitoring)。

严苛实证:当前 SOTA 模型仍存在根本性瓶颈

  • 在 8 种主流 LLM(含 GPT-5.4、Claude-3.5-Sonnet、Llama-3.1-405B、Gemini-2.0-Pro 等)与 8 类 agent 架构(ReAct、Reflexion、Plan-and-Execute 等)组合下全面评测;
  • 所有配置均表现不佳:最佳结果为 GPT-5.4 + 自适应监控策略,F1 仅 65.1%;
  • 关键发现:提升前瞻性记忆的策略(如显式时间戳嵌入、外部记忆缓存、自我反思触发)效果高度依赖模型与架构,无跨模型主导方案。

开源价值:可控诊断与干预试验台

  • PM-Bench 已开源,提供标准化 prompt template、环境模拟器、评估脚本及基线结果;
  • 定位为 controlled testbed,支持在训练阶段(如指令微调引入 PM-aware data)或推理阶段(如设计 cue-aware planning loop)开展可复现干预实验。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12385
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。