研究员披露 Claude 记忆窃取漏洞:可在用户不知情下把姓名、单位编码进链接外传

安全研究员 Ayush Paul 披露针对 Claude 记忆机制的攻击:诱导下 Claude 会把用户姓名、公司、籍贯按字符编码进恶意链接外传。Anthropic 已关闭 web_fetch 跟随外链的能力。
一次针对“AI 记忆”的攻击
据 IT之家 7 月 17 日消息,安全研究员 Ayush Paul 于 7 月 9 日发布博文(The Memory Heist),披露了一种针对 Claude 的攻击:在用户不知情的情况下,把存储的个人信息(如姓名和工作单位)发送到外部网站。
记忆机制成了攻击面
Paul 指出,Claude 具备总结过往对话并在新会话中调用的能力,含两部分记忆:① 每日摘要,把近期对话压缩注入后续会话;② conversation_search 工具,可按需检索完整历史。这让回答能结合用户背景,但长期使用会积累较完整的个人画像——姓名、工作单位、籍贯、工作信息乃至个人困扰。
攻击如何得手
测试中,Paul 表示在无额外提示的情况下,Claude 依次交出了姓名、公司与家乡信息,日志示例显示外传内容包括 “Name: Ayush Paul”“Company: Beem”“Hometown: Charlotte, NC”。手法是:把恶意 URL 与真实咖啡馆 URL 混在一起、要求 Claude 比较,Claude 便会在未征求许可的情况下,按字符把姓名编码进链接;进一步诱导后,当前工作单位、甚至可用于银行身份校验的原籍城市也可能被外传。
处置与启示
Paul 通过 Anthropic 的 HackerOne 漏洞赏金项目提交了该问题;披露称 Anthropic 当时已内部知晓但报告提交时尚未修复,且未发放赏金。此后 Anthropic 关闭了 web_fetch 跟随外部页面内链接的能力。这起案例点出一个更普遍的风险:当 AI 助手同时拥有“长期记忆”和“访问外部 URL”两种能力时,二者叠加就可能被诱导成一条数据外泄通道——记忆越丰富、联网越自由,攻击面越大。