综述◆ AI 生成 · 已溯源
把「隔离」当成 LLM 智能体安全的第一原则:一篇边界导向的综述

结论前置 / TL;DR
一篇 arXiv 综述提出:应把「隔离」作为 LLM 智能体系统安全的一等原则,并用「用户-智能体、智能体-工具、智能体-执行、智能体-智能体、系统-环境」五类边界统一梳理提示注入、工具滥用、记忆投毒等看似分散的攻击。
结论先行
当 LLM 智能体成为系统的「大脑」,安全就不再只是输入输出对齐,而是系统行为与真实执行结果的问题。这篇综述主张:用隔离这一条原则,把碎片化的攻击面统一起来。
五类边界
作者提出一个以边界为中心的分类,隔离体现在五个界面:
- 用户 ↔ 智能体
- 智能体 ↔ 工具
- 智能体 ↔ 执行
- 智能体 ↔ 智能体
- 系统 ↔ 环境
价值
- 解释了为什么提示注入、工具滥用、记忆投毒常常同源——都是某处「隔离」失守,并沿工作流扩散。
- 帮助定位:隔离最先在哪里失守、危害如何跨边界传播、每个界面最该上哪种防御。
- 提出「隔离即构造(isolation-by-construction)」的研究议程。
对做 Agent 系统与安全的团队,这套边界框架可直接用于威胁建模与防御选型。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12406