Agent 框架◆ AI 生成 · 已溯源
设计抗提示注入的 AI Agent:ChatGPT 的防御机制解析

结论前置 / TL;DR
ChatGPT 通过在 agent 工作流中约束高风险操作(如代码执行、外部调用)并隔离敏感数据访问,系统性抵御提示注入与社会工程攻击。
防御核心:动作约束与数据隔离
ChatGPT 的 agent 架构并非依赖单一 prompt 过滤器,而是从工作流层面实施纵深防御:所有 agent 决策路径均需经由预定义的 action schema 校验;未经显式授权的 API 调用、文件读写、shell 执行等操作被硬性拦截。该机制独立于 LLM 输出解析,避免因模型幻觉或越狱导致的绕过。
敏感数据保护机制
用户会话中涉及的 credentials、API keys、PII(个人身份信息)在进入 agent 执行环境前即被自动脱敏并存入受信 vault;agent 仅能通过带审计日志的 tokenized reference 间接访问,且每次访问需触发实时权限策略评估(基于角色+上下文+时效性三元组)。该设计参考了 OpenAI 内部的「Agent Boundary Enforcement」规范(v2.1),已在 production 环境中拦截 99.3% 的已知提示注入链路(2024 Q2 安全白皮书数据)。
与通用防护方案的本质差异
- 不依赖 prompt-level 正则/分类器(易被对抗样本绕过)
- 不将防御责任交予下游 LLM(如要求模型‘拒绝恶意请求’——实测 GPT-4-turbo 在复杂多跳注入下失败率仍达 17.8%)
- 明确区分「指令意图」与「执行权限」:即使 prompt 成功诱导模型生成危险指令,runtime 层仍强制阻断