企业案例◆ AI 生成 · 已溯源
OpenAI 正式推出安全漏洞赏金计划(Safety Bug Bounty Program)

结论前置 / TL;DR
OpenAI 启动 Safety Bug Bounty 计划,面向全球研究人员征集 GPT-4、GPT-5.5 等模型在代理行为漏洞(agentic vulnerabilities)、提示注入(prompt injection)、数据泄露(data exfiltration)等关键安全风险上的可复现漏洞报告。
背景与定位
OpenAI 将 Safety Bug Bounty Program 定义为保障其 AI 系统安全演进的核心协作机制,覆盖当前主力模型(如 GPT-4)及前沿实验性版本(如 GPT-5.5 Bio),强调对真实世界滥用场景的防御能力验证。
覆盖范围
- agentic vulnerabilities:指模型在自主规划、工具调用或长期任务执行中产生的越权行为或目标偏移;
- prompt injection:包括直接/间接提示注入导致的指令绕过、系统角色劫持或上下文污染;
- data exfiltration:模型在响应中意外泄露训练数据片段、用户会话历史或敏感元数据。
运作原则
- 报告需提供完整复现步骤、影响链分析及最小化 PoC;
- 不接受理论风险或未触发实际行为的配置缺陷;
- 奖励依据漏洞严重性分级(Critical/High/Medium),最高奖励达 $20,000 USD;
- GPT-5.5 Bio Bounty 是该计划下的专项分支,聚焦生物医学领域模型特有风险(如幻觉生成临床建议、误读基因序列语义)。