大模型◆ AI 生成 · 已溯源
SAFETY SENTRY:基于 EXECUTE-ASK-REFUSE 三路路由的上下文感知人工干预机制

结论前置 / TL;DR
Safety Sentry 是一种轻量级守卫模型,通过单次解码实现 per-instance 三分类路由(EXECUTE / ASK / REFUSE),在保持零重训练前提下支持跨部署风险阈值动态调节,在整体准确率与安全相关召回率上均超越主流开源及闭源基线模型。
问题本质:二元守卫范式存在结构性缺陷
LLM 智能体通过工具调用作用于现实环境,单次误判动作即可导致不可逆损害。当前主流防护方案依赖二元守卫模型(safe/unsafe),但该范式混淆了两个正交决策维度:① 动作本身是否具有内在危害性;② 动作在当前用户上下文下是否恰当。此外,其判断粒度停留在动作类别层级(如‘发送邮件’),而非具体实例(如‘向张三发送含敏感数据的邮件’),导致高频、低信息量中断,削弱用户自主性,并诱发对高危告警的‘习惯性忽略’。
方法创新:三路路由 + 单次解码轻量架构
Safety Sentry 将守卫任务重构为 per-instance 的三路路由决策:
- EXECUTE:动作安全且上下文适配,直接执行;
- ASK:动作本身无害但需用户确认上下文合理性(如隐私、时效、权限);
- REFUSE:动作存在内在危害性(如越权、泄露、破坏性操作),强制拒绝。
其核心是轻量级守卫模型,推理过程压缩至单次解码调用(single decoding call);仅需调节一个解码时阈值(decoding-time threshold),即可在同一固定 checkpoint 上灵活适配不同风险偏好部署场景(如医疗 vs. 客服),无需任何微调或重训练。
实证表现:兼顾精度、安全召回与误差控制
- 在 arXiv:2607.13594v1 报告的基准测试中,Safety Sentry 在整体准确率(overall accuracy)与安全相关召回率(safety-related recall)两项核心指标上,全面超越包括 Llama-Guard-3、Microsoft’s GPTGuard、Google’s Gemini Safety Classifier 等在内的开源与前沿闭源基线模型;
- 首次实现对两类方向性错误率(false EXECUTE 与 false REFUSE)的同时显式控制,避免‘过度保守’或‘过度放行’的系统性偏差。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.13594