开源模型◆ AI 生成 · 已溯源
gpt-oss-120b / gpt-oss-20b 及其安全增强版 gpt-oss-safeguard 发布:Apache 2.0 许可的开源推理模型

结论前置 / TL;DR
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两个 Apache 2.0 许可的开源权重推理模型,性能优于同规模开源模型;同步推出基于其微调的安全专用模型 gpt-oss-safeguard-120b / gpt-oss-safeguard-20b,支持策略驱动的内容标注。
模型定位与许可
- gpt-oss-120b 和 gpt-oss-20b 是 OpenAI 推出的两个开源权重(open-weight)语言模型,采用 Apache 2.0 许可协议,并受额外的 gpt-oss 使用政策约束。
- 二者定位为高性价比推理模型,在真实场景中表现强劲,尤其在数学推理、代码生成与多步逻辑任务上显著优于同参数量级的开源竞品(如 Llama-3-70b、Qwen2-72b)。
部署与能力优化
- 模型经结构与量化优化,可在消费级硬件(如单卡 RTX 4090)高效部署:gpt-oss-20b 支持 FP16 全精度推理,gpt-oss-120b 支持 4-bit AWQ 量化推理。
- 具备强工具调用(tool use)能力,原生支持 JSON Schema 输出与函数调用协议,适配 Agent 场景。
安全增强分支:gpt-oss-safeguard
- gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b 是基于对应 gpt-oss 主干模型进行后训练(post-training)的安全专用变体。
- 其核心能力是依据给定策略文档(policy document)进行推理并执行内容标注(content labeling),例如对输入文本按暴力、欺诈、隐私泄露等维度打标。
- 技术报告中提供了基线安全评估结果,以原始 gpt-oss 模型为对照组,验证了 safeguard 版本在策略一致性、拒绝率与误标率上的显著提升。