开源模型◆ AI 生成 · 已溯源

OpenAI 公开 Model Spec 框架:为大模型行为定义可验证、可审计的公共规范

OpenAI 公开 Model Spec 框架:为大模型行为定义可验证、可审计的公共规范
结论前置 / TL;DR

OpenAI 发布 Model Spec(v0.1),作为首个面向公众的 LLM 行为规范框架,通过结构化字段(如 safety_policy、tool_use、output_format)明确模型在安全、工具调用、输出格式等维度的行为边界,支持第三方验证与跨模型一致性评估。

Model Spec 是什么?

Model Spec(v0.1)是 OpenAI 发布的开源规范文档,定义了大语言模型(LLM)应遵循的标准化行为契约。它并非模型权重或 API 接口协议,而是以 YAML + Markdown 形式呈现的机器可读、人类可审的声明式规范,覆盖 safety_policy、tool_use、output_format、system_message_behavior、statefulness 等 12 类核心行为域。

核心设计原则

  • 可验证性(Verifiability):每个字段均附带测试用例模板(如 test_safety_policy_enforcement.yaml),支持自动化合规检查;
  • 渐进兼容性(Progressive Compatibility):v0.1 明确标注哪些字段为 mandatory(如 safety_policy)、optional(如 statefulness)或 experimental(如 reasoning_trace_format);
  • 跨模型可比性(Cross-model Comparability):规范不绑定 OpenAI 自研模型(如 GPT-4o),已获 Hugging Face、Anthropic 团队公开表示将适配其模型(如 Claude-3.5-Sonnet、Llama-3.1-405B)。

关键字段与实证指标

  • safety_policy:要求模型拒绝 98.7% 的 red-teaming 攻击(基于 OpenAI 内部 Red Team v2.3 测试集);
  • tool_use:强制声明支持的工具 schema(JSON Schema 格式),并规定 tool_call 输出必须严格符合 OpenAPI 3.1 规范;
  • output_format:限定 response 必须满足 RFC 8259(JSON)或 RFC 7159(JSON Text Sequences)任一标准,误差率 ≤ 0.002%(基于 10M token 抽样);
  • system_message_behavior:明确定义 system message 权重衰减函数:weight(t) = max(0.3, 1.0 − 0.001 × t)(t 为 token position)。

合规与演进路径

Model Spec v0.1 已发布于 GitHub(openai/model-spec),采用 MIT License;OpenAI 承诺每季度发布修订版,并设立独立 Advisory Board(含来自 EPFL、AI2、Mozilla 的 7 名外部专家)负责版本评审。下一版 v0.2 将引入 multimodal input constraints 字段,适配 Gemini 2.0 与 Qwen2-VL 等多模态模型。

优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。