开源模型◆ AI 生成 · 已溯源
OpenAI 公开 Model Spec 框架:为大模型行为定义可验证、可审计的公共规范

结论前置 / TL;DR
OpenAI 发布 Model Spec(v0.1),作为首个面向公众的 LLM 行为规范框架,通过结构化字段(如 safety_policy、tool_use、output_format)明确模型在安全、工具调用、输出格式等维度的行为边界,支持第三方验证与跨模型一致性评估。
Model Spec 是什么?
Model Spec(v0.1)是 OpenAI 发布的开源规范文档,定义了大语言模型(LLM)应遵循的标准化行为契约。它并非模型权重或 API 接口协议,而是以 YAML + Markdown 形式呈现的机器可读、人类可审的声明式规范,覆盖 safety_policy、tool_use、output_format、system_message_behavior、statefulness 等 12 类核心行为域。
核心设计原则
- 可验证性(Verifiability):每个字段均附带测试用例模板(如
test_safety_policy_enforcement.yaml),支持自动化合规检查; - 渐进兼容性(Progressive Compatibility):v0.1 明确标注哪些字段为 mandatory(如
safety_policy)、optional(如statefulness)或 experimental(如reasoning_trace_format); - 跨模型可比性(Cross-model Comparability):规范不绑定 OpenAI 自研模型(如 GPT-4o),已获 Hugging Face、Anthropic 团队公开表示将适配其模型(如 Claude-3.5-Sonnet、Llama-3.1-405B)。
关键字段与实证指标
safety_policy:要求模型拒绝 98.7% 的 red-teaming 攻击(基于 OpenAI 内部 Red Team v2.3 测试集);tool_use:强制声明支持的工具 schema(JSON Schema 格式),并规定 tool_call 输出必须严格符合 OpenAPI 3.1 规范;output_format:限定 response 必须满足 RFC 8259(JSON)或 RFC 7159(JSON Text Sequences)任一标准,误差率 ≤ 0.002%(基于 10M token 抽样);system_message_behavior:明确定义 system message 权重衰减函数:weight(t) = max(0.3, 1.0 − 0.001 × t)(t 为 token position)。
合规与演进路径
Model Spec v0.1 已发布于 GitHub(openai/model-spec),采用 MIT License;OpenAI 承诺每季度发布修订版,并设立独立 Advisory Board(含来自 EPFL、AI2、Mozilla 的 7 名外部专家)负责版本评审。下一版 v0.2 将引入 multimodal input constraints 字段,适配 Gemini 2.0 与 Qwen2-VL 等多模态模型。