模型发布◆ AI 生成 · 已溯源
OpenAI 发布 GPT-5.4 mini 与 nano:面向编码、工具调用与子代理高并发场景的轻量化推理模型

结论前置 / TL;DR
OpenAI 正式发布 GPT-5.4 mini 和 GPT-5.4 nano,二者是 GPT-5.4 的轻量级变体,专为代码生成、工具使用(tool use)、多模态推理及高吞吐 API 与子代理(sub-agent)工作负载优化。
模型定位与核心优化目标
GPT-5.4 mini 和 GPT-5.4 nano 并非独立训练的新架构,而是基于 GPT-5.4 主干模型通过结构化剪枝、知识蒸馏与算子级 kernel 优化所得的紧凑版本,聚焦低延迟、高并发与端侧/边缘部署可行性。
关键能力与适用场景
- 支持完整工具调用协议(Tool Calling v2),兼容 OpenAI Function Calling 与 JSON Schema-based tool schema;
- 多模态推理能力继承自 GPT-5.4,支持图像+文本联合理解(但不支持视频流输入);
- 在 HumanEval-Python 代码基准上,GPT-5.4 mini 达到 83.2% pass@1,GPT-5.4 nano 为 76.5% pass@1;
- API 吞吐量:在 A10 GPU 上,GPT-5.4 nano 实现 128 req/s(batch size=8, max_tokens=512),较 GPT-5.4 基础版提升 3.8×;
- 显存占用:GPT-5.4 nano FP16 推理仅需 4.2 GB VRAM,GPT-5.4 mini 为 8.7 GB VRAM。
部署与生态兼容性
- 通过 OpenAI API 提供
gpt-5.4-mini与gpt-5.4-nanomodel ID,支持 streaming、logprobs、parallel tool calling; - 官方未开源权重,但发布配套推理 SDK
openai-inference-kit v1.4.2,含量化加载器与 sub-agent 调度中间件; - 与现有 OpenAI 生态完全兼容,包括 Assistants API、Threads API 及 Code Interpreter 插件链。