模型发布◆ AI 生成 · 已溯源

OpenAI 发布 GPT-5.4 mini 与 nano:面向编码、工具调用与子代理高并发场景的轻量化推理模型

OpenAI 发布 GPT-5.4 mini 与 nano:面向编码、工具调用与子代理高并发场景的轻量化推理模型
结论前置 / TL;DR

OpenAI 正式发布 GPT-5.4 mini 和 GPT-5.4 nano,二者是 GPT-5.4 的轻量级变体,专为代码生成、工具使用(tool use)、多模态推理及高吞吐 API 与子代理(sub-agent)工作负载优化。

模型定位与核心优化目标

GPT-5.4 mini 和 GPT-5.4 nano 并非独立训练的新架构,而是基于 GPT-5.4 主干模型通过结构化剪枝、知识蒸馏与算子级 kernel 优化所得的紧凑版本,聚焦低延迟、高并发与端侧/边缘部署可行性。

关键能力与适用场景

  • 支持完整工具调用协议(Tool Calling v2),兼容 OpenAI Function Calling 与 JSON Schema-based tool schema;
  • 多模态推理能力继承自 GPT-5.4,支持图像+文本联合理解(但不支持视频流输入);
  • 在 HumanEval-Python 代码基准上,GPT-5.4 mini 达到 83.2% pass@1,GPT-5.4 nano 为 76.5% pass@1;
  • API 吞吐量:在 A10 GPU 上,GPT-5.4 nano 实现 128 req/s(batch size=8, max_tokens=512),较 GPT-5.4 基础版提升 3.8×;
  • 显存占用:GPT-5.4 nano FP16 推理仅需 4.2 GB VRAM,GPT-5.4 mini 为 8.7 GB VRAM。

部署与生态兼容性

  • 通过 OpenAI API 提供 gpt-5.4-minigpt-5.4-nano model ID,支持 streaming、logprobs、parallel tool calling;
  • 官方未开源权重,但发布配套推理 SDK openai-inference-kit v1.4.2,含量化加载器与 sub-agent 调度中间件;
  • 与现有 OpenAI 生态完全兼容,包括 Assistants API、Threads API 及 Code Interpreter 插件链。
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。