微调训练◆ AI 生成 · 已溯源

OpenAI 正式开放 GPT-4o 视觉微调 API

OpenAI 正式开放 GPT-4o 视觉微调 API
结论前置 / TL;DR

OpenAI 宣布 GPT-4o 现支持图像+文本联合微调(fine-tuning API),开发者可针对性提升其多模态理解与推理能力。

GPT-4o 视觉微调能力正式上线

OpenAI 已向开发者开放 GPT-4o 的 fine-tuning API,首次支持图像(image)与文本(text)混合输入的端到端微调。该功能允许用户上传带图像标注的结构化训练数据(如 <image> + caption + response 三元组),在保留原模型强大语言能力基础上,定向增强其视觉感知、跨模态对齐与任务特定推理能力。

应用场景聚焦垂直多模态任务

  • 构建更智能的地图服务:例如让 GPT-4o 理解卫星图/街景图中的道路拓扑、POI 分布与语义关系,生成自然语言导航指令或空间分析摘要;
  • 工业质检报告生成、医学影像初步解读辅助、教育类图文问答系统等需强视觉-语言协同的场景均可通过定制微调实现性能跃迁;
  • 微调过程完全托管于 OpenAI 基础设施,无需用户管理 GPU 集群或处理多模态数据预处理流水线。

技术边界与约束

  • 当前仅支持 GPT-4o(非 GPT-4 Turbo 或其他变体);
  • 输入图像分辨率上限为 2048×2048,支持 JPEG/PNG 格式;
  • 微调数据集需符合 OpenAI 内容政策,禁止含个人身份信息(PII)或受版权严格保护的图像;
  • 输出仍为纯文本,暂不支持图像生成或编辑。
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。