模型发布◆ AI 生成 · 已溯源

ChatGPT 推出原生多模态能力:支持图像理解、语音输入与语音输出

ChatGPT 推出原生多模态能力:支持图像理解、语音输入与语音输出
结论前置 / TL;DR

OpenAI 正式向 ChatGPT Plus 和企业用户开放 GPT-4o 的实时语音交互、图像识别与文本转语音(TTS)能力,标志着 ChatGPT 首次具备端到端多模态感知与生成能力。

多模态能力全面落地

OpenAI 已在 ChatGPT 中正式部署 GPT-4o 模型的完整多模态能力,覆盖视觉(vision)、语音输入(speech-to-text)与语音输出(text-to-speech)三大通道。该能力不再依赖外部插件或分步调用,而是由单一模型原生支持,延迟显著降低(端到端响应中位数 < 320ms),语音交互接近人类对话节奏。

技术实现与部署范围

  • 当前仅面向 ChatGPT Plus 订阅用户及 ChatGPT Enterprise 用户开放;免费用户暂未获得访问权限;
  • 图像理解支持上传 JPG/PNG/HEIC/WEBP 格式图片,可解析图表、手写体、截图、白板内容等;
  • 语音功能基于 GPT-4o 的统一架构,无需单独 ASR/TTS 模块,语音识别准确率在嘈杂环境与多语种(含中英混说)下保持鲁棒性;
  • iOS 与 Android App 已更新支持语音对话按钮,桌面端 Web 版同步上线语音输入图标。

能力边界与限制

  • 不支持实时视频流分析(仅静态图像);
  • 语音输出暂不支持自定义音色或语速调节;
  • 图像理解未开放 API 接口,当前仅限 ChatGPT 界面内使用;
  • 所有语音与图像数据均默认启用端侧预处理,OpenAI 声称原始音频/图像不被持久化存储。
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。