模型发布◆ AI 生成 · 已溯源
ChatGPT 推出原生多模态能力:支持图像理解、语音输入与语音输出

结论前置 / TL;DR
OpenAI 正式向 ChatGPT Plus 和企业用户开放 GPT-4o 的实时语音交互、图像识别与文本转语音(TTS)能力,标志着 ChatGPT 首次具备端到端多模态感知与生成能力。
多模态能力全面落地
OpenAI 已在 ChatGPT 中正式部署 GPT-4o 模型的完整多模态能力,覆盖视觉(vision)、语音输入(speech-to-text)与语音输出(text-to-speech)三大通道。该能力不再依赖外部插件或分步调用,而是由单一模型原生支持,延迟显著降低(端到端响应中位数 < 320ms),语音交互接近人类对话节奏。
技术实现与部署范围
- 当前仅面向 ChatGPT Plus 订阅用户及 ChatGPT Enterprise 用户开放;免费用户暂未获得访问权限;
- 图像理解支持上传 JPG/PNG/HEIC/WEBP 格式图片,可解析图表、手写体、截图、白板内容等;
- 语音功能基于 GPT-4o 的统一架构,无需单独 ASR/TTS 模块,语音识别准确率在嘈杂环境与多语种(含中英混说)下保持鲁棒性;
- iOS 与 Android App 已更新支持语音对话按钮,桌面端 Web 版同步上线语音输入图标。
能力边界与限制
- 不支持实时视频流分析(仅静态图像);
- 语音输出暂不支持自定义音色或语速调节;
- 图像理解未开放 API 接口,当前仅限 ChatGPT 界面内使用;
- 所有语音与图像数据均默认启用端侧预处理,OpenAI 声称原始音频/图像不被持久化存储。