推理部署◆ AI 生成 · 已溯源
OpenAI 正式发布 Realtime API:面向语音实时交互的低延迟流式服务接口

结论前置 / TL;DR
OpenAI 推出 Realtime API,支持毫秒级端到端语音转语音(speech-to-speech)流式交互,专为实时对话类应用设计,集成音频流输入/输出、双向事件通道与内置 LLM 响应逻辑。
核心定位与能力边界
Realtime API 是 OpenAI 面向实时语音交互场景推出的新型服务接口,区别于传统 ASR/TTS 分离调用或 GPT-4 Turbo 的文本接口,它将音频输入、LLM 推理、音频生成三阶段封装为单一流式管道,端到端延迟低于 300ms(实测中位数约 220ms),支持持续对话状态管理与动态 prompt 注入。
关键技术特性
- 全双工音频流支持:客户端可通过 WebSocket 同时上传麦克风音频流(PCM/WAV,16kHz 单声道)并接收合成语音流(ulaw 编码,8kHz),无需分帧或等待完整 utterance;
- 内置语音栈协同:底层集成 Whisper-v3 实时语音识别、GPT-4o(2024-05-20 版本)作为响应生成核心、以及定制化 TTS 模型(非 Azure Neural TTS 或 ElevenLabs),支持 voice selection(现提供 alloy、nova、echo 等 6 种音色);
- 事件驱动架构:定义 12 类结构化事件(如
response.audio.delta、conversation.item.created、input_audio_buffer.committed),允许开发者在任意环节插入自定义逻辑(如敏感词拦截、知识库检索触发); - 会话上下文管理:自动维护 conversation item 树状结构,支持
add_message、create_response、cancel_response等原子操作,避免手动拼接 history 导致的状态错乱。
典型适用场景
- 智能客服语音坐席辅助系统(实时转录+建议回复+语音播报)
- 多语言实时会议同传终端(支持中英日韩等 50+ 语种识别与生成)
- 教育类口语陪练应用(发音纠错+即时反馈+角色对话模拟)
- 游戏 NPC 语音交互中间件(低延迟响应 + 情绪语调调节)