推理框架◆ AI 生成 · 已溯源

阿里通义发布 Wan-Streamer v0.2:端到端 550ms 延迟的实时全模态“AI 视频电话”

阿里通义发布 Wan-Streamer v0.2:端到端 550ms 延迟的实时全模态“AI 视频电话”
结论前置 / TL;DR

通义实验室把“听、看、说、演”统一进单个 Transformer,端到端响应延迟约 550ms、画质提升到 640×368@25FPS,并用 Thinker/Performer 双通路解耦保证低延迟。

让 AI 像真人一样“边听边看边回应”

据 IT之家 7 月 17 日消息,阿里通义实验室发布 Wan-Streamer v0.2——面向实时双工交互的端到端全模态理解与生成模型,把“听、看、说、演”统一进单个 Transformer。三个关键指标:端到端响应延迟约 550ms(200ms 模型延迟 + 350ms 网络延迟);输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,微表情细节清晰;原生支持文本、音频、视频的实时理解与同步生成,无需外部模块拼装。团队称在响应延迟与功能覆盖(视频感知、视频输出、全双工、端到端且延迟控制在 1 秒内)上均优于常见实时交互系统。

关键机制:因果时间线 + 流式单元

Wan-Streamer 把用户的文本/音频/视频输入与智能体输出统一映射到同一条因果时间线(Causal Timeline)上,并引入流式单元(Streaming Unit):大约每 160ms 完成一次闭环——感知当前 160ms 音视频输入、更新共享交互状态与上下文、生成同步的语音与视频 Latent、解码输出上一单元的响应。也就是说,AI 不必等你说完再想,而是在你说话的每一小段时间里,同步完成“感知→理解→生成→解码”。这种原生流式建模,是极低延迟与全双工交互的基础。

提画质而不增延迟:Thinker / Performer 双通路解耦

v0.1 验证了端到端原生流式音视频对话的可行性,但 192×336 只能做近景特写。v0.2 把分辨率提升到 640×368——AI 不再是“悬浮的头部”,能看到视线方向、身体姿态、自然手势乃至房间布局。但高分辨率视频 Latent 计算量激增,若塞进原低延迟通路会击穿 200ms 模型侧底线。为此 v0.2 把模型拆成两条并行通路、在物理硬件上解耦:

  • 思考者 Thinker(单卡快车道):部署在单张 GPU 上,负责所有对延迟敏感的任务——流式音视频感知、语言与状态更新、构建 K/V 缓存、音频解码,保证 200ms 极低响应。
  • 执行者 Performer(多卡 Ulysses 并行):承担 640×368 高分辨率视频生成的重载计算,被扩展为多 GPU 的 Ulysses 式上下文并行集群,把长视频序列切分给多张显卡并行去噪。

用“单卡管低延迟、多卡管高画质”的解耦,Wan-Streamer v0.2 在不增加用户可感知延迟的前提下拿到了更好的画质。

来源溯源(合规留痕)
https://www.ithome.com/0/978/125.htm
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。