Qwen3.8-LiveTranslate 阿里通义推出的实时同声传译模型
Qwen3.8-LiveTranslate是什么
Qwen3.8-LiveTranslate是阿里通义千问推出的实时同声传译大模型,采用Interleave架构重构,字均延迟从2.8秒降至2.3秒,支持60种语言。模型具备实时说话人分离与音色克隆、原文译文同帧同出、长上下文消歧三大能力,可识别视频/音频输入,端到端输出双语文本及保留原音色的译文语音,适用跨国会议、跨境直播、视频本地化等场景,已通过千问AI平台开放API。

Qwen3.8-LiveTranslate的主要功能
- 实时同传 :基于Interleave架构的音频-文本单流处理,字均延迟仅2.3秒,边听边译。
- 说话人分离 :多人交替发言时自动区分各说话人,并分别复刻其音色生成译文语音。
- 双语同帧输出 :原文与译文同步同屏呈现,便于即时理解与原文核对。
- 长上下文消歧 :结合前文语境理解当前语句,让人名、术语、指代翻译更准确一致。
- 多语言互译 :支持60种语言识别输入、29种语言语音输出。
- 视觉信息辅助 :支持视频/图像输入,借助画面内容辅助翻译消歧。
Qwen3.8-LiveTranslate的技术原理
- Interleave 单流架构 :Qwen3.8-LiveTranslate 将同传重构为音频与文本交织的单流形式,已听音频和已出译文均缓存复用,避免每句话从头处理,在提升翻译质量的同时将字均延迟从 2.8 秒压缩至 2.3 秒。
- Thinker–Talker 双模块设计 :模型采用基于 Hybrid MoE 的 Thinker–Talker 结构。Thinker 将视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端完成理解与翻译;Talker 结合译文与源音频,合成保留原说话人音色的译文语音。
- 实时说话人分离 :面对多人交替发言场景,模型在翻译前先完成 Diarization,将每句话归属到具体说话人,并据此指导 Talker 为该说话人稳定复刻其音色,保证译文语音听得出是谁说的。
- 长上下文消歧 :模型将历史对话纳入上下文建模,跨轮关联前文信息,避免仅凭单句判断导致专有名词、人名、指代出现歧义,保证多人长对话中术语与表达的前后一致。
- 双语同步输出机制 :架构设计上原文与译文在同一条交织序列中对齐生成,天然支持同帧同出,使双语字幕、内容整理与检索等下游应用无需额外对齐处理。
如何使用Qwen3.8-LiveTranslate
方式一:在线体验
- 打开网址 https://omni.qwen.ai/live-translate。
- 允许麦克风权限,选择源语言和目标语言。
- 直接开始说话,可看到实时双语字幕并听到译文朗读。
方式二:API 使用
- 登录千问 AI 平台,获取 API Key。
- 调用 https://www.qianwenai.com/models/qwen3.8-livetranslate-flash-realtime 模型的实时接口,传入音频流。
- 接收返回的双语文本和译文语音即可。
Qwen3.8-LiveTranslate的核心优势
- 低延迟 :Interleave 架构让字均延迟从 2.8 秒降至 2.3 秒,已听音频和已出译文可缓存复用,翻译更快更流畅。
- 说话人分离 + 音色克隆 :多人交替发言时精准区分说话人,译文语音分别复刻各自音色,交流信息归属清晰。
- 双语同帧同出 :原文与译文同步呈现,兼顾即时理解与原文核对,天然适配字幕、内容整理、检索等场景。
- 长上下文消歧 :跨轮关联历史语境,解决单句判断的歧义问题,人名、术语翻译前后一致更精准。
- 60 种语言广覆盖 :支持 60 种语言识别、29 种语言语音输出,满足多语种实时交流需求。
Qwen3.8-LiveTranslate的同类竞品对比
对比维度 | Qwen3.8-LiveTranslate | GPT-4o(OpenAI Realtime API)
| 对比维度 | Qwen3.8-LiveTranslate | GPT-4o(OpenAI Realtime API) |
|---|---|---|
| 产品定位 | 端到端同声传译大模型 | 通用实时语音对话模型 |
| 架构 | Interleave 音频-文本单流,Hybrid MoE Thinker–Talker 双模块 | 端到端多模态大模型,语音直接进、语音直接出 |
| 同传延迟 | 字均延迟 2.3 秒(LAAL),专为同传优化 | 近实时对话,无官方同传延迟指标 |
| 说话人分离 | ✅ 原生支持,多人发言自动区分 | 有限,依赖 VAD 轮次切分 |
| 音色克隆 | ✅ 分说话人复刻原音色朗读译文 | ❌ 输出为固定风格语音,不支持音色克隆 |
| 双语同帧输出 | ✅ 原文译文同步对齐输出 | ❌ 仅输出单语回应 |
| 长上下文消歧 | ✅ 跨轮关联历史语境,人名术语一致 | 依赖对话记忆,无针对性消歧优化 |
| 语种覆盖 | 60 种语言识别 / 29 种语音输出 | 约 50+ 种语言对话 |
| 视觉输入 | ✅ 支持视频/图像辅助消歧 | ✅ 支持图像输入,但语音模式下较少使用 |
| 接入方式 | 千问 AI 平台 / 阿里云百炼 WebSocket API | OpenAI Realtime API(WebSocket/WebRTC) |
| 典型场景 | 跨国会议、跨境直播、字幕翻译、视频本地化 | 语音助手、实时口语对话陪练 |
Qwen3.8-LiveTranslate的应用场景
- 跨国会议 :多人发言时自动区分说话人并复刻音色实时翻译,让与会者仿佛在同语种交流。
- 跨境直播 :为主播输出双语同步字幕和译文语音,帮助直播内容无障碍触达全球观众。
- 视频本地化 :输入视频即可生成对齐的双语字幕和配音,大幅简化影视、课程内容的译制流程。
- 国际展会/会展 :为参展双方的现场交流提供低延迟同传,减少专业译员成本。
- 出海企业客服与培训 :支撑海外客户的实时语音咨询和跨语种员工培训,提升全球化服务效率。
相关工具
与本文相关的 AI 工具