首页/ 资讯/ Qwen3.8-LiveTranslate 阿里通义推出的实时同声传译模型

Qwen3.8-LiveTranslate 阿里通义推出的实时同声传译模型

灵犀编辑部 2026-09-20 0 阅读

Qwen3.8-LiveTranslate是什么

Qwen3.8-LiveTranslate是阿里通义千问推出的实时同声传译大模型,采用Interleave架构重构,字均延迟从2.8秒降至2.3秒,支持60种语言。模型具备实时说话人分离与音色克隆、原文译文同帧同出、长上下文消歧三大能力,可识别视频/音频输入,端到端输出双语文本及保留原音色的译文语音,适用跨国会议、跨境直播、视频本地化等场景,已通过千问AI平台开放API。

Qwen3.8-LiveTranslate

Qwen3.8-LiveTranslate的主要功能

  • 实时同传 :基于Interleave架构的音频-文本单流处理,字均延迟仅2.3秒,边听边译。
  • 说话人分离 :多人交替发言时自动区分各说话人,并分别复刻其音色生成译文语音。
  • 双语同帧输出 :原文与译文同步同屏呈现,便于即时理解与原文核对。
  • 长上下文消歧 :结合前文语境理解当前语句,让人名、术语、指代翻译更准确一致。
  • 多语言互译 :支持60种语言识别输入、29种语言语音输出。
  • 视觉信息辅助 :支持视频/图像输入,借助画面内容辅助翻译消歧。

Qwen3.8-LiveTranslate的技术原理

  • Interleave 单流架构 :Qwen3.8-LiveTranslate 将同传重构为音频与文本交织的单流形式,已听音频和已出译文均缓存复用,避免每句话从头处理,在提升翻译质量的同时将字均延迟从 2.8 秒压缩至 2.3 秒。
  • Thinker–Talker 双模块设计 :模型采用基于 Hybrid MoE 的 Thinker–Talker 结构。Thinker 将视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端完成理解与翻译;Talker 结合译文与源音频,合成保留原说话人音色的译文语音。
  • 实时说话人分离 :面对多人交替发言场景,模型在翻译前先完成 Diarization,将每句话归属到具体说话人,并据此指导 Talker 为该说话人稳定复刻其音色,保证译文语音听得出是谁说的。
  • 长上下文消歧 :模型将历史对话纳入上下文建模,跨轮关联前文信息,避免仅凭单句判断导致专有名词、人名、指代出现歧义,保证多人长对话中术语与表达的前后一致。
  • 双语同步输出机制 :架构设计上原文与译文在同一条交织序列中对齐生成,天然支持同帧同出,使双语字幕、内容整理与检索等下游应用无需额外对齐处理。

如何使用Qwen3.8-LiveTranslate

方式一:在线体验

  • 打开网址 https://omni.qwen.ai/live-translate。
  • 允许麦克风权限,选择源语言和目标语言。
  • 直接开始说话,可看到实时双语字幕并听到译文朗读。

方式二:API 使用

  • 登录千问 AI 平台,获取 API Key。
  • 调用 https://www.qianwenai.com/models/qwen3.8-livetranslate-flash-realtime 模型的实时接口,传入音频流。
  • 接收返回的双语文本和译文语音即可。

Qwen3.8-LiveTranslate的核心优势

  • 低延迟 :Interleave 架构让字均延迟从 2.8 秒降至 2.3 秒,已听音频和已出译文可缓存复用,翻译更快更流畅。
  • 说话人分离 + 音色克隆 :多人交替发言时精准区分说话人,译文语音分别复刻各自音色,交流信息归属清晰。
  • 双语同帧同出 :原文与译文同步呈现,兼顾即时理解与原文核对,天然适配字幕、内容整理、检索等场景。
  • 长上下文消歧 :跨轮关联历史语境,解决单句判断的歧义问题,人名、术语翻译前后一致更精准。
  • 60 种语言广覆盖 :支持 60 种语言识别、29 种语言语音输出,满足多语种实时交流需求。

Qwen3.8-LiveTranslate的同类竞品对比

对比维度 | Qwen3.8-LiveTranslate | GPT-4o(OpenAI Realtime API)

>
对比维度 Qwen3.8-LiveTranslate GPT-4o(OpenAI Realtime API)
产品定位 端到端同声传译大模型 通用实时语音对话模型
架构 Interleave 音频-文本单流,Hybrid MoE Thinker–Talker 双模块 端到端多模态大模型,语音直接进、语音直接出
同传延迟 字均延迟 2.3 秒(LAAL),专为同传优化 近实时对话,无官方同传延迟指标
说话人分离 ✅ 原生支持,多人发言自动区分 有限,依赖 VAD 轮次切分
音色克隆 ✅ 分说话人复刻原音色朗读译文 ❌ 输出为固定风格语音,不支持音色克隆
双语同帧输出 ✅ 原文译文同步对齐输出 ❌ 仅输出单语回应
长上下文消歧 ✅ 跨轮关联历史语境,人名术语一致 依赖对话记忆,无针对性消歧优化
语种覆盖 60 种语言识别 / 29 种语音输出 约 50+ 种语言对话
视觉输入 ✅ 支持视频/图像辅助消歧 ✅ 支持图像输入,但语音模式下较少使用
接入方式 千问 AI 平台 / 阿里云百炼 WebSocket API OpenAI Realtime API(WebSocket/WebRTC)
典型场景 跨国会议、跨境直播、字幕翻译、视频本地化 语音助手、实时口语对话陪练

Qwen3.8-LiveTranslate的应用场景

  • 跨国会议 :多人发言时自动区分说话人并复刻音色实时翻译,让与会者仿佛在同语种交流。
  • 跨境直播 :为主播输出双语同步字幕和译文语音,帮助直播内容无障碍触达全球观众。
  • 视频本地化 :输入视频即可生成对齐的双语字幕和配音,大幅简化影视、课程内容的译制流程。
  • 国际展会/会展 :为参展双方的现场交流提供低延迟同传,减少专业译员成本。
  • 出海企业客服与培训 :支撑海外客户的实时语音咨询和跨语种员工培训,提升全球化服务效率。
相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐