首页/ 资讯/ Qwen-Audio-3.1 阿里通义推出的语音大模型系列

Qwen-Audio-3.1 阿里通义推出的语音大模型系列

拆宝 2026-09-24 8 阅读

Qwen-Audio-3.1是什么

Qwen-Audio-3.1 是通义千问推出的语音大模型系列,包含五款模型:ASR 语音识别、ASR-Next 音频理解、TTS 语音合成、TTS-Next 音频创作、Realtime 实时交互,覆盖理解-生成-交互-创作全链条。Qwen-Audio-3.1支持 30 种语言和 16 种方言,分角色转写,情绪感知与全双工实时对话,可调用工具完成任务。

Qwen-Audio-3.1

Qwen-Audio-3.1的主要功能

  • ASR 语音识别 :支持 30 种语言和 16 种中文方言的分角色转写,带说话人标签和时间戳,可原生润色文本。

  • ASR-Next 音频理解 :从转写文字扩展到理解人物情绪、环境声与机械声,支持声音描述、事件定位和音频问答。

  • TTS 语音合成 :支持多语种、多方言合成,同一音色跨语言自然迁移,可指令控制情绪与语速。

  • TTS-Next 音频创作 :一次生成人声、音效与环境音构成的完整音频,适用于播客、有声书、影视、游戏、广告。

  • Realtime 实时交互 :全双工同时听说,理解情绪与意图,多语言切换,并能在对话中调用工具完成任务。

Qwen-Audio-3.1的技术原理

端到端联合建模(ASR) :Qwen-Audio-3.1-ASR 采用端到端方案,将说话人标签、时间戳和转写文本联合输出,而非传统级联系统的分步处理,因此能保留短插话和重叠语音;模型同时内置去语气词、去重复、自我纠正和语义重组能力,使转写结果在结构上可直接用于会议记录和对话分析。 下一代音频理解架构(ASR-Next) :ASR-Next 基于下一代架构,将处理对象从语音中的文字扩展为完整音频信号,通过理解声学层面的情绪、环境声与机械声,完成声音事件定位、描述与推理,标志着 ASR 从转写工具升级为泛音频理解模型。 音色迁移与表达控制(TTS) :TTS 模型突破只追求字音正确的传统合成方式,在同一音色上实现跨语言、跨方言的自然迁移,并通过指令对情绪、语速和表达方式建模,让合成语音贴合内容与场景。 统一音频生成(TTS-Next) :TTS-Next 围绕文本、时间戳和参考音频三类输入,统一生成人声、音效和环境音;在多轮对话中保持各角色音色与情绪一致,并通过自然语言控制生成过程,支持细粒度时间戳控制、声音复刻和 48kHz 高保真输出。 多教师蒸馏的全双工架构(Realtime) :Realtime 采用多教师蒸馏架构,在保持低延迟的同时提升理解、推理、表达与安全能力,实现全双工交互,说与听同时发生,支持随时插话打断;模型整合工具调用能力,能在持续对话中理解变化的需求,连接外部 API、知识库和业务系统完成任务。

如何使用Qwen-Audio-3.1

  • 打开千问 AI 平台 :访问 https://www.qianwenai.com/并登录账号,进入模型广场。

  • 选择所需模型 :根据需求选择对应模型,ASR(转写)、TTS(合成)、TTS-Next(创作)、Realtime(实时交互),点击进入详情页。

  • 获取 API Key :在控制台开通模型服务并创建 API Key,用于接口鉴权。

  • 调用接口 :参考各模型详情页的 API 文档,通过 HTTP 请求传入音频或文本参数(ASR-Next API 尚未上线,需等待开放)。

  • 集成到应用 :将接口接入自己的应用、Agent 或智能硬件,语音任务即可在线完成。

Qwen-Audio-3.1的核心优势

  • 多语言方言能力强 :一套模型支持 30 种语言和 16 种中文方言,温州话等难懂方言的识别提升尤为明显。

  • 转写智能润色 :ASR 原生完成去语气词、去重复和语义重组,输出更顺畅、更有逻辑的结构化文本。

  • 分角色高精度转写 :端到端输出说话人标签、时间戳与文本,全面优于 Fun-ASR 级联系统。

  • 音频理解升级 :ASR-Next 能理解情绪、环境声与机械声,从转写文字跃升为理解完整音频。

  • 创作能力一体化 :TTS-Next 一次生成人声、音效与环境音,多角色音色情绪一致,替代多人分工的后期制作流程。

  • 真人级实时交互 :全双工听说并行、支持插话打断,能感知情绪并调用工具完成任务。

  • 低延迟高性能 :流式识别首字响应约 160 毫秒,Realtime 基于多教师蒸馏兼顾低延迟与推理能力。

Qwen-Audio-3.1的项目地址

  • 在线体验Demo : Qwen-Audio-3.1-ASR :https://www.qianwenai.com/models/qwen-audio-3.1-asr-flash

  • Qwen-Audio-3.1-TTS :https://www.qianwenai.com/models/qwen-audio-3.1-tts-flash

  • Qwen-Audio-3.1-TTS-Next :https://www.qianwenai.com/models/qwen-audio-3.1-tts-next

  • Qwen-Audio-3.1-Realtime :https://www.qianwenai.com/models/qwen-audio-3.1-realtime-plus

Qwen-Audio-3.1的同类竞品对比

对比维度 | Qwen-Audio-3.1 | OpenAI(GPT-Realtime-2 / GPT-Live-1)

对比维度

Qwen-Audio-3.1

OpenAI(GPT-Realtime-2 / GPT-Live-1)

产品形态

五款模型组成的音频全栈:ASR、ASR-Next、TTS、TTS-Next、Realtime

聚焦实时语音交互:Realtime API(gpt-realtime 系列)+ GPT-Live 全双工模型

交互模式

Realtime 全双工,同时说和听,支持插话打断

GPT-Live 为真全双工;gpt-realtime 为极速半双工(不支持边听边说)

语言/方言覆盖

30 种语言 + 16 种中文方言,温州话等难懂方言优化明显

gpt-realtime-translate 支持 70 多种输入语言,但中文方言能力未专项承诺

音频创作能力

TTS-Next 可一次生成人声+音效+环境音的完整音频(播客、有声书、影视、游戏)

无对应能力,仅语音合成与实时对话

ASR 能力

分角色转写+时间戳+原生润色,方言 AST 平均语义句准率 82.10%,全面优于 Fun-ASR 级联系统

依赖 Whisper 等独立转写服务(如 gpt-realtime-whisper,每分钟 0.017 美元)

工具调用

可在实时对话中调用 API、知识库、业务系统

支持 Function calling、远程 MCP 服务器、SIP 电话,生态成熟度更高

Qwen-Audio-3.1的应用场景

  • 会议纪要与访谈记录 :用 ASR 的分角色转写和时间戳功能,自动输出谁在什么时候说了什么的结构化记录,原生润色去除口语杂质,大幅提升会议效率。

  • 播客与有声书创作 :通过 TTS-Next 一次生成多人对白、音效和环境音的完整音频,多角色音色与情绪保持一致,省去主播、音效师、混音师的分工协作。

  • 实时语音客服/智能助理 :基于 Realtime 的全双工交互和情绪感知能力,构建可被打断、会共情的语音客服,还能在对话中调用业务系统完成查询、下单等任务。

  • 跨境旅游与多语言沟通 :借助 30 种语言实时切换、同一音色跨语言合成的能力,为旅行规划、跨境电商、国际会议提供自然流畅的语音翻译与交流体验。

  • AI 智能硬件 :与 QwenNote、千问 AI 眼镜等硬件结合,用户无需打开电脑手机,直接语音发起任务、追加条件、跟踪执行,让语音成为 AI 硬件的自然入口。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐