通义实验室推出 Qwen-Audio-3.0-TTS 并登顶评测榜
阿里通义实验室于 2026 年 7 月推出了面向生产级应用的托管文本转语音(TTS)系统 Qwen-Audio-3.0-TTS。该模型在独立评测机构 Artificial Analysis 的 Speech Arena 排行榜中登顶,以 1238 的 Quality Elo 评分超越了 Google 的 Gemini 3.1 Flash TTS、SpeechifyAI 的 Simba 3.2 以及 Cartesia 的 Sonic 3.5。 这一成绩标志着国产语音生成模型在整体自然度、音色还原度以及端到端质量上已达到国际顶尖水准。
商业托管双版本设计:兼顾高质量配音与实时语音 Agent
不同于阿里早前发布的开源 Qwen3-TTS 模型系列(支持本地部署的 0.6B/1.7B 规格),此次发布的 Qwen-Audio-3.0-TTS 属于仅提供 API 的托管式商业服务,通过阿里云百炼平台(Model Studio)对外输出。 为了适配不同的工业应用场景,阿里提供了两个差异化版本:
- Plus 版本:优化了音频的细腻度与音色保真度,极适合有声书、长视频旁白和影视配音等场景;
- Flash 版本:聚焦在响应速度,其首包延迟(First-packet latency)低至 300 毫秒左右,主要赋能需要即时交互的实时语音 Agent 及虚拟助手。
技术特性:低帧率 Tokenizer 与 86 个细粒度控制标签
在底层架构上,该模型基于 12.5 Hz 低帧率语音 Tokenizer 与五阶段渐进式训练范式,展现出极强的抗噪鲁棒性,甚至单次可实现长达 3 分钟的高保真音频合成。Qwen-Audio-3.0-TTS 提供了“生产级”控制体验:用户可以使用自然语言指令定制语气与口音,也可以通过 86 个行内标签进行局部微调。 目前模型已全面支持 16 种语言以及包括 20 个中文方言区在内的多方言混合合成。