资讯 · 高影响返回资讯

阿里通义实验室发布 Qwen-Audio-3.0-TTS:登顶独立语音评测榜首,主打生产级语义可控与低延迟

阿里通义实验室于2026年7月推出托管式文本转语音(TTS)系统 Qwen-Audio-3.0-TTS,并在独立评测机构 Artificial Analysis 榜单中以 Elo 评分 1238 登顶。该系统不开源权重,通过阿里云百炼提供 API 商业服务。包含 Plus(高保真配音)与 Flash(约 300ms 低延迟语音 Agent)两个版本,支持自然语言可控和 86 个细粒度行内标签,支持 16 种语言及 20 种中文方言。

通义实验室推出 Qwen-Audio-3.0-TTS 并登顶评测榜

阿里通义实验室于 2026 年 7 月推出了面向生产级应用的托管文本转语音(TTS)系统 Qwen-Audio-3.0-TTS。该模型在独立评测机构 Artificial Analysis 的 Speech Arena 排行榜中登顶,以 1238 的 Quality Elo 评分超越了 Google 的 Gemini 3.1 Flash TTS、SpeechifyAI 的 Simba 3.2 以及 Cartesia 的 Sonic 3.5。 这一成绩标志着国产语音生成模型在整体自然度、音色还原度以及端到端质量上已达到国际顶尖水准。

商业托管双版本设计:兼顾高质量配音与实时语音 Agent

不同于阿里早前发布的开源 Qwen3-TTS 模型系列(支持本地部署的 0.6B/1.7B 规格),此次发布的 Qwen-Audio-3.0-TTS 属于仅提供 API 的托管式商业服务,通过阿里云百炼平台(Model Studio)对外输出。 为了适配不同的工业应用场景,阿里提供了两个差异化版本:

  • Plus 版本:优化了音频的细腻度与音色保真度,极适合有声书、长视频旁白和影视配音等场景;
  • Flash 版本:聚焦在响应速度,其首包延迟(First-packet latency)低至 300 毫秒左右,主要赋能需要即时交互的实时语音 Agent 及虚拟助手。

技术特性:低帧率 Tokenizer 与 86 个细粒度控制标签

在底层架构上,该模型基于 12.5 Hz 低帧率语音 Tokenizer 与五阶段渐进式训练范式,展现出极强的抗噪鲁棒性,甚至单次可实现长达 3 分钟的高保真音频合成。Qwen-Audio-3.0-TTS 提供了“生产级”控制体验:用户可以使用自然语言指令定制语气与口音,也可以通过 86 个行内标签进行局部微调。 目前模型已全面支持 16 种语言以及包括 20 个中文方言区在内的多方言混合合成。

下一步

继续追踪 阿里云

沿着同一主题继续阅读。

打开实体档案