Today for AI

Hugging Face Blog · 2026/10/7 21:21:03

TII 发布 Falcon ASR:专为阿拉伯语与英语优化的开源语音识别模型

原标题:Introducing Falcon ASR
68AI 研判分
核心综述

阿布扎比人工智能研究所(TII)正式推出开源语音识别模型 Falcon ASR,重点解决阿拉伯语在自动语音识别中的低资源痛点。该模型基于 Falcon LLM 系列架构,针对阿拉伯语方言及英语混合场景进行了深度优化,旨在为中东地区提供高精度、可定制的本地化语音交互基础设施。

报道全文原始报道全文

本文目录18 个章节

返回文章列表

Falcon ASR 模型发布

团队文章 发布于 2026 年 10 月 7 日 点赞 1

Abdul Muneer abdulmuneertii tiiuae Rishabh Saraf rishabh-saraf tiiuae Ramesh Gundluru gundlururamesh tiiuae Shamsa Hamad shamsaH tiiuae Lepauloux Ludovick tiiuae Hakim Hacid HakimHacid tiiuae

Falcon ASR:阿拉伯语和英语语音识别

English · العربية

阿拉伯语 WER:20.92% · 参数量:1.6B · 阿联酋方言 WER(TII 评估):22.73%

我们正式推出 Falcon-ASR,这是一款拥有 16 亿参数的阿拉伯语语音识别模型,特别针对阿联酋方言进行了优化。该模型由阿布扎比的技术创新研究所(TII)开发,同时也支持英语、法语、西班牙语和葡萄牙语。

在我们的评估中,Falcon-ASR 在六个阿拉伯语测试集上实现了平均 20.92% 的词错误率(WER),相比之下,我们所采用的排行榜快照中的最佳公开结果为 23.17%。在我们内部的阿联酋方言评估中,它在所有对比系统中取得了最低的词错误率和字符错误率。

此外,我们还支持转录文本的词级时间戳功能,可将每个转录出的单词与其在音频中的位置进行关联。

试用 Falcon ASR →

识别口语化阿拉伯语

阿拉伯语的语音特征因地区、说话人和场景的不同而存在显著差异。一个能够处理正式新闻广播的模型,在面对阿联酋方言的日常对话或电话线路录音时,仍可能表现不佳。此外,方言阿拉伯语的转录资源远少于现代标准阿拉伯语(MSA),这使得模型的训练和评估变得更加困难。

我们在阿联酋阿拉伯语、现代标准阿拉伯语(MSA)、其他海湾地区及阿拉伯方言以及英语上训练了 Falcon-ASR。我们的目标是转录人们在日常口语中使用的词汇,包括方言形式以及语言间的切换。

阿拉伯语基准测试结果

由 ELM 研究中心维护的 Open Universal Arabic ASR Leaderboard 根据六个测试集上的等权重平均词错误率(WER)对系统进行排名。该榜单还报告了字符错误率(CER)。对于这两项指标,数值越低表示性能越好。我们的 Falcon-ASR 评估遵循此协议。

falcon-asr-arabic

WER = Word Error Rate(词错误率);CER = Character Error Rate(字符错误率)。数值越低表示性能越好。

我们使用排行榜固定的清单文件,在相同的六个基准测试上评估了 Falcon-ASR。竞争对手的数据为截至 2026 年 9 月 30 日已发布的排行榜平均值。Falcon-ASR 的平均 WER 比该快照中最佳已发布结果高出 2.25 个百分点(即表现更优)。

评估阿联酋阿拉伯语语音

公开评估数据已包含阿联酋阿拉伯语:Casablanca 数据集包含一个阿联酋子集。我们通过内部评估补充了这一覆盖范围,针对额外的阿联酋及海湾地区语音,利用保留录音和人工验证的转录文本,以评估超出公开阿联酋子集范围的转录准确性。

在我们的内部阿联酋阿拉伯语评估中,Falcon-ASR 实现了 22.73% 的 WER 和 10.19% 的 CER:

falcon-asr-emirati

在此处比较的系统之中,Falcon-ASR 拥有最低的 WER 和 CER。其 WER 比次佳结果 Qwen3-Omni 低 4.07 个百分点。结果表明,在该评估中,无论是单词层面还是字符层面,转录准确性均有所提升。

针对不同录音条件的训练

我们纳入了背景噪声、重叠语音、音乐、房间混响以及电话效应,同时也包含了语速和音调的变化。我们对阿联酋阿拉伯语录音应用了相同的处理方式,使模型能够接触到会议、通话及其他日常录音中可能遇到的各种条件。

英语及其他语言

Falcon-ASR 也使用相同的模型权重转录英语。在 Hugging Face Open ASR Leaderboard 所使用的七个公开英语测试集上,我们的评估显示其平均词错误率(WER)为 5.74%。

falcon-asr-english

该模型还支持法语、西班牙语和葡萄牙语。这五种语言均使用相同的权重,无需指定语言标志。输出结果为说话语言的转录文本。

模型基础

Falcon-ASR 基于我们的 Falcon3-Audio 工作构建。Falcon3-Audio 的架构和训练方法在 Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data 中进行了描述。

试用 Falcon ASR

我们的 Hugging Face Demo Space 允许您试用 Falcon-ASR 并探索其转录功能。API 访问权限和原生应用程序正在计划中。我们诚邀您使用自己的录音来体验 Demo。

致谢

我们要感谢 Falcon-Emirati 模型背后的团队在阿拉伯语基础模型方面提供的支持。有关他们最新工作的详情,请阅读 Falcon-Emirati 博客文章。

我们也衷心感谢 Mikhail Lubinets 在计算基础设施方面提供的持续支持。


推出 Falcon ASR

我们推出 Falcon-ASR,这是一款拥有 16 亿参数的阿拉伯语语音识别模型,特别关注阿联酋方言。该模型由阿布扎比的创新技术研究所(TII)开发,同时也支持英语、法语、西班牙语和葡萄牙语。

在我们的评估中,Falcon-ASR 在六个阿拉伯语测试集上实现了 20.92% 的平均词错误率(WER),相比之下,我们所使用的排行榜版本中的最佳已发表结果为 23.17%。在我们对阿联酋方言的内部评估中,该模型在所比较的系统中取得了最低的字错误率和字符错误率。

我们还支持转录过程中的词级时间戳,使每个单词都与音频录音中的位置相关联。

试用 Falcon ASR ←

识别口语阿拉伯语

阿拉伯语因地区、说话者及录音环境的不同而存在显著差异。模型可能在转写正式新闻播报时表现良好,但在处理阿联酋方言对话或电话录音时却遇到困难。此外,相较于现代标准阿拉伯语(MSA),可用于训练和评估的阿拉伯方言语音-文本对齐资源更为稀缺,这进一步增加了相关工作的难度。

我们在阿联酋方言、现代标准阿拉伯语以及其他海湾和阿拉伯方言以及英语上训练了 Falcon-ASR。我们的目标是准确转写人们在日常生活中使用的词汇,包括方言表达和语码转换现象。

阿拉伯语测试结果

由 ELM 研究中心维护的 通用阿拉伯语自动语音识别开放排行榜 根据六个测试集上的平均词错误率(WER)对系统进行排名,每个测试集的权重相等。该排行榜还展示了字符错误率(CER)。这两个指标的值越低,表示性能越好。我们对模型的评估遵循这一协议。

阿拉伯语测试中词错误率和字符错误率的比较

WER 为词错误率;CER 为字符错误率。数值越低表示性能越好。

我们使用排行榜中固定的样本列表,在相同的六个测试集上评估了 Falcon-ASR。竞争模型的数字是排行榜上发布的平均值,并于 2026 年 9 月 30 日进行了验证。在该版本中,本模型的平均词错误率比已发布的最佳结果低了 2.25 个百分点。

阿联酋方言评估

目前已有用于评估阿联酋方言的公开数据,例如 Casablanca 数据集就包含专门的阿联酋部分。为了补充这一覆盖范围,我们还进行了内部评估,针对额外的阿联酋和海湾地区语音录音进行测试。这些测试使用了专用的测试录音和经过人工审核的参考文本,以评估除公开阿联酋数据之外的额外材料上的转写准确性。

在我们的内部阿联酋评估中,Falcon-ASR 实现了 22.73% 的词错误率和 10.19% 的字符错误率:

阿联酋评估中词错误率和字符错误率的比较

在此处比较的系统中,Falcon-ASR 记录了最低的词错误率和字符错误率。其词错误率比紧随其后的 Qwen3-Omni 低了 4.07 个百分点。结果表明,在该评估中,无论是单词级别还是字符级别的转写准确性均有所提升。

不同录音条件下的训练

此外,训练数据还包含背景噪声、重叠语音、音乐、混响以及电话通信效果,同时涵盖语速和音调的变化。我们对阿联酋录音也应用了相同的处理流程,以使模型能够适应会议、通话及其他日常录音中可能遇到的各种不同环境。

英语及其他语言

Falcon-ASR 使用相同的模型权重转录英语语音。在 Hugging Face 开放语音识别排行榜上使用的七个通用英语测试集评估中,其平均词错误率(WER)为 5.74%。

英语测试集中的词错误率

该模型还支持法语、西班牙语和葡萄牙语。这五种语言共用同一套权重,无需预先指定语言。输出结果为所讲语言的文本转录。

基础模型

Falcon-ASR 基于我们在 Falcon3-Audio 方面的工作成果。论文 Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data 介绍了 Falcon3-Audio 的架构及其训练方法。

体验 Falcon ASR

通过 Hugging Face 上的演示空间,您可以体验 Falcon-ASR 并探索其语音转录能力。API 接口和本地应用的访问方式正在规划中。我们邀请您使用自己的录音来试用该模型。

致谢

衷心感谢 Falcon-Emirati 模型开发团队在阿拉伯语基础模型领域给予的支持。有关该团队的最新工作成果,请参阅 关于 Falcon-Emirati 的文章。

同时,我们要向 Mikhail Lubinets 表示诚挚的谢意,感谢他对计算基础设施提供的持续支持。