← 返回 2026-10-05 简报

开放TTS排行榜:可扩展的多语言文本转语音与声音克隆评估体系

Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning

语音播报
摘要
事件:Hugging Face推出开放TTS排行榜,针对超8000个开源模型,采用客观指标解决人工评估扩展性不足问题。 要点:基于Qwen3 ASR计算WER/CER,在H200上测RTFx与TTFA,用WavLM算声纹相似度SIM,评估耗时从数周缩至数小时。 影响:填补多语言及声音克隆客观评测空白,助力开发者快速筛选兼顾速度与音质的模型,推动开源生态标准化。

TLDR 👉 新的语音合成排行榜专注于开源和多语言

开源文本转语音(TTS)模型的发布速度令人惊叹。截至2026年9月30日,在Hugging Face Hub上已有超过8000个可用的TTS模型🚀

然而,评估工作并未跟上这一节奏:它仍然分散且缺乏标准化。黄金标准是人类偏好评分,如MOS或MUSHRA(详见指标部分)。为此,几个基于竞技场模式的排行榜已确立为社区有用的参考点:

TTS Arena v2

Artificial Analysis

Voice Arena

这些竞技场通过向用户展示来自两个模型的TTS输出,并让他们选择其中一个来比较模型。在收集到足够的投票后,计算Elo分数以对模型进行排名,通常使用Bradley–Terry模型(参见Voice Arena方法论)。

虽然人类偏好是最终的裁决者,但竞技场无法扩展以跟上TTS发布的节奏。这可能在一定程度上解释了为什么开源模型在竞技场式排行榜中代表性不足:截至2026年9月30日,Artificial Analysis上的92个模型中仅有16个是开源权重的,Voice Arena上也存在类似的偏差。这可能反映了实际因素:添加API模型只需一个API密钥,而开源模型必须由竞技场运营商托管和提供服务,且商业提供商比开源作者更有理由寻求上榜。竞技场式评估的另一个局限性在于投票者的一致性:没有任何竞技场能确保同一批具有相同“更好”标准的投票者能够随着时间的推移一致地评估模型。即使是同一个人的偏好也会随时间变化(正如赫拉克利特那句名言所说:“人不能两次踏进同一条河流”)。

为此,我们构建了Open TTS Leaderboard,它使用客观指标从性能的不同互补方面评估模型:

可懂度:提示与生成音频转录之间的词/字符错误率(WER和CER),使用Qwen3 ASR(Open ASR Leaderboard上排名最高的开源模型)。

速度:在H200 GPU上进行批量离线推理的逆实时因子(RTFx),以及在H200 GPU和CPU上量化流式批处理大小为1的延迟的时间到首个音频(TTFA)。

说话人相似度:通过计算生成音频与参考片段的WavLM说话人嵌入之间的余弦相似度(SIM)得出。

依靠客观指标评估,模型评估时间从几周(用于收集投票)缩短到几小时⚡

重要的是,Open TTS Leaderboard并不取代人类偏好排名。基于ASR的WER提供可懂度的代理指标,而说话人相似度估计语音身份保留程度。它们都不能直接衡量自然度、表现力或听众偏好。尽管如此,它们甚至可以为基于投票的排行榜提供哪些模型应纳入评估的建议。

我们建立这个排行榜的初衷是让它由社区塑造;我们希望听到您的反馈,以便评估保持相关性和洞察力。接下来的几节将概述Open TTS Leaderboard的主要功能。

多语言+语音克隆评估

从排行榜的默认视图来看,模型根据Seed TTS Eval(论文)和CV3 Eval(零样本)(论文)的英语分片的宏观平均WER进行排名。

在综合这两个分片上的英语WER时,hexgrad/Kokoro-82M、Supertone/supertonic-3和fishaudio/s2-pro领先,而帕累托图则可视化了哪些模型在WER、批量推理(RTFx)和模型大小之间取得了良好的平衡。

英语表现并不一定适用于其他语言。可以通过切换语言来对多语言性能进行模型排名。Seed TTS Eval 仅包含英语和中文的音频,因此其他语言的得分直接来自 CV3 Eval(零样本)。请注意,中文、日文和韩文属于基于字符的语言,因此报告的是字符错误率(CER),而跨语言的“平均 WER”是各语言之间的宏平均值。

k2-fsa/OmniVoice 、 fishaudio/s2-pro 以及 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 是强大的多语言模型。

通过切换“语音克隆”,可以比较支持该功能(在所选语言上)的模型。

此外,表格中现在出现了用于说话人相似度的 SIM 列,以及两个额外的帕累托图,用于可视化 SIM、批量推理和模型大小之间的权衡。

某些模型(如 bosonai/higgs-tts-3-4b 和 openbmb/VoxCPM2 )的平均 WER 在启用语音克隆时有所改善,即在提供参考音频的情况下。

比较并投票评选 TTS 输出

数字仅能说明故事的一部分,正如前面提到的,人类偏好才是最终的裁决者。通过“Listen”标签页,您可以比较指标背后的生成输出,找出您更喜欢的模型!

选择您感兴趣的语言/数据集,无论您是否想比较语音克隆,并可选择特定模型或收听随机选择的输出。

“Listen”标签页填补了现有 TTS 排行榜的一个重要空白:一个探索各种模型输出的空间。

您甚至可以对生成的输出提供反馈。随着我们收集到更多社区投票,我们可能会将这些数据纳入排行榜。所以请投票!但请使用您的 HF 账户登录,以帮助我们剔除垃圾信息/机器人。

流式传输性能

“Streaming”标签页比较了流式传输能力。模型根据 TTFA(首音频时间)进行排名,该指标量化了用户探测模型后到获得可播放音频所需等待的时间。这对于语音代理和其他交互式应用非常重要。

对于流式模型(“Streaming API”下显示✅),这是直到第一个音频块到达的时间。对于非流式模型,这是直到整个语句生成完毕的时间,因为播放无法更早开始。每个模型在相同的 50 个 CV3-Eval 英语提示上以单次音频(批量大小为 1)运行,使用相同的硬件和默认语音。我们舍弃前 3 次运行作为预热,并报告其余部分的 TTFA 中位数。

默认视图比较的是在 H200 GPU 上的性能。对于一小部分(但正在增长)的模型,也提供了 CPU 的结果!

kyutai/pocket-tts 是一款在 GPU 和 CPU 上流式传输表现极佳的模型!

结论

Open TTS Leaderboard 的目标不仅是跟上 TTS 模型发布的惊人速度,还要由社区塑造;我们希望听到您的反馈,以使评估保持相关性和洞察力。请告诉我们您希望看到哪些数据集、模型和指标!

目前,我们专注于:

开源模型 ,以突出许多被竞技场式评估所忽视的优秀模型。

多语言 ,因为英语表现不能作为其他语言的合适代理。

我们将很快开源评估脚本,类似于 Open ASR Leaderboard 仓库 ,以便您可以直接通过 GitHub Issues 和 PRs 提供反馈和建议!让我们一起塑造 TTS 评估 🤗

本条评分 8.4 score-v1
  • 来源权威 8
    注册表 priority=8(Hugging Face)
  • 时效 0.4
    发布 4.9 天前,已衰减到地板 0.4
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-10-05 8.4 18 入选
2026-10-04 8.49 31 未入选
2026-10-03 8.77 38 未入选
2026-10-02 9.22 36 未入选
原文链接:https://huggingface.co/blog/open-tts-leaderboard
来源:Hugging Face
以上内容由 AI 自动翻译,仅供参考。
← 返回简报