ByteNoteByteNote
开源语音合成不该再等几周听感票
字

字节笔记本

2026年10月10日 · 约 4 分钟读完

开源语音合成不该再等几周听感票

API中转
¥120

开源语音合成模型在 Hub 上已经过八千个,人工听感榜要排上好几周。Hugging Face 2026-09-30 的博文放出 Open TTS Leaderboard,先用客观指标在几小时内筛一圈,再把听感留给人工。评测脚本仓是 huggingface/open-tts-leaderboard,Apache-2.0,本轮看到 3 星、4 次提交。在线榜在 hf-audio 的 open_tts_leaderboard 空间,本轮打开时还在拉元数据,下面的名次以博文当时点名的模型为准,不是本轮刷新后的实时表。博文由评测组加上社区贡献者署名,本轮不把个人名字抄进正文。

博文封面

英语分高,带不到别的语言

默认排名用英语词错率的宏平均,来源是 Seed-TTS Eval 和 CV3-Eval 的英语子集。Seed-TTS 只覆盖英语和中文,论文号写在 2406.02430。其余语言走 CV3 零样本,每语 500 条,页面写了法、西、日、韩、意、德、俄,论文号 2505.17589。中日韩用字错率。博文原句写得很直:英语好,不保证换语言还好。当时公开权重在另一家人工竞技场的 92 个模型里只占 16 个,所以这张客观榜把开源模型单独摊开。空间页显示收藏 42、社区讨论 2,本轮打开时状态还停在拉取元数据,不把空表当成零模型。

可懂度用 Qwen3-ASR 算词错率或字错率。速度分两路:批跑的实时倍率写在 H200 上,首字时延按批大小 1 做流式。音色像不像用 WavLM 向量的余弦,只给带克隆的模型。仓库还写了生成用一张 H200,转写和相似度用 L4,首字时延可以落到 A100 或 CPU。英语首字时延用 CV3 的 50 条提示,预热 3 条之后取中位。冒烟例子里 Seamless M4T v2 large 的 CV3 英语词错率 4.55%、实时倍率 23.01,Seed 英语词错率写成 0.00%、实时倍率 19.46,合成 2.27% 和 21.19。这是脚本仓的冒烟数,不是全榜冠军。

两套评测集

博文点过的名字,先当快照

英语词错率当时点到 hexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-pro。多语言点到 k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512。克隆词错率点到 bosonai/higgs-tts-3-4b、openbmb/VoxCPM2。流式首字点到 kyutai/pocket-tts。空间上的听感页要登录才能投票。投稿还没有单独通道,脚本公开后走 Issues 和 PR。Seed-TTS 和 CV3 的许可证不允许再分发,要自己做私有副本再改环境变量。跑通一条链路还要账号、计费、可写令牌和对象存储,再按各模型目录里的提交脚本丢到 Hugging Face Jobs。

三项客观指标

这张榜补的是筛选速度,不是听感的终审。人工竞技场还在,只是不必先听几周才知道开源模型大概排在哪。本轮没有代跑 H200,也没有把空间里仍在刷新的格子抄进正文。若要复现,先按脚本仓建 Python 3.12 环境,再决定是只看英语宏平均,还是把 CV3 那几门语言一并打开。站点里已有若干合成工具稿,这篇只写评测栈和当时点名的快照。

相关文章

分享: