人工智能 来源:Hugging Face Blog 整理:feaOS 2026-10-01 00:37:08

Open TTS Leaderboard:面向多语言语音合成与声音克隆的可扩展评测

面对Hugging Face Hub上已超过八千个开源文本转语音(TTS)模型、但评估仍分散且难以标准化的现状,社区推出Open TTS Leaderboard,用客观指标对多语言TTS与声音克隆进行可扩展评测。指标包括:用Qwen3 ASR计算提示与生成音频转写之间的字词错误率以衡量可懂度;在H200上统计离线批处理逆实时因子与流式首音频时延以衡量速度;以及用WavLM说话人嵌入余弦相似度衡量说话人一致性。作者指出,竞技场式人工偏好榜单虽权威,但扩容慢,且开源权重模型占比偏低。该榜单默认以Seed TTS Eval与CV3 Eval英语子集的宏平均WER排序,并强调客观指标不能替代自然度与听感偏好,但可帮助人工榜筛选候选模型。

ENTRY_ID: NEWS-17851 READ_MODE: SHORT_SIGNAL