Gradium AI发布新默认TTS模型:81%高难度场景通过率
近日,Gradium AI发布了新的文本转语音(TTS)模型,并将其设为API和Studio平台上的默认选项。该公司的新模型在涵盖五种语言的500句高难度场景测试中获得了81%的人类评分通过率,在综合评估中领先于Cartesia Sonic 3.6和ElevenLabs v3 Conversational等竞争对手。此外,Gradium的新TTS模型首次音频输出时间为216毫秒,比其替代模型快了170毫秒。新模型已于8月31日部署,并且现有语音包括自定义克隆版本均不受影响。该测试集由Gradium构建并开源在Hugging Face上,包含五种语言(英语、德语、法语、西班牙语和葡萄牙语)的500句句子,涵盖十项评估标准,评分严格,要求每个元素都被正确完整地发音。
