语音与模型评测

Open TTS Leaderboard 上线:选语音模型,别只看英语排名与生成速度

Easycha 编辑部
#语音合成#Hugging Face#TTS
EASYCHA 原创技术拼贴封面:耳机、麦克风与文字和音频卡片,标题为选声音,先听再看分。
EASYCHA · AI 生成的编辑插图;音频波形与评测卡片均为概念示意,不代表实际声音、产品截图或实测成绩。
事件日期:2026 年 9 月 30 日 一个语音模型读得准、听起来自然、响应又快,才可能适合实际应用,但这些能力很难用一个总分概括。Hugging Face 昨天介绍了 Open TTS Leaderboard,重点覆盖开源与多语言语音合成模型,用自动化指标加上试听入口,帮助开发者比较不同方案。 官方发布了什么 根据原文,榜单从三个方向评估模型。可懂度通过 Qwen3 ASR 将生成音频转写,再与输入文字比较,计算词错误率或字错误率;速度同时观察批量离线生成和首段可播放音频的等待时间;声音克隆则使用 WavLM 说话人表示的余弦相似度,比较生成声音与参考音频的音色身份。 这些指标各自回答一个问题:有没有读错、多久能听到、像不像参考声音。官方明确,它们并不直接测量自然度、表现力或听众偏好,因此新榜单不能替代人工听感评测。本文整理发布信息与选型思路,Easycha 未独立生成或测评相关音频。 默认排名不等于中文表现 榜单默认按 Seed TTS Eval 与 CV3 Eval 零样本英语子集的宏平均词错误率排序。原文允许切换语言,并说明中文、日文和韩文采用字错误率。除英语和中文外,其他语言的评测数据来自 CV3 Eval 零样本子集。 Easycha 分析:准备接入中文客服、朗读或内容配音时,应先选中文和对应任务,再比较模型。英语排名靠前并不能证明中文数字、专有名词、多音字或中英混读也同样可靠。宏平均结果还能隐藏某一类输入的集中失败,实际试用仍需要业务样本。 声音克隆也会改变比较条件。开启相关选项后,榜单筛选支持所选语言克隆的模型,并展示音色相似度。原文观察到,部分模型提供参考音频后,读音错误率也会改善。因此,有无参考音频不能混成同一组结果;参考片段本身的清晰度和内容,也值得在自己的测试中固定。 生成快,不一定开口快 批量离线推理的逆实时因子衡量生成音频的效率,首段音频等待时间则更贴近语音助手的交互感受。榜单的流式页面用相同的五十条英语提示、单条音频批量、默认声音测试,排除前三次预热,再报告其余样本的等待时间中位数。 对支持流式的模型,计时到第一段音频到达;对不支持流式的模型,则要等整句生成完毕,因为此前无法开始播放。默认硬件是 H200 GPU,部分模型另有 CPU 结果。不能把这组英语、指定硬件上的结果直接当作中文云端 API 的首包延迟。 Easycha 分析:真正的用户等待还可能包括请求排队、网络传输和客户端播放缓冲。选型时应把离线批量吞吐与在线首次播放分开记录,再检查后续音频能否持续跟上播放速度,避免只优化第一小段而忽略中途停顿。 把试听纳入验收 官方提供 Listen 页面,可按语言、数据集及克隆条件比较榜单背后的生成样本。自动转写错误率能够提示漏字和错读,但转写器本身也会出错;音色表示相近,也不保证重音、停顿和情绪符合场景。人工试听仍有不可替代的作用。 Easycha 建议准备一小组固定文本,覆盖常规句子、金额日期、缩写和较长段落,记录错读、漏读、首次播放等待与听感,再结合部署成本做选择。此次发布还把评测脚本开源列为后续计划,不能仅凭榜单上线就假定所有复现材料已经齐备。新榜单的价值,是让比较条件更容易看清;最终选择仍应落到用户实际会听到的声音。

来源与延伸阅读