Hugging Face 推出 Open TTS Leaderboard 語音和聲音克隆評估榜單
Hugging Face 推出了 Open TTS Leaderboard,旨在通過可擴充套件的客觀指標(如 WER、CER、推理速度和說話人相似度)來評估多語言語音合成與聲音克隆模型。該排行榜提供多語言評測、支援聲音克隆對比、內建音訊試聽與投票功能,並針對 GPU 和 CPU 環境對流式效能(TTFA)進行了基準測試。
Hugging Face 推出了 Open TTS Leaderboard,旨在通過可擴充套件的客觀指標(如 WER、CER、推理速度和說話人相似度)來評估多語言語音合成與聲音克隆模型。該排行榜提供多語言評測、支援聲音克隆對比、內建音訊試聽與投票功能,並針對 GPU 和 CPU 環境對流式效能(TTFA)進行了基準測試。
英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。
NVIDIA 釋出的 Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中表現領先,在 Qwen3-VL 上實現了較 GB300 NVL72 最高 3.7 倍的吞吐量提升。
Google Research 釋出研究《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,探討了 AI 評測中樣本數量(N)與每個樣本評測者數量(K)之間的權衡關係。