跳到正文

#評測/基準

RSS
今日 1 則
今天10月1日週四
  1. Hugging Face Blog55

    Hugging Face 推出 Open TTS Leaderboard 語音和聲音克隆評估榜單

    Hugging Face 推出了 Open TTS Leaderboard,旨在通過可擴充套件的客觀指標(如 WER、CER、推理速度和說話人相似度)來評估多語言語音合成與聲音克隆模型。該排行榜提供多語言評測、支援聲音克隆對比、內建音訊試聽與投票功能,並針對 GPU 和 CPU 環境對流式效能(TTFA)進行了基準測試。

9月22日週二
  1. Hugging Face Blog59

    英國 AI 安全研究所與 EvalEval 如何讓評測結果可復現

    英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。

  2. Simon Willison83

    Simon Willison 評測 TypeSafe AI 推出的 Jev 決策模型

    TypeSafe AI 近期推出了名為 Jev 的 System One 決策模型,它接收非結構化文本輸入並返回對應類別的浮點數置信度分數。Jev 僅對輸入收費且價格低至每百萬 token 0.042 美元,支援 Yes/No、多選和評分三類問題並在後臺並行評估。作者指出 Jev 的黑盒特性和偏差問題需要謹慎對待,但社群已圍繞其展開了豐富的創意應用和開源復現嘗試。

    推薦理由:原文介紹了 TypeSafe AI 推出的決策模型 Jev 及其獨特的工作機制和定價模式,讀者可以藉此瞭解這類新型模型在分類與檢索重排場景中的應用與侷限。

9月16日週三
8月17日週一
8月10日週一
  1. Import AI46

    Import AI 468:23 條 RSI 政策建議、PostTrainBench+ 以及信任和透明度如何與 AI 競賽相互交織

    智庫 IFP 釋出了 23 條旨在幫助政策制定者應對 AI 研發自動化風險的操作性政策建議,涵蓋 7 個具體類別。麻省理工學院和哥倫比亞大學的研究人員在論文《Racing to Ruin》中分析了 AI 研發競爭中的協調放緩問題,指出信任和透明度是實現穩定結果的關鍵變數。

6月15日週一
4月1日週三