Hugging Face Blog·· 9 天前AI 評分59
英國 AI 安全研究所與 EvalEval 如何讓評測結果可復現
How UK AISI and EvalEval Are Making Benchmark Results Reproducible
AI 導讀
英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。
此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。
來源:Hugging Face Blog · huggingface.co