英國 AI 安全研究所與 EvalEval 如何讓評測結果可復現
英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。
英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。
Import AI 第 461 期回顧了多項行業動態與研究,包括非營利組織 Sequent 成立以推進 AI 對齊研究、認知公司推出高難度編碼基準 FrontierCode、小米釋出具備極高生成速度的大模型 MiMo-V2.5-Pro-UltraSpeed,以及評估 AI 科研輔助能力的 AARRI-Bench 基準。