跳到正文
Hugging Face Blog·· 29 天前AI 評分55

BenchMIRT:大模型基準測試究竟在測量什麼?

BenchMIRT: What are LLM benchmarks actually measuring?

AI 導讀

Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。

該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。

來源:Hugging Face Blog · huggingface.co