跳到正文

#安全/對齊

RSS
今日 0 則
9月2日週三
  1. Hugging Face Blog55

    BenchMIRT:大模型基準測試究竟在測量什麼?

    Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。

5月18日週一
  1. Import AI46

    Import AI 457: AI stuxnet、Muon 最佳化器與正向對齊

    研究人員對擁有 20 多年曆史的 fast16.sys 計算機病毒進行了深入調查,發現其會選擇性地篡改高精度計算軟體的結果以破壞科研專案。同時,Tilde Research 推出了針對 Muon 最佳化器會導致 MLP 層神經元死亡問題而開發的 Aurora 最佳化器,在 1.1B 引數 transformers 和約 100B tokens 訓練測試中取得了更低的最終損失及更高的 MMLU 分數。