跳到正文

#開源生態

RSS
今日 0 則
9月23日週三
  1. OpenAI News70

    推出 MentalHealthBench 心理健康評測基準

    OpenAI推出MentalHealthBench,一個多語言、多情境的心理健康對話評測基準。該基準由80多名全球心理健康專家共同制定,覆蓋從日常對話到危機情境的多種場景,並提供專家評估標準和自動化評分工具。

    推薦理由:OpenAI釋出MentalHealthBench,提供多語言、多情境的心理健康評測基準,幫助研究者評估模型安全性與實用性。

9月19日週六
  1. Google Research53

    Google Research 推出 MilleMiglia:面向中長途物流的現實例項生成器

    Google Research 介紹了 MilleMiglia,這是一個旨在為中長途物流配送問題建立現實基準的 C++ 例項生成器。該工具通過結合空間分佈、需求和車輛排程等統計模型,生成隱私安全且符合實際的物流網路資料。相關原始碼與文件已在 GitHub 開源,以推動運籌學與供應鏈最佳化領域的後續研究。

9月2日週三
8月25日週二
8月13日週四
  1. Hugging Face Blog74

    Hugging Face 部落格:復現 2,200 篇 ICML 論文的經驗與發現

    Hugging Face 舉辦了一場使用編碼智慧體逐條復現 ICML 2026 論文的駭客松,1,221 名參與者在 19 天內釋出了 6,816 份日誌並嘗試復現了 2,226 篇論文。

    推薦理由:文章公佈了大規模智慧體復現學術論文的成果與發現,讀者可以從中瞭解自動化復現對檢驗科研質量的實際效果與侷限。

8月10日週一
  1. Hugging Face Blog64

    讓知識蒸餾足夠低成本以實現規模化執行

    Multiverse Computing 在其最新論文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出離線 Top‑100 logits 快取與分塊 KL 損失兩項改進。

    推薦理由:本文提出的離線Top‑K logits快取和分塊KL損失顯著降低視訊記憶體需求,使大規模LLM蒸餾可在單GPU上完成,降低成本並提升實驗效率。

7月1日週三
6月30日週二
5月18日週一
  1. Import AI46

    Import AI 457: AI stuxnet、Muon 最佳化器與正向對齊

    研究人員對擁有 20 多年曆史的 fast16.sys 計算機病毒進行了深入調查,發現其會選擇性地篡改高精度計算軟體的結果以破壞科研專案。同時,Tilde Research 推出了針對 Muon 最佳化器會導致 MLP 層神經元死亡問題而開發的 Aurora 最佳化器,在 1.1B 引數 transformers 和約 100B tokens 訓練測試中取得了更低的最終損失及更高的 MMLU 分數。

3月25日週三
  1. Google Research60

    Google Research 推出 TurboQuant:通過極低壓縮實現 AI 效率革新

    Google Research 推出了 TurboQuant 壓縮演算法及相關演算法 Quantized Johnson-Lindenstrauss 和 PolarQuant,用於解決向量量化中的記憶體開銷問題。實驗表明,TurboQuant 在長文本基準測試中能夠將 KV 快取記憶體大小減少至少 6 倍且不損失模型準確率,並在 H100 GPU 上實現了顯著的計算加速。

    推薦理由:原文給出了新演算法的壓縮率和長文本評測結果,讀者可以據此評估其在降低記憶體開銷方面的實際效用。

3月13日週五
  1. Berkeley AI Research68

    大規模 LLM 互動識別方法

    本文介紹了 SPEX 與 ProxySPEX 兩種演算法,利用稀疏恢復和層次結構在大規模 LLM 互動識別中顯著降低計算成本。SPEX 通過訊號處理和編碼理論實現數千個元件的交互發現,ProxySPEX 在保持效能的同時將 ablation 數量減少約 10 倍。兩種方法已在 SHAP‑IQ 倉庫公開,支援特徵、資料和模型元件的解釋。

    推薦理由:SPEX 和 ProxySPEX 通過稀疏恢復和層次結構顯著降低了交互發現的計算成本,為大規模 LLM 解釋提供了可行方案。