推出 MentalHealthBench 心理健康評測基準
OpenAI推出MentalHealthBench,一個多語言、多情境的心理健康對話評測基準。該基準由80多名全球心理健康專家共同制定,覆蓋從日常對話到危機情境的多種場景,並提供專家評估標準和自動化評分工具。
推薦理由:OpenAI釋出MentalHealthBench,提供多語言、多情境的心理健康評測基準,幫助研究者評估模型安全性與實用性。
OpenAI推出MentalHealthBench,一個多語言、多情境的心理健康對話評測基準。該基準由80多名全球心理健康專家共同制定,覆蓋從日常對話到危機情境的多種場景,並提供專家評估標準和自動化評分工具。
推薦理由:OpenAI釋出MentalHealthBench,提供多語言、多情境的心理健康評測基準,幫助研究者評估模型安全性與實用性。
Google Research 介紹了 MilleMiglia,這是一個旨在為中長途物流配送問題建立現實基準的 C++ 例項生成器。該工具通過結合空間分佈、需求和車輛排程等統計模型,生成隱私安全且符合實際的物流網路資料。相關原始碼與文件已在 GitHub 開源,以推動運籌學與供應鏈最佳化領域的後續研究。
Google Research 聯合 NASA JPL 推出了 MAPL-EMIT 深度學習框架,利用 Swin-S transformer 架構處理高光譜輻射測量資料,實現了甲烷羽流的自動檢測、定量增強預測和源頭定位。
Hugging Face 推出的 Quantization-Aware Healing(QAH)方法,讓經結構壓縮與量化的 4-bit 模型在 9 項 benchmark 中的 7 項超越了全精度原版。
Hugging Face 舉辦了一場使用編碼智慧體逐條復現 ICML 2026 論文的駭客松,1,221 名參與者在 19 天內釋出了 6,816 份日誌並嘗試復現了 2,226 篇論文。
推薦理由:文章公佈了大規模智慧體復現學術論文的成果與發現,讀者可以從中瞭解自動化復現對檢驗科研質量的實際效果與侷限。
Multiverse Computing 在其最新論文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出離線 Top‑100 logits 快取與分塊 KL 損失兩項改進。
推薦理由:本文提出的離線Top‑K logits快取和分塊KL損失顯著降低視訊記憶體需求,使大規模LLM蒸餾可在單GPU上完成,降低成本並提升實驗效率。
IBM Research 釋出了 ScarfBench,一個用於評估 AI 代理在企業 Java 框架遷移任務中的基準。該基準包含 34 個應用、102 個框架實現、204 個遷移任務,約 151K 行程式碼。
DiScoFormer 是一款基於 Transformer 架構的新型模型,只需單次前向傳播即可同時估計分佈的密度與得分且無需重新訓練。在 100 維測試中,它將得分誤差降低約 6.5 倍,密度誤差降低超過 37 倍。該模型以高斯混合模型進行訓練,能夠適應分佈外輸入並在多個領域中複用。
研究人員對擁有 20 多年曆史的 fast16.sys 計算機病毒進行了深入調查,發現其會選擇性地篡改高精度計算軟體的結果以破壞科研專案。同時,Tilde Research 推出了針對 Muon 最佳化器會導致 MLP 層神經元死亡問題而開發的 Aurora 最佳化器,在 1.1B 引數 transformers 和約 100B tokens 訓練測試中取得了更低的最終損失及更高的 MMLU 分數。
Google Research 推出了 TurboQuant 壓縮演算法及相關演算法 Quantized Johnson-Lindenstrauss 和 PolarQuant,用於解決向量量化中的記憶體開銷問題。實驗表明,TurboQuant 在長文本基準測試中能夠將 KV 快取記憶體大小減少至少 6 倍且不損失模型準確率,並在 H100 GPU 上實現了顯著的計算加速。
推薦理由:原文給出了新演算法的壓縮率和長文本評測結果,讀者可以據此評估其在降低記憶體開銷方面的實際效用。
本文介紹了 SPEX 與 ProxySPEX 兩種演算法,利用稀疏恢復和層次結構在大規模 LLM 互動識別中顯著降低計算成本。SPEX 通過訊號處理和編碼理論實現數千個元件的交互發現,ProxySPEX 在保持效能的同時將 ablation 數量減少約 10 倍。兩種方法已在 SHAP‑IQ 倉庫公開,支援特徵、資料和模型元件的解釋。
推薦理由:SPEX 和 ProxySPEX 通過稀疏恢復和層次結構顯著降低了交互發現的計算成本,為大規模 LLM 解釋提供了可行方案。