跳到正文

#資料/訓練

RSS
今日 0 則
9月25日週五
  1. AWS Machine Learning Blog70

    Amazon SageMaker HyperPod 與 Qumulo 實現多區域訓練

    本文介紹瞭如何使用 Amazon SageMaker HyperPod 與 Qumulo 的 Cloud Native 解決方案,在不同 AWS 區域間進行大規模 AI 模型訓練,並給出了跨區域訓練的效能驗證結果。

    推薦理由:文章詳細說明如何使用 SageMaker HyperPod 與 Qumulo 進行跨區域訓練,並給出驗證結果,幫助讀者評估跨區域訓練的效能與成本。

9月16日週三
8月10日週一
  1. Hugging Face Blog64

    讓知識蒸餾足夠低成本以實現規模化執行

    Multiverse Computing 在其最新論文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出離線 Top‑100 logits 快取與分塊 KL 損失兩項改進。

    推薦理由:本文提出的離線Top‑K logits快取和分塊KL損失顯著降低視訊記憶體需求,使大規模LLM蒸餾可在單GPU上完成,降低成本並提升實驗效率。

7月23日週四
  1. Google Research70

    讓量子計算機從錯誤中學習

    Google Research 在其 Willow 超導處理器上演示了利用強化學習實現量子計算機持續校準的方法,顯著降低了邏輯錯誤率。實驗中,RL 訓練將錯誤率降低 3.5 倍,最終邏輯錯誤率低至每千個糾錯週期不到一次,並在數百量子位元的模擬中驗證了可擴充套件性。該方法將量子錯誤檢測事件作為主動學習訊號,展示了可持續計算的新範式。

    推薦理由:通過強化學習實現量子計算機持續校準,顯著降低邏輯錯誤率,展示了可擴充套件的自適應控制方法,為未來大規模量子計算提供可行路徑。

7月16日週四
  1. Google Research62

    揭示擴散模型創造力的奧秘

    Google Research 通過數學分析解釋了擴散模型的創造力來源,指出正則化導致的分數平滑使模型在去噪過程中產生插值,從而生成新穎影像。文章以一維示例說明分數平滑如何軟化梯度,並通過實驗驗證權重衰減對其影響;在多維情形下,分數平滑幫助模型在資料流形上平衡質量與新穎性。作者已公開實驗程式碼。

    推薦理由:本文闡釋擴散模型創造力來源,揭示正則化導致的分數平滑如何產生新穎影像,並指出可通過調節正則化實現更具創造性的生成。

7月6日週一
  1. Hugging Face Blog47

    PRX 第 4 部分:資料策略

    PRX 團隊公開了 7B 模型的預訓練資料策略,詳細闡述了結合公共與內部資料集、利用 VLM 重新加長文本標註以及通過 Mosaic Streaming(MDS)和 Lance 格式進行分散式訓練的完整資料流水線。該團隊放棄了預計算文本潛變數,轉而在訓練迴圈中動態執行 Qwen3-VL 文本編碼器,僅帶來約 3-4% 的吞吐量成本。

6月4日週四
  1. Google Research72

    Google開源水文框架,開啟洪水韌性新篇章

    Google Research公開了其水文模型框架,供各國氣象機構在GitHub上使用和構建AI洪水預報模型。該框架基於PyTorch實現LSTM網路,支援使用Caravan資料集訓練,並已在Czech Hydrometeorological Institute驗證,提升預測時效6天。

    推薦理由:Google公開的水文框架讓各國氣象機構可自行訓練AI洪水預報模型,提升預測時效並降低技術門檻。

5月28日週四
  1. Google Research59

    零信任聚合實現私有分析

    Google Research 在部落格中公佈了一種零信任聚合方案,利用單次加密提交和TEE硬體隔離,提供了更高效的隱私分析。該方案基於晶格加密,客戶端可在單條訊息中提交資料,伺服器僅能解密聚合結果;TEE 進一步驗證協議執行。Google 已將此技術用於 SafetyCore、Pixel Recorder、Gboard 等 Android 裝置,以在不洩露使用者內容的前提下評估模型效能並提升安全性。

3月13日週五
  1. Berkeley AI Research68

    大規模 LLM 互動識別方法

    本文介紹了 SPEX 與 ProxySPEX 兩種演算法,利用稀疏恢復和層次結構在大規模 LLM 互動識別中顯著降低計算成本。SPEX 通過訊號處理和編碼理論實現數千個元件的交互發現,ProxySPEX 在保持效能的同時將 ablation 數量減少約 10 倍。兩種方法已在 SHAP‑IQ 倉庫公開,支援特徵、資料和模型元件的解釋。

    推薦理由:SPEX 和 ProxySPEX 通過稀疏恢復和層次結構顯著降低了交互發現的計算成本,為大規模 LLM 解釋提供了可行方案。

3月12日週四
  1. Google Research68

    AI 驅動閃洪預測,守護城市

    Google Research 推出 AI 驅動的城市閃洪預測系統,並在 Flood Hub 上提供服務。該系統利用 Groundsource 資料集和 Gemini 分析新聞報道,構建 24 小時預警模型。

    推薦理由:Google 通過 AI 預測城市閃洪,提供 24 小時預警,填補全球南方缺乏預警的空白,可能挽救數千人生命,並提升災害響應效率。

  2. Google Research72

    推出 Groundsource:利用 Gemini 將新聞報道轉化為資料

    Google Research 推出 Groundsource,利用 Gemini 將全球新聞報道轉化為結構化災害資料,首次公開 260 萬條洪水記錄,覆蓋 150+ 國家。該方法通過新聞文本提取、時間空間推理和地圖對映,驗證準確率達 82%,顯著擴充套件現有災害資料庫,為城市規劃、保險和應急響應提供可靠的歷史基線。

    推薦理由:Groundsource 利用 Gemini 將全球新聞報道轉化為結構化災害資料,首次公開 260 萬條洪水記錄,覆蓋 150+ 國家,顯著提升災害預測精度,為城市規劃、保險和應急響應提供可靠的歷史基線。

1月10日週六
  1. Berkeley AI Research48

    基於資訊驅動的成像系統設計

    研究人員提出一種基於資訊量的成像系統評估與最佳化框架,能夠直接衡量測量的區分能力。該框架通過從噪聲測量中估計互資訊,預測四個領域(彩色攝影、射電天文、無鏡成像、顯微鏡)的解碼效能,並在不需要重建演算法的情況下實現與最先進端到端方法相當的設計,同時降低記憶體和計算需求。