Microsoft Research 如何預測電網的空間天氣風險
Microsoft Research 開發的機器學習系統可為美國本土 66,935 個變電站提供空間天氣風險預測,在風險出現前 30 到 60 分鐘發出警告。該系統在評估期內檢測到了近 80% 的重大空間天氣事件,並結合了太陽風觀測、AE 與 Dst 指數預測、地質條件及電網資料。
Microsoft Research 開發的機器學習系統可為美國本土 66,935 個變電站提供空間天氣風險預測,在風險出現前 30 到 60 分鐘發出警告。該系統在評估期內檢測到了近 80% 的重大空間天氣事件,並結合了太陽風觀測、AE 與 Dst 指數預測、地質條件及電網資料。
Google Research 推出了 Diffusion Controller 框架,將擴散模型的去噪過程重構為連續控制問題,用輕量級附加網路實現了對影像生成軌跡的平滑動態調整。實驗表明,其輕量級灰盒版本在匹配人類偏好的指標上表現優異,而白盒微調版本則取得了更高的勝率。
推薦理由:原文介紹了將影像生成去噪過程建模為連續控制問題的框架,並展示了其在灰盒和白盒環境下的效能表現,讀者可以據此瞭解如何兼顧生成畫質與對齊控制。
ProvenanceGuard 是一款針對 MCP 智慧體的後置生成驗證層,旨在解決交叉來源混淆問題並進行源感知的事實核查。該系統通過保持來源身份不變來分別檢查支援來源與回答中的指定來源是否一致。在包含 281 條真實醫療智慧體軌跡的測試中,它從專家判定的 361 個宣告中捕獲了 138 個不應通過的宣告,並在可識別來源的宣告中取得了約 86% 的正確選源率。
Google Research 介紹了用於自動化長影片生成的多智慧體框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四個核心元件。該框架通過全域性最佳化和世界狀態追蹤解決語義漂移與級聯失敗問題,能夠將創意轉化為分鐘級、具備多鏡頭敘事一致性的影片。
推薦理由:該研究通過多智慧體框架解決長影片生成中的視覺一致性問題,為提升影片擴散模型的長時序敘事能力提供了可複用的系統架構參考。
NVIDIA 聯合 Google DeepMind 及歐洲生物資訊研究所(EMBL-EBI)等全球研究機構,通過 AlphaFold Database 免費釋出了覆蓋超 2,800 種病毒的蛋白質複合物預測 3D 結構資料集。
推薦理由:原文介紹了由 NVIDIA 與 Google DeepMind 等機構合作開源的病毒蛋白質複合物預測資料集,讀者可以據此瞭解 AI 在生物學研究中的最新應用進展。
英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。
微軟研究團隊釋出 RetroChimera,一種用於大規模小分子合成預測的框架,並在 Nature 論文中展示其效能。RetroChimera 結合 R‑SMILES 2 與 NeuralLoc 兩種模型,通過學習式重排序實現更準確的合成路線預測。其開源實現已在 GitHub 上釋出,旨在加速藥物與材料研發。
推薦理由:RetroChimera 通過融合兩種模型提升化學合成預測,公開原始碼可加速藥物與材料研發。
Google Research 介紹了 MilleMiglia,這是一個旨在為中長途物流配送問題建立現實基準的 C++ 例項生成器。該工具通過結合空間分佈、需求和車輛排程等統計模型,生成隱私安全且符合實際的物流網路資料。相關原始碼與文件已在 GitHub 開源,以推動運籌學與供應鏈最佳化領域的後續研究。
OpenAI 分析 2026 年 4 月至 7 月超 150 萬條 ChatGPT 工作相關訊息發現,跨職業的 AI 使用正逐漸演變為常規工作流的一部分。在持續觀察的約 6,200 名員工中,跨職業任務佔比從 4 月的 13.1% 上升至 7 月的 25.9%,其中與客戶討論商品或服務等任務的次月複用率達到 54%。
Google Research 推出了 Retrieve-for-Train 框架,通過離線強化學習將複雜的查詢分解與檢索最佳化編譯至輕量級擴散檢索器中,從而消除了推理時的 CoT 推理 token 開銷。
IBM Research 團隊指出當前基準測試中的平均準確率掩蓋了智慧體的可靠性問題,並推出了用於測量和改善該問題的 Consistency Analyzer 與一致性指南。實驗表明,該方法在 AppWorld 測試中將一致性差距從 24.4 個百分點縮小至 12.0 個百分點,且未降低平均準確率。相關開原始碼與技術報告已釋出。
推薦理由:文章提出了一種測量和緩解智慧體執行不一致性的方法,對評估和提升智慧體在生產環境中的可靠性有參考價值。
Google Research 介紹了 ToolGrad 框架,這是一種採用“先生成工具使用鏈、再反向標註使用者提示詞”的答案優先範式,能夠以更低成本高效生成複雜的智慧體工具使用資料集。
推薦理由:該研究提出了一種反向生成智慧體工具使用資料集的方法,通過文本梯度迭代構建工作流,為解決合成數據成本與可擴充套件性瓶頸提供了新路徑。
OpenAI 分享了一個 AI 生成的 Navier–Stokes 世紀獎問題的解決方案,包含書面說明和 Lean 形式化證明。
推薦理由:OpenAI 通過 AI 生成的證明展示了在數學領域應用 LLM 的潛力,讀者可瞭解 AI 在嚴謹推理中的可行性。
Google Research 評估了多基因風險評分(PRS)在非歐洲目標群體中的表現,發現當目標群體樣本量較小時,利用歐洲群體進行遷移學習可提升統計效能,但隨著目標群體樣本量增大,外部資料池化的收益反而會減弱。研究表明,這一臨界點取決於具體性狀的遺傳保守性,且先進的多源群體方法需要相當規模的目標群體樣本才能超越簡單方法。
Google Research 與 HHMI Janelia 及多所高校合作,釋出了包含超過 16.6 萬個神經元和 1.25 億個突觸連線的雄性果蠅完整大腦及中樞神經系統連線圖譜。該圖譜利用 AI 技術將電子顯微鏡影像重建為 3D 結構,並經過人工校對驗證,為研究大腦工作機制提供了重要資源。相關成果已發表在 Cell 期刊上。
推薦理由:該研究釋出了迄今規模最大的完整雄性果蠅大腦及中樞神經系統連線圖譜,為神經科學研究提供了重要基礎資源。
Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。
Google Research 聯合 NASA JPL 推出了 MAPL-EMIT 深度學習框架,利用 Swin-S transformer 架構處理高光譜輻射測量資料,實現了甲烷羽流的自動檢測、定量增強預測和源頭定位。
Google Research 推出了 GlucoFM,這是一個用於連續血糖監測的自監督基礎模型,採用雙流設計將較慢的血糖趨勢與短期偏差明確分離。在多項臨床預測任務評估中,GlucoFM 的 PR-AUC 表現優於對比模型,並且在餐後血糖響應預測、跨資料集遷移以及少樣本適應場景中展現出優勢。
推薦理由:Google Research 推出的 GlucoFM 能夠有效分離動態並提升臨床預測準確率,為研究人員在代謝健康資料建模時提供了可參考的新方法。
Google Research 推出了 AgentHands,這是一個在 XR 中為智慧體對話生成互動式手勢的研究原型。該系統通過多維度分類法與工作流,將 LLM 的推理結果對映為與語音同步的 3D 手勢,提升了空間定位、複雜動作理解及安全性提示的效果。
Hugging Face 推出的 Quantization-Aware Healing(QAH)方法,讓經結構壓縮與量化的 4-bit 模型在 9 項 benchmark 中的 7 項超越了全精度原版。
Google Research 推出 Mobility-Embedded POIs (ME-POIs) 框架,將聚合匿名移動模式與文本描述融合,顯著提升地點屬性預測。在公開基準上,ME-POIs 使訪問意圖預測提升 81.9%,價格等級分類提升 75.1%,繁忙度估計準確率提升 24.7%。
Hugging Face 最新研究引入了三項測試,用於量化語音識別模型中的基準測試最佳化(benchmaxxing)現象,評估了 11 個開源 ASR 模型後發現部分高分系統會復現基準測試中的錯誤轉錄、填補被靜音的數字並根據資料集調整拼寫習慣。
推薦理由:研究指出語音識別模型會利用音訊中的線索復現公開測試集的錯誤和拼寫習慣,這有助於理解如何通過獨立測試集評估模型真實效能。
Hugging Face 團隊釋出研究探討如何為 AI 智慧體配置自蒸餾記憶,評估了從 30B 到前沿模型的 8 款模型在 AppWorld 基準上的表現。研究發現智慧體記憶效果取決於模型能力層級:強模型適合注入完整記憶,較弱模型適合精選檢索,而已飽和模型則無明顯增益。精選檢索能在僅增加 5% token 的情況下使 gpt-oss-120b 任務完成度提升 16.1 個百分點。
推薦理由:研究表明智慧體記憶容量需要根據模型能力進行校準而非盲目堆砌,為提升準確率和控制成本提供了實踐參考。
Hugging Face 釋出了 2026 年夏季開源模型現狀報告,梳理了從 1 月到 8 月期間平臺上的模型規模、下載與點贊分化、開源協議、衍生生態以及智慧體流量變化。報告指出中國實驗室在前端模型規模上領先,Qwen 成為社群衍生基石,同時端側量化和智慧體呼叫正在重塑平臺生態。
推薦理由:文章基於平臺全量資料分析了開源模型在規模、授權、社群衍生與端側部署上的最新結構性變化。
Hugging Face 舉辦了一場使用編碼智慧體逐條復現 ICML 2026 論文的駭客松,1,221 名參與者在 19 天內釋出了 6,816 份日誌並嘗試復現了 2,226 篇論文。
推薦理由:文章公佈了大規模智慧體復現學術論文的成果與發現,讀者可以從中瞭解自動化復現對檢驗科研質量的實際效果與侷限。
Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。
推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。
Google Research 介紹了知識 profiling 行為框架和 WikiProfile 基準,用以衡量大語言模型的編碼與檢索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事實已被編碼,但模型仍無法直接檢索其中 26% 至 34% 的事實。這說明事實性錯誤主要源於知識無法可靠呼叫的檢索失敗,而非知識未被編碼的儲存缺失。
推薦理由:研究指出前沿大語言模型的知識編碼已接近飽和,準確率瓶頸在於檢索而非儲存,為後續訓練與推理最佳化提供了新方向。
Google Research 推出了 AMIE 的即時影片配置版本 AMIE (Video),能夠基於 Gemini 和 Project Astra 進行同步臨床影片問診,感知非引導性的臨床非語言線索並進行即時診斷推理。
推薦理由:這項研究展示了多模態醫療AI在影片問診中的專家級表現,為遠端醫療系統的架構設計提供了實證參考。
Multiverse Computing 在其最新論文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出離線 Top‑100 logits 快取與分塊 KL 損失兩項改進。
推薦理由:本文提出的離線Top‑K logits快取和分塊KL損失顯著降低視訊記憶體需求,使大規模LLM蒸餾可在單GPU上完成,降低成本並提升實驗效率。
Google Research 推出了基於 Chain-of-Evidence 架構的自主科研框架 Science One,通過構建即時證據鏈與 CoE Audit 評估協議解決 AI 生成論文中的幻覺與不可復現問題。結果顯示該框架在 MLE-Bench 等基準測試中實現了零幻覺引用與完全可驗證的分數,同時達到了 SOTA 效能。
推薦理由:原文介紹了通過證據鏈確保 AI 科研成果可驗證的新框架,讀者可以據此評估自主研究系統的可靠性邊界。
研究團隊擴充套件了 K-Search 進化核心搜尋框架併為其增加了 MLX 後端,通過結構化 CUDA 到 MLX 翻譯層將 NVIDIA 生態的核心最佳化經驗自動遷移至 Apple Silicon。實驗表明,該方法在注意力核心上實現了接近專家的效能,在 Mamba SSM 核心的預填充階段取得了約 20 倍的吞吐量提升。
推薦理由:研究展示瞭如何通過結構化翻譯層將 CUDA 最佳化經驗遷移至 Apple Silicon,為異構硬體的高效能核心開發提供了可複用的方法。
Berkeley AI Research 提出了 ABBEL 框架,通過將長互動歷史替換為自然語言信念狀態並引入信念 grading,解決大語言模型在長視界任務中上下文無法無限擴充套件及傳統自我總結效能下降的問題。實驗表明,在 CollabBench 環境中,ABBEL-rec-BG 將與全上下文模型的效能差距縮小了約 50%,訓練步數減少 50%,同時峰值上下文 token 顯著降低。
Google Research 介紹了 SymptomAI,這是一種用於日常症狀評估的對話式 AI 智慧體,並在 13917 名參與者的全國規模研究中評估了其鑑別診斷效能。研究發現,由智慧體主動引導提問的策略顯著優於無引導的基線,且其生成的鑑別診斷結果在臨床專家盲測中的準確率表現良好。此外,研究還發現 SymptomAI 的診斷結果與參與者 Fitbit 可穿戴裝置的生物訊號變化趨勢相吻合。
推薦理由:研究評估了基於大模型的對話式症狀評估工具在真實患者人群中的診斷表現,並結合可穿戴裝置生理指標進行了驗證。
Google Research 在其 Willow 超導處理器上演示了利用強化學習實現量子計算機持續校準的方法,顯著降低了邏輯錯誤率。實驗中,RL 訓練將錯誤率降低 3.5 倍,最終邏輯錯誤率低至每千個糾錯週期不到一次,並在數百量子位元的模擬中驗證了可擴充套件性。該方法將量子錯誤檢測事件作為主動學習訊號,展示了可持續計算的新範式。
推薦理由:通過強化學習實現量子計算機持續校準,顯著降低邏輯錯誤率,展示了可擴充套件的自適應控制方法,為未來大規模量子計算提供可行路徑。
Google Research 通過數學分析解釋了擴散模型的創造力來源,指出正則化導致的分數平滑使模型在去噪過程中產生插值,從而生成新穎影像。文章以一維示例說明分數平滑如何軟化梯度,並通過實驗驗證權重衰減對其影響;在多維情形下,分數平滑幫助模型在資料流形上平衡質量與新穎性。作者已公開實驗程式碼。
推薦理由:本文闡釋擴散模型創造力來源,揭示正則化導致的分數平滑如何產生新穎影像,並指出可通過調節正則化實現更具創造性的生成。
Google Research 推出了 SensorFM,這是一個在大規模未標註可穿戴感測器資料上預訓練的大型感測器基礎模型。該模型使用超一萬億分鐘的多模態感測器訊號進行自監督訓練,能夠跨越心血管、代謝、睡眠和心理健康等多個領域進行通用表徵,並支援構建更精準的個人健康智慧體。
推薦理由:研究展示瞭如何利用大規模未標註感測器資料訓練通用生理表徵,讀者可以瞭解其在多工泛化和健康智慧體中的表現。
Google Research 在 Nature Cities 發表研究,通過在 10 個美國大城市進行的大規模真實實驗表明,利用導航平臺對一小部分行程進行協同路由干預,能夠分散交通並顯著提高行駛速度、減少碳排放。該研究修改了 Google Maps 演算法以引導車輛避開擁堵路段,通過系統性的城市級交叉實驗驗證了網路化導航技術在改善整體交通狀況方面的有效性。
推薦理由:Google Research 在 Nature Cities 發表研究,通過在 10 個美國大城市進行的大規模真實實驗表明,利用導航平臺對一小部分行程進行協同路由干預,能夠分散交通並顯著提高行駛速度、減少碳排放。該研究修改了 Google Maps 演算法以引導車輛避開擁堵路段,通過系統性的城市級交叉實驗驗證了網路化導航技術在改善整體交通狀況方面的有效性。
伯克利人工智慧研究院(BAIR)團隊探討了推理成本大幅下降後資料系統面臨的新機遇與新挑戰,指出未來資料系統需要圍繞 Agent 的互動、底層協同及自主合成三個維度進行徹底重構。文章重點分析了 Agent 推理帶來的高併發複雜查詢需求、多 Agent 協作所需的狀態管理機制以及利用 Agent 從零自主合成專用資料系統的方法。
推薦理由:文章探討了零成本推理時代對資料系統的影響,提出了面向、由和基於 Agent 的三大數據系統設計方向,為理解未來智慧基礎設施演進提供了前瞻視角。
DiScoFormer 是一款基於 Transformer 架構的新型模型,只需單次前向傳播即可同時估計分佈的密度與得分且無需重新訓練。在 100 維測試中,它將得分誤差降低約 6.5 倍,密度誤差降低超過 37 倍。該模型以高斯混合模型進行訓練,能夠適應分佈外輸入並在多個領域中複用。
Google Research 提出了線性彈性快取方法,將頁面驅逐建模為滑雪租賃問題,並利用輕量級機器學習動態調整快取大小。在 Spanner 生產工作負載的測試中,該方法使記憶體使用量減少了 15.5%,快取命中率略有下降,並將總擁有成本(TCO)降低了約 5%。