Google DeepMind 介紹 WeatherNext 如何協助美國國家颶風中心預測颶風梅利莎
Google DeepMind 的天氣模型 WeatherNext 成功提前五天預測了 2025 年颶風梅利莎在牙買加增強至五級強颶風的路徑與強度。該模型通過結合全球天氣模式與極端熱帶氣旋資料集,兼顧了傳統模型難以同時做到的路徑與強度預測能力。
推薦理由:文章詳細記錄了 AI 天氣模型在颶風預報中的實際表現與提前天數,讀者可以據此評估其在極端氣象預測中的應用潛力。
Google DeepMind 的天氣模型 WeatherNext 成功提前五天預測了 2025 年颶風梅利莎在牙買加增強至五級強颶風的路徑與強度。該模型通過結合全球天氣模式與極端熱帶氣旋資料集,兼顧了傳統模型難以同時做到的路徑與強度預測能力。
推薦理由:文章詳細記錄了 AI 天氣模型在颶風預報中的實際表現與提前天數,讀者可以據此評估其在極端氣象預測中的應用潛力。
Google DeepMind 正式推出 Gemini 3.5 模型系列的首款型號 3.5 Flash,主打前沿智慧與高速推理,重點提升智慧體和編碼任務表現。3.5 Flash 在 Terminal-Bench 2.1 等基準上表現優於 Gemini 3.1 Pro,速度達到其他前沿模型的 4 倍,目前已全面向全球使用者、開發者及企業推出。
Google DeepMind 釋出了基於 Gemini 構建的協作式多智慧體 AI 系統 Co-Scientist,旨在通過生成、辯論和演化科學假說來加速生命科學等領域的科研突破。該系統由生成、接近度、反射、排名、演化和元審查等多個專業智慧體組成,並引入了類似 AlphaGo 的積分制辯論機制來驗證和篩選最有潛力的研究方向。目前該系統正通過全新實驗工具逐步向研究人員開放。
推薦理由:Google DeepMind 釋出了基於 Gemini 構建的多智慧體科學研究系統 Co-Scientist,讀者可以瞭解其通過模擬科學辯論生成和演化假說的具體架構與應用效果。
Adaptive Parallel Reasoning 提出讓模型自行決定何時並行拆分、執行緒數量和協調方式,以提升推理效率。ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法已實現多執行緒並行推理,減少上下文旋轉和推理延遲。此範式可在數學、編碼和代理任務中顯著降低推理時間,避免上下文旋轉問題。
Google DeepMind 總結了 Gemini 驅動的編碼智慧體 AlphaEvolve 在科學研究、AI 基礎設施最佳化及商業應用等領域的最新進展。該系統在基因組學測序錯誤校正、電網最佳化、量子物理模擬以及下一代 TPU 晶片設計等多個場景中顯著提升了效能和效率,並正通過 Google Cloud 向各行業企業開放應用。
推薦理由:原文梳理了該系統一年來的應用成果與商業拓展,讀者可以據此瞭解其在科學研究和工程基礎設施中的落地成效。
Google Research 長期通過開源軟體、開放訪問資料集及全球夥伴關係推動科學創新,其開源工具和資料已賦能全球逾 25 萬名研究人員與開發者。在基因組學領域,其深度學習工具已處理 250 萬個體的基因組;在醫療健康領域,Health AI Developer Foundations 旗下的 MedGemma 等模型下載量已超 480 萬次。
Google DeepMind 宣佈推出 AI co-clinician 研究計劃,旨在探索結合多模態能力的醫療人工智慧系統,以輔助醫生並提升遠端醫療和臨床決策的質量。該系統採用雙Agent架構,在多項模擬臨床評估與藥物問答基準測試中展現出處理複雜醫療任務的潛力。
推薦理由:原文介紹了醫用人工智慧研究專案的架構與模擬評估結果,讀者可以瞭解多模態技術在醫療場景中的實際表現與安全性保障。
Google Research 介紹了 Empirical Research Assistance(ERA)在公共衛生預測、宇宙學計算、氣候碳監測和神經科學等四個領域的應用進展。研究顯示,ERA 結合先進模型能夠解決傳統方法難以應對的複雜方程與資料分析問題,並接近或超越現有專業工具的表現。
Mistral AI 宣佈 Workflows 進入公開預覽階段,作為 Studio 的一部分為企業 AI 提供持久化執行、可觀測性和容錯能力。開發者使用 Python 編寫工作流,支援通過 Le Chat 觸發,底層基於 Temporal 構建並採用控制面與資料面分離的部署模型。
推薦理由:原文給出了架構設計和落地案例,讀者可以據此評估其在生產環境中的編排能力。
Google DeepMind 宣佈與韓國科學技術資訊通訊部建立全新合作伙伴關係,將通過在首爾設立 AI 園區、開放先進的科學 AI 模型以及開展人才與安全合作來支援韓國的 AI 戰略。雙方合作將涵蓋生命科學、氣象和氣候等關鍵領域,並與首爾國立大學、韓國科學技術院等機構展開科研合作。
Google 宣佈在 Google Photos 的 Auto frame 功能中推出全新的照片視角重構方案,利用機器學習模型理解場景空間佈局並藉助生成式 AI 從新視角生成影像。該方法分為三維場景與相機估計、生成式補全與修飾兩個階段,通過估計三維點 map 並調整相機內外參來修復廣角畸變和調整構圖。
推薦理由:Google Research 公佈了一種將照片解釋為三維場景並自動調整相機視角與焦距的新方法,通過結合三維點圖估計與生成式擴散模型,在 Google Photos 的 Auto frame 功能中實現了拍照後的視角重構與畸變修正。
Google DeepMind 推出了 Decoupled DiLoCo 架構,通過將大規模訓練拆分到非同步執行的獨立計算叢集中,降低了跨資料中心訓練的頻寬需求並增強了硬體容錯能力。測試表明,該架構使用 Gemma 4 模型在發生硬體故障時保持了高可用性,併成功在四個美國不同區域以低頻寬完成了 120 億引數模型的預訓練。
推薦理由:該架構通過非同步計算與低頻寬需求,解決了跨資料中心訓練大模型的同步瓶頸與硬體故障痛點。
Google Research 推出了 ReasoningBank 智慧體記憶框架,通過從成功和失敗經驗中提取結構化推理模式來實現測試期自我進化。該方法通過記憶感知測試期擴充套件(MaTTS)機制,在網頁瀏覽和軟體工程基準測試中顯著提升了智慧體的成功率和執行效率。
推薦理由:文章介紹了從成功與失敗經驗中提取結構化推理模式的記憶框架,讀者可以據此瞭解如何通過記憶增強智慧體的測試期擴充套件能力。
Google DeepMind 宣佈與 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 達成合作,共同加速企業的 AI 驅動轉型並推動前沿技術的大規模應用。合作重點包括構建行業專屬的 AI 方案、讓合作伙伴獲得前沿模型(如 Gemini 系列)的早期訪問許可權以及對接 AI 領導層。
GRASP 是一種新的梯度規劃器,針對學習到的世界模型實現長時序規劃。它通過將軌跡提升到虛擬狀態實現並行最佳化、在狀態迭代中加入噪聲以增強探索、並重塑梯度以避免脆弱的狀態輸入梯度,從而顯著提升規劃魯棒性和速度。實驗顯示在 Push‑T 任務中,GRASP 在更長時間步上取得更高成功率且耗時更短。詳情見論文 https://arxiv.org/abs/2602.00475。
推薦理由:GRASP 通過提升狀態、加入噪聲與梯度重塑,解決了大規模世界模型長時序規劃的梯度爆炸與不穩定問題。
Google Research 介紹了 Simula 框架,這是一種採用第一性原理構建整個合成數據集的種子無關且具身智慧的方法。該框架通過全域性多元化、區域性多元化、複雜化和質量檢查四個可控軸來分解生成過程,並在多個領域評估中展示了最佳化資料屬性對下游效能的提升。
推薦理由:文章介紹了通過第一性原理構建合成數據集的 Simula 框架,為解決稀缺領域的資料瓶頸提供了可程式設計的工作流方案。
Google Research 推出了名為 MoGen 的開源神經形態生成模型,利用 point cloud flow matching 模擬逼真的 3D 神經元形狀以增強訓練資料。將 MoGen 生成的合成數據加入訓練管道,使重構錯誤率降低了 4.4%,並顯著減少了未來全腦對映所需的人工校對工作量。
Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表達力和音質,支援 70+ 語言和多說話人對話,並通過細粒度音訊標籤讓開發者可用自然語言控制語音風格。該模型在人工分析 TTS 評測中獲得 1,211 Elo 分,並已在 Gemini API、Vertex AI 及 Google AI Studio 預覽。
推薦理由:Gemini 3.1 Flash TTS 通過細粒度音訊標籤提升可控性與表達力,支援 70+ 語言,支援多說話人對話,適合企業與開發者構建多語種語音應用,且在人工分析 TTS 評測中獲得 1,211 Elo 分。
Google Research 聯合紐約大學等機構推出了 Vantage,這是一個利用生成式 AI 在模擬環境中評估批判性思維和協作等未來核心技能的實驗專案。該系統通過執行大模型動態引導多方對話來製造情境挑戰,並由評估大模型結合教育評分標準生成技能地圖與反饋。Vantage 目前已在 Google Labs 開放英文版本註冊。
Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。
推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。
Google Research 釋出 ConvApparel 資料集,旨在衡量並彌合 LLM 驅動的使用者模擬器的真實性差距。該資料集包含 4,000+ 人機多輪對話,近 15,000 輪,覆蓋服裝購物場景。通過雙代理收集協議、人口統計對齊、人類相似度評分和反事實驗證三大支柱,評估 Prompted、ICL 與 SFT 模擬器的真實性。
Google Research 推出兩款 AI 代理——PaperVizAgent 與 ScholarPeer,分別用於生成高質量學術圖表和自動化同行評審。
推薦理由:兩款 AI 代理在圖表生成和同行評審上顯著優於現有基線,展示了多代理協作在科研流程中的潛力,為科研人員減輕行政負擔,提升工作效率。
Google Research 通過一套基於心理問卷的情境判斷測試,評估了 25 種 LLM 在行為傾向上的對齊程度。結果顯示,模型在共識度高的場景中可達 90% 以上的方向性對齊,但在低共識場景下對齊率僅停留在 80% 左右。
Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。
推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。
Google Research 釋出研究《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,探討了 AI 評測中樣本數量(N)與每個樣本評測者數量(K)之間的權衡關係。
Mistral AI 推出了專為人類開發者與智慧體共同設計的命令列工具 Spaces,通過將互動式輸入轉化為標誌、建立基於外掛的結構化資料介面以及自動生成專案上下文檔案,實現了工具的高效協同與自主執行。
推薦理由:文章介紹了 Mistral AI 開發 Spaces 命令列工具的經驗,闡述了通過將互動式輸入對映為標誌、設計基於外掛的資料結構以及生成專案上下文檔案,使開發者工具同時適配人類與智慧體,從而提升整體可複用性的設計原則。
Google Research 在新白皮書中指出,未來的量子計算機可能會用比此前預估更少的量子位元和門數破解保護加密貨幣的橢圓曲線密碼學。研究團隊給出了破解 ECDLP-256 的更新量子資源估算,並採用零知識證明方法在不洩露攻擊細節的前提下驗證漏洞,同時敦促加密貨幣社群向後量子密碼學遷移。
推薦理由:原文給出了量子計算機破解加密貨幣的具體資源估算和零知識證明驗證方法,讀者可以據此評估後量子密碼學遷移的緊迫性。
Google DeepMind 釋出了由 Gemini 驅動的 AI 滑鼠指標實驗專案與互動原則,旨在讓使用者無需切換視窗即可通過指向和語音在 Chrome 等產品中直接呼叫 AI 能力。
推薦理由:原文介紹了將 AI 融入滑鼠指標的互動理念與實驗功能,讀者可以據此瞭解未來跨應用多模態互動的設計方向。
Google Research 宣佈推出 Vibe Coding XR 工作流,結合 Gemini 的長上下文推理與網路端 XR Blocks 框架,將自然語言直接轉換為物理感知的 Android XR 應用。該系統通過專用系統提示詞和程式碼模板自動處理空間邏輯,讓開發者能夠在短時間內快速構建和測試空間計算原型。
推薦理由:原文公佈了結合大模型與空間計算框架的具體實現方案,讀者可以據此瞭解如何通過自然語言快速生成擴充套件現實應用。
Google Research 推出了 TurboQuant 壓縮演算法及相關演算法 Quantized Johnson-Lindenstrauss 和 PolarQuant,用於解決向量量化中的記憶體開銷問題。實驗表明,TurboQuant 在長文本基準測試中能夠將 KV 快取記憶體大小減少至少 6 倍且不損失模型準確率,並在 H100 GPU 上實現了顯著的計算加速。
推薦理由:原文給出了新演算法的壓縮率和長文本評測結果,讀者可以據此評估其在降低記憶體開銷方面的實際效用。
Google Research 推出了 S2Vec,這是一個旨在學習城市和建築環境通用嵌入的自監督框架。該框架利用 S2 幾何庫將地球表面劃分為多解析度單元,將要素光柵化為多層影像,並通過掩碼自編碼技術在不需要手動標籤的情況下捕捉地理空間特徵。評估結果表明,S2Vec 在零樣本地理適應等社會經濟預測任務中表現出極強的效能,但在樹木覆蓋和高程等環境任務中仍需結合衛星影像嵌入來提升效果。
Mistral AI 釋出 4B 引數量的語音生成模型 Voxtral TTS,支援 9 種語言的高質量語音合成與低延遲流式傳輸。該模型具備上下文理解、說話人建模及零樣本跨語言語音適應能力,已通過 API、Mistral Studio 和 Hugging Face 開放。
推薦理由:原文公佈了架構細節和零樣本跨語言能力,讀者可以據此評估它在即時語音工作流中的表現。
Google Research 在 The Check Up 活動上公佈了醫療健康領域的最新研究進展,涵蓋個性化醫療、臨床協作、開發者生態、公共衛生及生物醫學發現。
推薦理由:Google Research 公佈了醫療健康領域的最新研究成果與進展,讀者可以據此瞭解其技術在臨床、公共衛生和生物醫藥方面的實際應用方向。
Google Research 與英國國家醫療服務體系等機構合作在 Nature Cancer 發表了兩項研究,評估了基於人工智慧的乳腺癌檢測系統。研究表明,該系統在獨立篩查中展現出更高的癌症檢測靈敏度,並在融入雙人閱讀工作流時達到了非劣效的整體效能,同時有望大幅減少人工閱讀的工作量。
推薦理由:原文公佈了兩項評估乳腺癌篩查人工智慧系統的研究結果,讀者可以據此瞭解人工智慧在醫療影像診斷中的效能表現與臨床整合潛力。
Mistral AI 推出 Forge,一套面向企業的 AI 模型構建系統,幫助組織在自有資料上訓練、微調並持續改進專屬模型。Forge 覆蓋預訓練、後訓練、強化學習等全生命週期,支援 dense 與 MoE 架構、多模態輸入,並以 Agent 為先設計,適用於政府、金融、軟體、製造等多行業場景。
推薦理由:Forge 讓企業能在自有資料上訓練專屬模型,提升內部流程自動化與合規性,並通過持續強化學習實現模型與業務目標的動態對齊。
Mistral AI 釋出了 Mistral Small 4,這是一款統一推理、多模態與編碼功能的模型,採用 119B 引數、256k 上下文視窗,支援可配置推理強度,提供 40% 的延遲降低和 3 倍的吞吐量提升。該模型採用 Apache 2.0 許可,支援 vLLM、llama.cpp、SGLang 等開源框架,並已加入 NVIDIA Nemotron 聯盟。
推薦理由:Mistral Small 4 將推理、多模態與編碼功能統一,提供可配置推理強度和高效推理,幫助使用者在單一模型中完成多種任務。
Mistral AI 宣佈作為創始成員加入 NVIDIA Nemotron Coalition,雙方將聯合開發前沿開源 AI 模型,同時 Mistral AI 釋出了 Mistral Small 4。
推薦理由:原文給出了聯盟合作的核心方向與新模型釋出資訊,讀者可以據此瞭解開源大模型領域的最新生態動向。
Google Research 聯合多所高校在 PNAS 發表論文,評估了大語言模型在凝聚態物理學高溫超導專家級問題上的表現。研究發現,基於封閉受控資料來源的 NotebookLM 與定製系統表現優於聯網模型,並指出了現有系統在事實準確性、時效理解和圖表分析方面的不足。
推薦理由:這項研究評估了大語言模型在高溫超導領域的表現,為開發面向科學發現的可信工具提供了實證依據。
Leanstral 是 Mistral AI 推出的首款專為 Lean 4 設計的開原始碼代理,採用 6B 活躍引數,支援在 Mistral Vibe 中零設定使用,並提供免費 API 端點。
推薦理由:Leanstral 以 6B 引數實現高效 Lean 4 程式碼生成,成本低於主流模型,展示了開原始碼代理在正式驗證場景中的可行性。
本文介紹了 SPEX 與 ProxySPEX 兩種演算法,利用稀疏恢復和層次結構在大規模 LLM 互動識別中顯著降低計算成本。SPEX 通過訊號處理和編碼理論實現數千個元件的交互發現,ProxySPEX 在保持效能的同時將 ablation 數量減少約 10 倍。兩種方法已在 SHAP‑IQ 倉庫公開,支援特徵、資料和模型元件的解釋。
推薦理由:SPEX 和 ProxySPEX 通過稀疏恢復和層次結構顯著降低了交互發現的計算成本,為大規模 LLM 解釋提供了可行方案。