Google Research:思考以檢索:推理如何解鎖大語言模型中的引數化知識
Google Research 探討了大語言模型中推理如何解鎖引數化知識,通過控制實驗揭示了計算緩衝區效應和事實啟動兩大機制。研究表明,即使面對簡單的單跳問題,啟用推理也能幫助模型召回原本難以觸及的正確答案。不過,推理階段產生的中途幻覺會顯著降低最終答案的正確率。
推薦理由:研究揭示了推理如何解鎖大語言模型的引數化知識,並指出了中間事實對準確率的關鍵影響。
Google Research 探討了大語言模型中推理如何解鎖引數化知識,通過控制實驗揭示了計算緩衝區效應和事實啟動兩大機制。研究表明,即使面對簡單的單跳問題,啟用推理也能幫助模型召回原本難以觸及的正確答案。不過,推理階段產生的中途幻覺會顯著降低最終答案的正確率。
推薦理由:研究揭示了推理如何解鎖大語言模型的引數化知識,並指出了中間事實對準確率的關鍵影響。
Google Research 開發了一個高解析度深度學習框架,將衛星影像轉化為英格蘭全境林籬、石牆和樹叢的向量化資料集。該框架基於在超 3 億張全球衛星影像上預訓練的 ViT Backbone,並結合雙層標註系統與多邊形緊湊度評分,有效解決了複雜空間拓撲與計算規模等技術難題。這一新資源賦能土地所有者與自然保護主義者測量並擴充套件微觀生態特徵,在不損害糧食安全的前提下應對氣候與生物多樣性危機。
Google Research 分享了關於消費者理解皮膚科 AI 工具的研究,指出結構化 AI 輔助能顯著提升使用者識別皮膚狀況的能力與準確率。在一項針對 2,345 名參與者的研究中,使用 AI 工具組的病情命名準確率達到 23%,接近未輔助對照組 8% 的三倍。然而,由於資訊通用性限制,標準 AI 組在確定後續醫療行動時的準確率並未表現出顯著提升。
Google Research 推出了正則化 f 散度核檢驗新框架,旨在提高機器學習模型隱私審計與機器遺忘評估的敏感性與準確性。該框架通過相對距離測試和自適應方法,有效控制了假陽性,並在物理學資料集、差分隱私及機器遺忘演算法評估中表現出優於傳統基線方法的效能。
DeepMind 在獅子山開展了一項預註冊試驗,評估 AI 輔助學習工具 Guided Learning 對學生數學成績的影響。實驗顯示,學生使用 Guided Learning 的數學成績提升了 0.258 標準差,等同於 1.2 至 1.7 年的學習進度;在課堂中使用 Gemini 的教師班級更高達 1.8 至 2.5 年的進步。
推薦理由:該研究展示了 Gemini 輔助教學可在短期內顯著提升學生數學成績,驗證了 AI 與教師協同的有效性。
Google Research 推出了被動心率監測系統(PHRM),利用智慧手機前置攝像頭在日常面部解鎖後進行影片採集,通過深度學習實現全膚色覆蓋的心率與靜息心率精準追蹤。該研究結合實驗室與真實世界評估,在各類膚色上均達到了與穿戴裝置相當的準確率,並同步開源了相關資料集與“PHRM-mini”預訓練模型供合規研究者申請使用。
推薦理由:研究推出了基於智慧手機攝像頭的被動心率監測系統,其準確率達到行業標準並開源了資料集與預訓練模型。
Google Research 在部落格中公佈了一種零信任聚合方案,利用單次加密提交和TEE硬體隔離,提供了更高效的隱私分析。該方案基於晶格加密,客戶端可在單條訊息中提交資料,伺服器僅能解密聚合結果;TEE 進一步驗證協議執行。Google 已將此技術用於 SafetyCore、Pixel Recorder、Gboard 等 Android 裝置,以在不洩露使用者內容的前提下評估模型效能並提升安全性。
Google DeepMind 報道了斯坦福大學遺傳學家 Gary Peltz 利用 Co-Scientist 從現有藥物文獻中尋找肝纖維化治療方案的研究。研究表明,Co-Scientist 提出的三個候選藥物中有兩個通過了實驗室活體人類肝細胞測試,其中癌症藥物 vorinostat 成功阻斷了 91% 的肝損傷反應並促進了肝細胞再生。
推薦理由:原文通過具體實驗結果展示了 Co-Scientist 在老藥新用研究中的應用成效,為理解 AI 在生物醫藥研發中的實際價值提供了具體參考。
Adaptive Parallel Reasoning 提出讓模型自行決定何時並行拆分、執行緒數量和協調方式,以提升推理效率。ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法已實現多執行緒並行推理,減少上下文旋轉和推理延遲。此範式可在數學、編碼和代理任務中顯著降低推理時間,避免上下文旋轉問題。
Google DeepMind 宣佈推出 AI co-clinician 研究計劃,旨在探索結合多模態能力的醫療人工智慧系統,以輔助醫生並提升遠端醫療和臨床決策的質量。該系統採用雙Agent架構,在多項模擬臨床評估與藥物問答基準測試中展現出處理複雜醫療任務的潛力。
推薦理由:原文介紹了醫用人工智慧研究專案的架構與模擬評估結果,讀者可以瞭解多模態技術在醫療場景中的實際表現與安全性保障。
Google Research 介紹了 Empirical Research Assistance(ERA)在公共衛生預測、宇宙學計算、氣候碳監測和神經科學等四個領域的應用進展。研究顯示,ERA 結合先進模型能夠解決傳統方法難以應對的複雜方程與資料分析問題,並接近或超越現有專業工具的表現。
Google DeepMind 推出了 Decoupled DiLoCo 架構,通過將大規模訓練拆分到非同步執行的獨立計算叢集中,降低了跨資料中心訓練的頻寬需求並增強了硬體容錯能力。測試表明,該架構使用 Gemma 4 模型在發生硬體故障時保持了高可用性,併成功在四個美國不同區域以低頻寬完成了 120 億引數模型的預訓練。
推薦理由:該架構通過非同步計算與低頻寬需求,解決了跨資料中心訓練大模型的同步瓶頸與硬體故障痛點。
Google Research 推出了 ReasoningBank 智慧體記憶框架,通過從成功和失敗經驗中提取結構化推理模式來實現測試期自我進化。該方法通過記憶感知測試期擴充套件(MaTTS)機制,在網頁瀏覽和軟體工程基準測試中顯著提升了智慧體的成功率和執行效率。
推薦理由:文章介紹了從成功與失敗經驗中提取結構化推理模式的記憶框架,讀者可以據此瞭解如何通過記憶增強智慧體的測試期擴充套件能力。
GRASP 是一種新的梯度規劃器,針對學習到的世界模型實現長時序規劃。它通過將軌跡提升到虛擬狀態實現並行最佳化、在狀態迭代中加入噪聲以增強探索、並重塑梯度以避免脆弱的狀態輸入梯度,從而顯著提升規劃魯棒性和速度。實驗顯示在 Push‑T 任務中,GRASP 在更長時間步上取得更高成功率且耗時更短。詳情見論文 https://arxiv.org/abs/2602.00475。
推薦理由:GRASP 通過提升狀態、加入噪聲與梯度重塑,解決了大規模世界模型長時序規劃的梯度爆炸與不穩定問題。
Google Research 介紹了 Simula 框架,這是一種採用第一性原理構建整個合成數據集的種子無關且具身智慧的方法。該框架通過全域性多元化、區域性多元化、複雜化和質量檢查四個可控軸來分解生成過程,並在多個領域評估中展示了最佳化資料屬性對下游效能的提升。
推薦理由:文章介紹了通過第一性原理構建合成數據集的 Simula 框架,為解決稀缺領域的資料瓶頸提供了可程式設計的工作流方案。
Google Research 推出了名為 MoGen 的開源神經形態生成模型,利用 point cloud flow matching 模擬逼真的 3D 神經元形狀以增強訓練資料。將 MoGen 生成的合成數據加入訓練管道,使重構錯誤率降低了 4.4%,並顯著減少了未來全腦對映所需的人工校對工作量。
Google Research 釋出 ConvApparel 資料集,旨在衡量並彌合 LLM 驅動的使用者模擬器的真實性差距。該資料集包含 4,000+ 人機多輪對話,近 15,000 輪,覆蓋服裝購物場景。通過雙代理收集協議、人口統計對齊、人類相似度評分和反事實驗證三大支柱,評估 Prompted、ICL 與 SFT 模擬器的真實性。
Google Research 釋出研究《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,探討了 AI 評測中樣本數量(N)與每個樣本評測者數量(K)之間的權衡關係。
Google Research 在新白皮書中指出,未來的量子計算機可能會用比此前預估更少的量子位元和門數破解保護加密貨幣的橢圓曲線密碼學。研究團隊給出了破解 ECDLP-256 的更新量子資源估算,並採用零知識證明方法在不洩露攻擊細節的前提下驗證漏洞,同時敦促加密貨幣社群向後量子密碼學遷移。
推薦理由:原文給出了量子計算機破解加密貨幣的具體資源估算和零知識證明驗證方法,讀者可以據此評估後量子密碼學遷移的緊迫性。
Google Research 推出了 TurboQuant 壓縮演算法及相關演算法 Quantized Johnson-Lindenstrauss 和 PolarQuant,用於解決向量量化中的記憶體開銷問題。實驗表明,TurboQuant 在長文本基準測試中能夠將 KV 快取記憶體大小減少至少 6 倍且不損失模型準確率,並在 H100 GPU 上實現了顯著的計算加速。
推薦理由:原文給出了新演算法的壓縮率和長文本評測結果,讀者可以據此評估其在降低記憶體開銷方面的實際效用。
Google Research 推出了 S2Vec,這是一個旨在學習城市和建築環境通用嵌入的自監督框架。該框架利用 S2 幾何庫將地球表面劃分為多解析度單元,將要素光柵化為多層影像,並通過掩碼自編碼技術在不需要手動標籤的情況下捕捉地理空間特徵。評估結果表明,S2Vec 在零樣本地理適應等社會經濟預測任務中表現出極強的效能,但在樹木覆蓋和高程等環境任務中仍需結合衛星影像嵌入來提升效果。
Google Research 在 The Check Up 活動上公佈了醫療健康領域的最新研究進展,涵蓋個性化醫療、臨床協作、開發者生態、公共衛生及生物醫學發現。
推薦理由:Google Research 公佈了醫療健康領域的最新研究成果與進展,讀者可以據此瞭解其技術在臨床、公共衛生和生物醫藥方面的實際應用方向。
Google Research 與英國國家醫療服務體系等機構合作在 Nature Cancer 發表了兩項研究,評估了基於人工智慧的乳腺癌檢測系統。研究表明,該系統在獨立篩查中展現出更高的癌症檢測靈敏度,並在融入雙人閱讀工作流時達到了非劣效的整體效能,同時有望大幅減少人工閱讀的工作量。
推薦理由:原文公佈了兩項評估乳腺癌篩查人工智慧系統的研究結果,讀者可以據此瞭解人工智慧在醫療影像診斷中的效能表現與臨床整合潛力。
Google Research 聯合多所高校在 PNAS 發表論文,評估了大語言模型在凝聚態物理學高溫超導專家級問題上的表現。研究發現,基於封閉受控資料來源的 NotebookLM 與定製系統表現優於聯網模型,並指出了現有系統在事實準確性、時效理解和圖表分析方面的不足。
推薦理由:這項研究評估了大語言模型在高溫超導領域的表現,為開發面向科學發現的可信工具提供了實證依據。
本文介紹了 SPEX 與 ProxySPEX 兩種演算法,利用稀疏恢復和層次結構在大規模 LLM 互動識別中顯著降低計算成本。SPEX 通過訊號處理和編碼理論實現數千個元件的交互發現,ProxySPEX 在保持效能的同時將 ablation 數量減少約 10 倍。兩種方法已在 SHAP‑IQ 倉庫公開,支援特徵、資料和模型元件的解釋。
推薦理由:SPEX 和 ProxySPEX 通過稀疏恢復和層次結構顯著降低了交互發現的計算成本,為大規模 LLM 解釋提供了可行方案。
Google Research 推出 Groundsource,利用 Gemini 將全球新聞報道轉化為結構化災害資料,首次公開 260 萬條洪水記錄,覆蓋 150+ 國家。該方法通過新聞文本提取、時間空間推理和地圖對映,驗證準確率達 82%,顯著擴充套件現有災害資料庫,為城市規劃、保險和應急響應提供可靠的歷史基線。
推薦理由:Groundsource 利用 Gemini 將全球新聞報道轉化為結構化災害資料,首次公開 260 萬條洪水記錄,覆蓋 150+ 國家,顯著提升災害預測精度,為城市規劃、保險和應急響應提供可靠的歷史基線。
Google Research 在 Beth Israel Deaconess Medical Center 進行了一項單中心前瞻性可行性研究,評估其對話式診斷 AI AMIE 在門診前訪談中的安全性與實用性。研究共招募 100 名成人患者,零安全停機事件,AMIE 的診斷準確率在前 7 名中達 90%,並獲得患者與醫生的高度接受度。
推薦理由:該研究首次在真實臨床環境中驗證了對話式診斷 AI 的可行性與安全性,為未來大規模臨床試驗奠定基礎,並顯示患者與醫生接受度高,提示其在臨床決策支援中的價值。
研究人員提出一種基於資訊量的成像系統評估與最佳化框架,能夠直接衡量測量的區分能力。該框架通過從噪聲測量中估計互資訊,預測四個領域(彩色攝影、射電天文、無鏡成像、顯微鏡)的解碼效能,並在不需要重建演算法的情況下實現與最先進端到端方法相當的設計,同時降低記憶體和計算需求。
作者介紹了一種基於分治範式的強化學習演算法 Transitive RL,旨在解決傳統時序差分學習在長步數任務中的誤差累積與擴充套件難題。該方法通過在目標條件強化學習中應用可傳遞的貝爾曼更新規則,將軌跡分割為兩段,並利用資料集中的狀態和期望迴歸來計算軟最大值,從而在複雜長步數任務中取得了良好效能且無需手動調整超引數。
伯克利人工智慧研究團隊發表論文,為經典語言建模任務 word2vec 的學習過程提供瞭解析理論。研究證明在實際訓練設定下,該學習問題可簡化為無加權最小二乘矩陣分解,其梯度流動力學可通過閉式求解,學到的最終表徵即為主成分分析結果。