跳到正文

#論文/研究

RSS
今日 2 則
7月26日週日
  1. Berkeley AI Research35

    教導 LLM 更新信念以實現高效的長視界互動 (Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction)

    Berkeley AI Research 提出了 ABBEL 框架,通過將長互動歷史替換為自然語言信念狀態並引入信念 grading,解決大語言模型在長視界任務中上下文無法無限擴充套件及傳統自我總結效能下降的問題。實驗表明,在 CollabBench 環境中,ABBEL-rec-BG 將與全上下文模型的效能差距縮小了約 50%,訓練步數減少 50%,同時峰值上下文 token 顯著降低。

7月23日週四
  1. Google Research60

    SymptomAI:面向日常症狀評估的對話式AI智慧體研究

    Google Research 介紹了 SymptomAI,這是一種用於日常症狀評估的對話式 AI 智慧體,並在 13917 名參與者的全國規模研究中評估了其鑑別診斷效能。研究發現,由智慧體主動引導提問的策略顯著優於無引導的基線,且其生成的鑑別診斷結果在臨床專家盲測中的準確率表現良好。此外,研究還發現 SymptomAI 的診斷結果與參與者 Fitbit 可穿戴裝置的生物訊號變化趨勢相吻合。

    推薦理由:研究評估了基於大模型的對話式症狀評估工具在真實患者人群中的診斷表現,並結合可穿戴裝置生理指標進行了驗證。

  2. Google Research70

    讓量子計算機從錯誤中學習

    Google Research 在其 Willow 超導處理器上演示了利用強化學習實現量子計算機持續校準的方法,顯著降低了邏輯錯誤率。實驗中,RL 訓練將錯誤率降低 3.5 倍,最終邏輯錯誤率低至每千個糾錯週期不到一次,並在數百量子位元的模擬中驗證了可擴充套件性。該方法將量子錯誤檢測事件作為主動學習訊號,展示了可持續計算的新範式。

    推薦理由:通過強化學習實現量子計算機持續校準,顯著降低邏輯錯誤率,展示了可擴充套件的自適應控制方法,為未來大規模量子計算提供可行路徑。

7月16日週四
  1. Google Research62

    揭示擴散模型創造力的奧秘

    Google Research 通過數學分析解釋了擴散模型的創造力來源,指出正則化導致的分數平滑使模型在去噪過程中產生插值,從而生成新穎影像。文章以一維示例說明分數平滑如何軟化梯度,並通過實驗驗證權重衰減對其影響;在多維情形下,分數平滑幫助模型在資料流形上平衡質量與新穎性。作者已公開實驗程式碼。

    推薦理由:本文闡釋擴散模型創造力來源,揭示正則化導致的分數平滑如何產生新穎影像,並指出可通過調節正則化實現更具創造性的生成。

7月9日週四
  1. Google Research66

    Google Research 推出 SensorFM:面向可穿戴健康資料的通用大模型

    Google Research 推出了 SensorFM,這是一個在大規模未標註可穿戴感測器資料上預訓練的大型感測器基礎模型。該模型使用超一萬億分鐘的多模態感測器訊號進行自監督訓練,能夠跨越心血管、代謝、睡眠和心理健康等多個領域進行通用表徵,並支援構建更精準的個人健康智慧體。

    推薦理由:研究展示瞭如何利用大規模未標註感測器資料訓練通用生理表徵,讀者可以瞭解其在多工泛化和健康智慧體中的表現。

7月8日週三
  1. Google Research61

    合作的力量:我們如何減少交通擁堵

    Google Research 在 Nature Cities 發表研究,通過在 10 個美國大城市進行的大規模真實實驗表明,利用導航平臺對一小部分行程進行協同路由干預,能夠分散交通並顯著提高行駛速度、減少碳排放。該研究修改了 Google Maps 演算法以引導車輛避開擁堵路段,通過系統性的城市級交叉實驗驗證了網路化導航技術在改善整體交通狀況方面的有效性。

    推薦理由:Google Research 在 Nature Cities 發表研究,通過在 10 個美國大城市進行的大規模真實實驗表明,利用導航平臺對一小部分行程進行協同路由干預,能夠分散交通並顯著提高行駛速度、減少碳排放。該研究修改了 Google Maps 演算法以引導車輛避開擁堵路段,通過系統性的城市級交叉實驗驗證了網路化導航技術在改善整體交通狀況方面的有效性。

7月7日週二
  1. Berkeley AI Research62

    Intelligence is Free, Now What? Data Systems for, of, and by Agents

    伯克利人工智慧研究院(BAIR)團隊探討了推理成本大幅下降後資料系統面臨的新機遇與新挑戰,指出未來資料系統需要圍繞 Agent 的互動、底層協同及自主合成三個維度進行徹底重構。文章重點分析了 Agent 推理帶來的高併發複雜查詢需求、多 Agent 協作所需的狀態管理機制以及利用 Agent 從零自主合成專用資料系統的方法。

    推薦理由:文章探討了零成本推理時代對資料系統的影響,提出了面向、由和基於 Agent 的三大數據系統設計方向,為理解未來智慧基礎設施演進提供了前瞻視角。

6月30日週二
6月25日週四
  1. Google Research48

    用線性彈性快取最佳化雲端經濟學

    Google Research 提出了線性彈性快取方法,將頁面驅逐建模為滑雪租賃問題,並利用輕量級機器學習動態調整快取大小。在 Spanner 生產工作負載的測試中,該方法使記憶體使用量減少了 15.5%,快取命中率略有下降,並將總擁有成本(TCO)降低了約 5%。

  2. Google Research63

    Google Research:思考以檢索:推理如何解鎖大語言模型中的引數化知識

    Google Research 探討了大語言模型中推理如何解鎖引數化知識,通過控制實驗揭示了計算緩衝區效應和事實啟動兩大機制。研究表明,即使面對簡單的單跳問題,啟用推理也能幫助模型召回原本難以觸及的正確答案。不過,推理階段產生的中途幻覺會顯著降低最終答案的正確率。

    推薦理由:研究揭示了推理如何解鎖大語言模型的引數化知識,並指出了中間事實對準確率的關鍵影響。

6月22日週一
6月17日週三
  1. Google Research41

    從畫素到規劃:用 Earth AI 恢復自然

    Google Research 開發了一個高解析度深度學習框架,將衛星影像轉化為英格蘭全境林籬、石牆和樹叢的向量化資料集。該框架基於在超 3 億張全球衛星影像上預訓練的 ViT Backbone,並結合雙層標註系統與多邊形緊湊度評分,有效解決了複雜空間拓撲與計算規模等技術難題。這一新資源賦能土地所有者與自然保護主義者測量並擴充套件微觀生態特徵,在不損害糧食安全的前提下應對氣候與生物多樣性危機。

6月13日週六
  1. Google Research44

    研究探討 AI 如何幫助使用者理解皮膚狀況

    Google Research 分享了關於消費者理解皮膚科 AI 工具的研究,指出結構化 AI 輔助能顯著提升使用者識別皮膚狀況的能力與準確率。在一項針對 2,345 名參與者的研究中,使用 AI 工具組的病情命名準確率達到 23%,接近未輔助對照組 8% 的三倍。然而,由於資訊通用性限制,標準 AI 組在確定後續醫療行動時的準確率並未表現出顯著提升。

6月11日週四
  1. Google Research58

    Google Research 提出用於機器遺忘審計的新框架

    Google Research 推出了正則化 f 散度核檢驗新框架,旨在提高機器學習模型隱私審計與機器遺忘評估的敏感性與準確性。該框架通過相對距離測試和自適應方法,有效控制了假陽性,並在物理學資料集、差分隱私及機器遺忘演算法評估中表現出優於傳統基線方法的效能。

6月8日週一
  1. Google DeepMind64

    測量 AI 在獅子山及其他地區學習影響

    DeepMind 在獅子山開展了一項預註冊試驗,評估 AI 輔助學習工具 Guided Learning 對學生數學成績的影響。實驗顯示,學生使用 Guided Learning 的數學成績提升了 0.258 標準差,等同於 1.2 至 1.7 年的學習進度;在課堂中使用 Gemini 的教師班級更高達 1.8 至 2.5 年的進步。

    推薦理由:該研究展示了 Gemini 輔助教學可在短期內顯著提升學生數學成績,驗證了 AI 與教師協同的有效性。

  2. Import AI12

    Import AI 460:社會獎勵攻擊基準 SocioHack、Anthropic 的遞迴自我改進及強化學習無人機競速

    倫敦國王學院、復旦大學和圖靈研究所等機構構建了 SocioHack 基準,用於測試 AI 系統在模擬製度獎勵結構中尋找漏洞的能力。研究顯示,強化學習訓練的 LLM 能以 61.25% 的召回率和 90.85% 的精度重新發現歷史上被修補的漏洞策略。Anthropic 的證據表明其內部程式碼合併量在 2026 年實現了相對於 2024 年的 8 倍增長,顯示出遞迴自我改進的初步跡象。

6月5日週五
  1. Google Research71

    Google Research 推出基於智慧手機攝像頭的被動心率與靜息心率監測系統 PHRM

    Google Research 推出了被動心率監測系統(PHRM),利用智慧手機前置攝像頭在日常面部解鎖後進行影片採集,通過深度學習實現全膚色覆蓋的心率與靜息心率精準追蹤。該研究結合實驗室與真實世界評估,在各類膚色上均達到了與穿戴裝置相當的準確率,並同步開源了相關資料集與“PHRM-mini”預訓練模型供合規研究者申請使用。

    推薦理由:研究推出了基於智慧手機攝像頭的被動心率監測系統,其準確率達到行業標準並開源了資料集與預訓練模型。

5月28日週四
  1. Google Research59

    零信任聚合實現私有分析

    Google Research 在部落格中公佈了一種零信任聚合方案,利用單次加密提交和TEE硬體隔離,提供了更高效的隱私分析。該方案基於晶格加密,客戶端可在單條訊息中提交資料,伺服器僅能解密聚合結果;TEE 進一步驗證協議執行。Google 已將此技術用於 SafetyCore、Pixel Recorder、Gboard 等 Android 裝置,以在不洩露使用者內容的前提下評估模型效能並提升安全性。

5月18日週一
  1. Import AI46

    Import AI 457: AI stuxnet、Muon 最佳化器與正向對齊

    研究人員對擁有 20 多年曆史的 fast16.sys 計算機病毒進行了深入調查,發現其會選擇性地篡改高精度計算軟體的結果以破壞科研專案。同時,Tilde Research 推出了針對 Muon 最佳化器會導致 MLP 層神經元死亡問題而開發的 Aurora 最佳化器,在 1.1B 引數 transformers 和約 100B tokens 訓練測試中取得了更低的最終損失及更高的 MMLU 分數。

5月16日週六
  1. Google DeepMind62

    Google DeepMind 部落格:利用 Co-Scientist 發現治療肝纖維化的老藥新用方案

    Google DeepMind 報道了斯坦福大學遺傳學家 Gary Peltz 利用 Co-Scientist 從現有藥物文獻中尋找肝纖維化治療方案的研究。研究表明,Co-Scientist 提出的三個候選藥物中有兩個通過了實驗室活體人類肝細胞測試,其中癌症藥物 vorinostat 成功阻斷了 91% 的肝損傷反應並促進了肝細胞再生。

    推薦理由:原文通過具體實驗結果展示了 Co-Scientist 在老藥新用研究中的應用成效,為理解 AI 在生物醫藥研發中的實際價值提供了具體參考。

5月8日週五
  1. Berkeley AI Research42

    Adaptive Parallel Reasoning:高效推理擴充套件的下一範式

    Adaptive Parallel Reasoning 提出讓模型自行決定何時並行拆分、執行緒數量和協調方式,以提升推理效率。ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法已實現多執行緒並行推理,減少上下文旋轉和推理延遲。此範式可在數學、編碼和代理任務中顯著降低推理時間,避免上下文旋轉問題。

4月30日週四
  1. Google DeepMind64

    Google DeepMind 釋出 AI co-clinician 醫療人工智慧研究專案

    Google DeepMind 宣佈推出 AI co-clinician 研究計劃,旨在探索結合多模態能力的醫療人工智慧系統,以輔助醫生並提升遠端醫療和臨床決策的質量。該系統採用雙Agent架構,在多項模擬臨床評估與藥物問答基準測試中展現出處理複雜醫療任務的潛力。

    推薦理由:原文介紹了醫用人工智慧研究專案的架構與模擬評估結果,讀者可以瞭解多模態技術在醫療場景中的實際表現與安全性保障。

4月22日週三
  1. Google DeepMind66

    Google DeepMind 推出 Decoupled DiLoCo:實現具彈性且分散式的 AI 訓練新架構

    Google DeepMind 推出了 Decoupled DiLoCo 架構,通過將大規模訓練拆分到非同步執行的獨立計算叢集中,降低了跨資料中心訓練的頻寬需求並增強了硬體容錯能力。測試表明,該架構使用 Gemma 4 模型在發生硬體故障時保持了高可用性,併成功在四個美國不同區域以低頻寬完成了 120 億引數模型的預訓練。

    推薦理由:該架構通過非同步計算與低頻寬需求,解決了跨資料中心訓練大模型的同步瓶頸與硬體故障痛點。

  2. Google Research64

    ReasoningBank:使智慧體能夠從經驗中學習

    Google Research 推出了 ReasoningBank 智慧體記憶框架,通過從成功和失敗經驗中提取結構化推理模式來實現測試期自我進化。該方法通過記憶感知測試期擴充套件(MaTTS)機制,在網頁瀏覽和軟體工程基準測試中顯著提升了智慧體的成功率和執行效率。

    推薦理由:文章介紹了從成功與失敗經驗中提取結構化推理模式的記憶框架,讀者可以據此瞭解如何通過記憶增強智慧體的測試期擴充套件能力。

4月20日週一
  1. Berkeley AI Research66

    GRASP:提升狀態、加入噪聲與梯度重塑實現長時序規劃

    GRASP 是一種新的梯度規劃器,針對學習到的世界模型實現長時序規劃。它通過將軌跡提升到虛擬狀態實現並行最佳化、在狀態迭代中加入噪聲以增強探索、並重塑梯度以避免脆弱的狀態輸入梯度,從而顯著提升規劃魯棒性和速度。實驗顯示在 Push‑T 任務中,GRASP 在更長時間步上取得更高成功率且耗時更短。詳情見論文 https://arxiv.org/abs/2602.00475。

    推薦理由:GRASP 通過提升狀態、加入噪聲與梯度重塑,解決了大規模世界模型長時序規劃的梯度爆炸與不穩定問題。

4月16日週四
  1. Google Research62

    Google Research 推出 Simula:基於第一性原理的推理驅動合成數據集生成與評估框架

    Google Research 介紹了 Simula 框架,這是一種採用第一性原理構建整個合成數據集的種子無關且具身智慧的方法。該框架通過全域性多元化、區域性多元化、複雜化和質量檢查四個可控軸來分解生成過程,並在多個領域評估中展示了最佳化資料屬性對下游效能的提升。

    推薦理由:文章介紹了通過第一性原理構建合成數據集的 Simula 框架,為解決稀缺領域的資料瓶頸提供了可程式設計的工作流方案。

4月9日週四
  1. Google Research46

    ConvApparel:衡量並彌合用戶模擬器的真實性差距

    Google Research 釋出 ConvApparel 資料集,旨在衡量並彌合 LLM 驅動的使用者模擬器的真實性差距。該資料集包含 4,000+ 人機多輪對話,近 15,000 輪,覆蓋服裝購物場景。通過雙代理收集協議、人口統計對齊、人類相似度評分和反事實驗證三大支柱,評估 Prompted、ICL 與 SFT 模擬器的真實性。

4月1日週三
3月31日週二
  1. Google Research65

    Google Research 通過負責任地披露量子漏洞來保護加密貨幣

    Google Research 在新白皮書中指出,未來的量子計算機可能會用比此前預估更少的量子位元和門數破解保護加密貨幣的橢圓曲線密碼學。研究團隊給出了破解 ECDLP-256 的更新量子資源估算,並採用零知識證明方法在不洩露攻擊細節的前提下驗證漏洞,同時敦促加密貨幣社群向後量子密碼學遷移。

    推薦理由:原文給出了量子計算機破解加密貨幣的具體資源估算和零知識證明驗證方法,讀者可以據此評估後量子密碼學遷移的緊迫性。

3月25日週三
  1. Google Research60

    Google Research 推出 TurboQuant:通過極低壓縮實現 AI 效率革新

    Google Research 推出了 TurboQuant 壓縮演算法及相關演算法 Quantized Johnson-Lindenstrauss 和 PolarQuant,用於解決向量量化中的記憶體開銷問題。實驗表明,TurboQuant 在長文本基準測試中能夠將 KV 快取記憶體大小減少至少 6 倍且不損失模型準確率,並在 H100 GPU 上實現了顯著的計算加速。

    推薦理由:原文給出了新演算法的壓縮率和長文本評測結果,讀者可以據此評估其在降低記憶體開銷方面的實際效用。

  2. Google Research58

    Google Research 推出 S2Vec:通過自監督學習理解城市與建築環境的語言

    Google Research 推出了 S2Vec,這是一個旨在學習城市和建築環境通用嵌入的自監督框架。該框架利用 S2 幾何庫將地球表面劃分為多解析度單元,將要素光柵化為多層影像,並通過掩碼自編碼技術在不需要手動標籤的情況下捕捉地理空間特徵。評估結果表明,S2Vec 在零樣本地理適應等社會經濟預測任務中表現出極強的效能,但在樹木覆蓋和高程等環境任務中仍需結合衛星影像嵌入來提升效果。

3月18日週三
  1. Google Research61

    Google Research 在 The Check Up 活動上公佈醫療健康 AI 最新突破

    Google Research 在 The Check Up 活動上公佈了醫療健康領域的最新研究進展,涵蓋個性化醫療、臨床協作、開發者生態、公共衛生及生物醫學發現。

    推薦理由:Google Research 公佈了醫療健康領域的最新研究成果與進展,讀者可以據此瞭解其技術在臨床、公共衛生和生物醫藥方面的實際應用方向。

  2. Google Research63

    利用機器學習改善乳腺癌篩查工作流

    Google Research 與英國國家醫療服務體系等機構合作在 Nature Cancer 發表了兩項研究,評估了基於人工智慧的乳腺癌檢測系統。研究表明,該系統在獨立篩查中展現出更高的癌症檢測靈敏度,並在融入雙人閱讀工作流時達到了非劣效的整體效能,同時有望大幅減少人工閱讀的工作量。

    推薦理由:原文公佈了兩項評估乳腺癌篩查人工智慧系統的研究結果,讀者可以據此瞭解人工智慧在醫療影像診斷中的效能表現與臨床整合潛力。

3月17日週二
  1. Google Research60

    Google Research 評估大語言模型在超導研究問題上的表現

    Google Research 聯合多所高校在 PNAS 發表論文,評估了大語言模型在凝聚態物理學高溫超導專家級問題上的表現。研究發現,基於封閉受控資料來源的 NotebookLM 與定製系統表現優於聯網模型,並指出了現有系統在事實準確性、時效理解和圖表分析方面的不足。

    推薦理由:這項研究評估了大語言模型在高溫超導領域的表現,為開發面向科學發現的可信工具提供了實證依據。

3月13日週五
  1. Berkeley AI Research68

    大規模 LLM 互動識別方法

    本文介紹了 SPEX 與 ProxySPEX 兩種演算法,利用稀疏恢復和層次結構在大規模 LLM 互動識別中顯著降低計算成本。SPEX 通過訊號處理和編碼理論實現數千個元件的交互發現,ProxySPEX 在保持效能的同時將 ablation 數量減少約 10 倍。兩種方法已在 SHAP‑IQ 倉庫公開,支援特徵、資料和模型元件的解釋。

    推薦理由:SPEX 和 ProxySPEX 通過稀疏恢復和層次結構顯著降低了交互發現的計算成本,為大規模 LLM 解釋提供了可行方案。

3月12日週四
  1. Google Research72

    推出 Groundsource:利用 Gemini 將新聞報道轉化為資料

    Google Research 推出 Groundsource,利用 Gemini 將全球新聞報道轉化為結構化災害資料,首次公開 260 萬條洪水記錄,覆蓋 150+ 國家。該方法通過新聞文本提取、時間空間推理和地圖對映,驗證準確率達 82%,顯著擴充套件現有災害資料庫,為城市規劃、保險和應急響應提供可靠的歷史基線。

    推薦理由:Groundsource 利用 Gemini 將全球新聞報道轉化為結構化災害資料,首次公開 260 萬條洪水記錄,覆蓋 150+ 國家,顯著提升災害預測精度,為城市規劃、保險和應急響應提供可靠的歷史基線。

  2. Google Research66

    AMIE 對話式診斷 AI 在真實臨床環境中的可行性研究

    Google Research 在 Beth Israel Deaconess Medical Center 進行了一項單中心前瞻性可行性研究,評估其對話式診斷 AI AMIE 在門診前訪談中的安全性與實用性。研究共招募 100 名成人患者,零安全停機事件,AMIE 的診斷準確率在前 7 名中達 90%,並獲得患者與醫生的高度接受度。

    推薦理由:該研究首次在真實臨床環境中驗證了對話式診斷 AI 的可行性與安全性,為未來大規模臨床試驗奠定基礎,並顯示患者與醫生接受度高,提示其在臨床決策支援中的價值。

1月10日週六
  1. Berkeley AI Research48

    基於資訊驅動的成像系統設計

    研究人員提出一種基於資訊量的成像系統評估與最佳化框架,能夠直接衡量測量的區分能力。該框架通過從噪聲測量中估計互資訊,預測四個領域(彩色攝影、射電天文、無鏡成像、顯微鏡)的解碼效能,並在不需要重建演算法的情況下實現與最先進端到端方法相當的設計,同時降低記憶體和計算需求。