Google Flow Music 推出 Lyria 3.5,提升音樂性、歌詞、聲樂與創作控制
Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。
推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。
Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。
推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。
研究團隊擴充套件了 K-Search 進化核心搜尋框架併為其增加了 MLX 後端,通過結構化 CUDA 到 MLX 翻譯層將 NVIDIA 生態的核心最佳化經驗自動遷移至 Apple Silicon。實驗表明,該方法在注意力核心上實現了接近專家的效能,在 Mamba SSM 核心的預填充階段取得了約 20 倍的吞吐量提升。
推薦理由:研究展示瞭如何通過結構化翻譯層將 CUDA 最佳化經驗遷移至 Apple Silicon,為異構硬體的高效能核心開發提供了可複用的方法。
DeepMind 在部落格中釋出 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身視覺‑語言‑動作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。
推薦理由:Gemini Robotics 2 通過全身控制、精細操作和多機器人協作,展示了在複雜任務中的智慧執行能力,並能在數小時內適配新機器人身體。
Google Research 介紹了 SymptomAI,這是一種用於日常症狀評估的對話式 AI 智慧體,並在 13917 名參與者的全國規模研究中評估了其鑑別診斷效能。研究發現,由智慧體主動引導提問的策略顯著優於無引導的基線,且其生成的鑑別診斷結果在臨床專家盲測中的準確率表現良好。此外,研究還發現 SymptomAI 的診斷結果與參與者 Fitbit 可穿戴裝置的生物訊號變化趨勢相吻合。
推薦理由:研究評估了基於大模型的對話式症狀評估工具在真實患者人群中的診斷表現,並結合可穿戴裝置生理指標進行了驗證。
Google Research 在其 Willow 超導處理器上演示了利用強化學習實現量子計算機持續校準的方法,顯著降低了邏輯錯誤率。實驗中,RL 訓練將錯誤率降低 3.5 倍,最終邏輯錯誤率低至每千個糾錯週期不到一次,並在數百量子位元的模擬中驗證了可擴充套件性。該方法將量子錯誤檢測事件作為主動學習訊號,展示了可持續計算的新範式。
推薦理由:通過強化學習實現量子計算機持續校準,顯著降低邏輯錯誤率,展示了可擴充套件的自適應控制方法,為未來大規模量子計算提供可行路徑。
Google DeepMind 宣佈向 DOE 17 個國家實驗室提供 4 千萬美元 AI 代幣和雲額度,以支援 Genesis 任務。
推薦理由:Google DeepMind 通過 4 千萬美元 AI 代幣和雲額度,助力 DOE 研究者加速科學突破。
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延遲支撐大規模 AI 智慧體工作流。
推薦理由:官方釋出了三個新的 Gemini Flash 系列模型,給出了詳細的效能指標與價格,讀者可以據此評估其在智慧體工作流和高吞吐任務中的成本與效率。
Import AI 第 465 期探討了開源模型與閉源模型在網路安全等能力上的差距正在縮小,並介紹了 Kimi K3 的表現、Demis Hassabis 提出的 AGI 監管框架以及 LLM 隱蔽執行邊通道任務的研究。文章指出,開源權重的廣泛擴散將深刻改變技術與安全格局。
Google DeepMind 推出了基於 3.5 Flash 構建並針對網路安全任務微調的輕量化模型 Gemini 3.5 Flash Cyber,旨在幫助防禦者快速發現、驗證和修補軟體漏洞。
推薦理由:Google DeepMind 推出了專為網路安全微調的輕量化模型,通過支援高頻率和多輪呼叫,在多個安全基準上展現了優於 mainline 模型和部分競品的漏洞挖掘能力。
Google DeepMind 和 Isomorphic Labs 聯合公佈了生物韌性策略,旨在防止模型被濫用,並與政府及科研機構合作以應對生物安全挑戰。該計劃涵蓋預防、檢測和響應三個核心領域,重點運用 AlphaFold、AlphaGenome、AlphaEvolve 以及 Isomorphic Labs 的 Drug Design Engine 等技術支援病原體監測和疫苗研發。
Google Research 通過數學分析解釋了擴散模型的創造力來源,指出正則化導致的分數平滑使模型在去噪過程中產生插值,從而生成新穎影像。文章以一維示例說明分數平滑如何軟化梯度,並通過實驗驗證權重衰減對其影響;在多維情形下,分數平滑幫助模型在資料流形上平衡質量與新穎性。作者已公開實驗程式碼。
推薦理由:本文闡釋擴散模型創造力來源,揭示正則化導致的分數平滑如何產生新穎影像,並指出可通過調節正則化實現更具創造性的生成。
Google DeepMind 推出由 Gemini 驅動的網路應用 ATL Saathi 的即時試點,為全印度的 Atal Tinkering Labs 教師提供 24/7 的規劃與培訓助手。該應用由 Gemini 3.5 Flash 模型提供底層智慧,首批在全國 100 所試點學校推出。
Google Research 推出了 SensorFM,這是一個在大規模未標註可穿戴感測器資料上預訓練的大型感測器基礎模型。該模型使用超一萬億分鐘的多模態感測器訊號進行自監督訓練,能夠跨越心血管、代謝、睡眠和心理健康等多個領域進行通用表徵,並支援構建更精準的個人健康智慧體。
推薦理由:研究展示瞭如何利用大規模未標註感測器資料訓練通用生理表徵,讀者可以瞭解其在多工泛化和健康智慧體中的表現。
Google Research 在 Nature Cities 發表研究,通過在 10 個美國大城市進行的大規模真實實驗表明,利用導航平臺對一小部分行程進行協同路由干預,能夠分散交通並顯著提高行駛速度、減少碳排放。該研究修改了 Google Maps 演算法以引導車輛避開擁堵路段,通過系統性的城市級交叉實驗驗證了網路化導航技術在改善整體交通狀況方面的有效性。
推薦理由:Google Research 在 Nature Cities 發表研究,通過在 10 個美國大城市進行的大規模真實實驗表明,利用導航平臺對一小部分行程進行協同路由干預,能夠分散交通並顯著提高行駛速度、減少碳排放。該研究修改了 Google Maps 演算法以引導車輛避開擁堵路段,通過系統性的城市級交叉實驗驗證了網路化導航技術在改善整體交通狀況方面的有效性。
Google DeepMind 與 A24 宣佈建立首創的研究合作伙伴關係,旨在將前沿技術與下一代娛樂相結合,幫助藝術家開發新的工作流和技術。Google 還對 A24 進行了投資,雙方將在多個專案中展開深度研發協作,通過藝術家的反饋指導技術發展,以拓展未來娛樂的創作可能。
Hugging Face 與 Cerebras 聯合推出將開源語音 AI 架構與高速推理相結合的即時語音方案,實現自然的語音到語音互動。該開源級聯語音堆疊由 Nvidia Parakeet 進行語音識別、Cerebras 執行 Google DeepMind 的 Gemma 4 31B 模型進行推理、以及 Alibaba 的 Qwen3TTS 生成語音,並已應用於 Reachy Mini 機器人。
推薦理由:原文展示了開源語音流水線如何結合硬體推理速度,讀者可以評估這種架構在低延遲互動中的表現。
Google Research 釋出了擴充套件後的建築級屋頂反射率資料集,覆蓋全球 50 多個城市,旨在幫助城規劃者實施清涼屋頂解決方案以緩解極端熱浪。該資料集通過全新的高解析度 Heat Resilience Earth Engine App 公開提供,結合衛星資料與機器學習模型實現了 30 釐米的高空間解析度。
Google DeepMind 推出兩款新模型:速度最快且最具成本效益的影像模型 Nano Banana 2 Lite,以及用於高質量影片生成和對話式編輯的 Gemini Omni Flash。
推薦理由:Google DeepMind 推出 Nano Banana 2 Lite 與 Gemini Omni Flash 兩款新模型,為開發者串聯影像生成與影片編輯提供了低成本且高效的新方案。
Google Research 推出了 TabFM,這是一個專為表格資料分類和迴歸設計的零樣本基礎模型。該模型通過將表格預測轉換為上下文學習問題,消除了傳統機器學習中的手動模型訓練、超引數調優和複雜特徵工程,能夠在單次前向傳遞中對未見過的表格生成高質量預測。
推薦理由:Google Research 釋出了面向表格資料的零樣本基礎模型 TabFM,讀者可以據此瞭解大模型架構如何簡化分類和迴歸的工作流。
Google Research 宣佈推出一項新架構,將多Token預測(MTP)技術應用到已部署且權重被凍結的 Gemini Nano v3 模型上。該方法採用零複製架構直接利用主模型的鍵值快取,在 Pixel 9 和 10 系列裝置上實現了 50% 或更高的推理速度提升,並減少了能耗。
推薦理由:谷歌研究團隊通過在已凍結的 Gemini Nano 模型上應用多Token預測架構,在不增加記憶體冗餘的前提下顯著提升了端側裝置的推理速度與能效。
Google Research 提出了線性彈性快取方法,將頁面驅逐建模為滑雪租賃問題,並利用輕量級機器學習動態調整快取大小。在 Spanner 生產工作負載的測試中,該方法使記憶體使用量減少了 15.5%,快取命中率略有下降,並將總擁有成本(TCO)降低了約 5%。
Google Research 探討了大語言模型中推理如何解鎖引數化知識,通過控制實驗揭示了計算緩衝區效應和事實啟動兩大機制。研究表明,即使面對簡單的單跳問題,啟用推理也能幫助模型召回原本難以觸及的正確答案。不過,推理階段產生的中途幻覺會顯著降低最終答案的正確率。
推薦理由:研究揭示了推理如何解鎖大語言模型的引數化知識,並指出了中間事實對準確率的關鍵影響。
Google DeepMind 宣佈在 Gemini 3.5 Flash 中內建 computer use 功能,使其能夠跨瀏覽器、移動端和桌面環境執行智慧體任務。該功能支援長週期和企業自動化場景,並通過對抗性訓練與可選的企業安全保護系統來降低提示詞注入等風險。開發者現可通過 Gemini API 和 Gemini Enterprise Agent Platform 開始構建相關應用。
推薦理由:官方將 computer use 能力直接整合至主模型,開發者可據此構建能跨平臺操作的自定義智慧體。
研究表明 AI 系統在文本說服力和真實世界行為中超越了人類專家,其中 Opus 4.1、Opus 4.20、GPT-4o、GPT-5.4、Gemini 2.5 Pro 及 Grok 4.20 表現最強。該結論基於包含 18,978 場對話和 6,923 名參與者的四項實驗,實驗顯示 AI 在為 Save the Children 籌款時的效果是英國專業募捐者的近 3 倍。
Google DeepMind 與英國政府及多方合作伙伴共同推出了一款基於 Gemini 構建的 AI 規劃原型工具,旨在將房屋建設申請的處理時間縮短一半。該工具能夠整合資料、識別本地政策、總結反饋並起草評估報告,同時保持規劃官員的最終決策權,計劃於 2027 年面向全國所有地方議會推廣。
Google Research 開發了一個高解析度深度學習框架,將衛星影像轉化為英格蘭全境林籬、石牆和樹叢的向量化資料集。該框架基於在超 3 億張全球衛星影像上預訓練的 ViT Backbone,並結合雙層標註系統與多邊形緊湊度評分,有效解決了複雜空間拓撲與計算規模等技術難題。這一新資源賦能土地所有者與自然保護主義者測量並擴充套件微觀生態特徵,在不損害糧食安全的前提下應對氣候與生物多樣性危機。
Google DeepMind 官方釋出了 AI 智慧體安全控制路線圖,旨在通過結合模型對齊與系統級防禦來應對自主智慧體帶來的潛在威脅。該路線圖涵蓋威脅建模、基於監控的預防與響應機制,並已通過分析百萬條程式設計智慧體軌跡來最佳化安全協議與即時監控。
Google Research 分享了關於消費者理解皮膚科 AI 工具的研究,指出結構化 AI 輔助能顯著提升使用者識別皮膚狀況的能力與準確率。在一項針對 2,345 名參與者的研究中,使用 AI 工具組的病情命名準確率達到 23%,接近未輔助對照組 8% 的三倍。然而,由於資訊通用性限制,標準 AI 組在確定後續醫療行動時的準確率並未表現出顯著提升。
Google Research 推出了正則化 f 散度核檢驗新框架,旨在提高機器學習模型隱私審計與機器遺忘評估的敏感性與準確性。該框架通過相對距離測試和自適應方法,有效控制了假陽性,並在物理學資料集、差分隱私及機器遺忘演算法評估中表現出優於傳統基線方法的效能。
Google DeepMind 釋出了採用 Apache 2.0 協議開源的實驗性模型 DiffusionGemma,這是一款基於 Gemma 4 家族和 Gemini 擴散研究的 26B MoE 文本擴散模型,可在專用 GPU 上實現高達 4 倍的文本生成速度。
推薦理由:該模型採用文本擴散架構實現數倍於傳統自迴歸模型的推理速度,為開發者探索本地即時互動工作流提供了新的硬體利用方式與微調路徑。
Google DeepMind 聯合 Schmidt Sciences、Cooperative AI Foundation、ARIA 及 Google.org 宣佈推出一項高達 1000 萬美元的技術研究資助計劃,面向全球研究人員徵集多智慧體 AI 安全領域的提案。
Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。
推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。
DeepMind 推出 Gemma 4 12B,這是一款無編碼器的統一多模態模型,能夠直接在配備 16GB VRAM 的筆記本上執行。它在保持與 26B MoE 近似的推理效能的同時,顯著降低了記憶體佔用,並首次支援原生音訊輸入。
推薦理由:Gemma 4 12B 以無編碼器的多模態架構實現低記憶體、強推理,適配本地 16GB VRAM 機器,讀者可據此評估在邊緣裝置上的部署可能。
Google DeepMind Accelerator: Robotics 選拔了來自歐洲的15家機器人初創公司,提供為期三個月的密集指導與技術支援,幫助其將 AI 整合到核心產品中,並將 Gemini 機器人模型納入其技術棧。
DeepMind 在獅子山開展了一項預註冊試驗,評估 AI 輔助學習工具 Guided Learning 對學生數學成績的影響。實驗顯示,學生使用 Guided Learning 的數學成績提升了 0.258 標準差,等同於 1.2 至 1.7 年的學習進度;在課堂中使用 Gemini 的教師班級更高達 1.8 至 2.5 年的進步。
推薦理由:該研究展示了 Gemini 輔助教學可在短期內顯著提升學生數學成績,驗證了 AI 與教師協同的有效性。
Google Research 推出了 Gemini Enterprise Agent Platform 的 Agentic RAG,利用多代理協同、規劃與足夠上下文機制,提升多源多跳查詢的準確率至 34%,在跨語料庫實驗中保持 90.1% 的高準確率,且延遲與單語料庫版本相近。該功能已作為公開預覽提供。
推薦理由:該系統在多源多跳查詢中將準確率提升至 34%,為企業工作流提供更可靠的答案,並在跨語料庫場景下保持 90.1% 的高準確率。
Google Research 推出了被動心率監測系統(PHRM),利用智慧手機前置攝像頭在日常面部解鎖後進行影片採集,通過深度學習實現全膚色覆蓋的心率與靜息心率精準追蹤。該研究結合實驗室與真實世界評估,在各類膚色上均達到了與穿戴裝置相當的準確率,並同步開源了相關資料集與“PHRM-mini”預訓練模型供合規研究者申請使用。
推薦理由:研究推出了基於智慧手機攝像頭的被動心率監測系統,其準確率達到行業標準並開源了資料集與預訓練模型。
Google Research公開了其水文模型框架,供各國氣象機構在GitHub上使用和構建AI洪水預報模型。該框架基於PyTorch實現LSTM網路,支援使用Caravan資料集訓練,並已在Czech Hydrometeorological Institute驗證,提升預測時效6天。
推薦理由:Google公開的水文框架讓各國氣象機構可自行訓練AI洪水預報模型,提升預測時效並降低技術門檻。
Google Research 在 I/O 2026 上公佈了多款 AI 工具與模型,涵蓋科研加速、健康應用、邊緣計算與氣候預測等領域。
推薦理由:Google Research 在 I/O 2026 上公佈多款 AI 工具與模型,展示了從科研到產品的快速落地與實際影響,凸顯代理式編碼與多模態推理在科學與日常應用中的變革潛力,併為全球科研社群提供了可擴充套件的實驗平臺。
Google Research 在部落格中公佈了一種零信任聚合方案,利用單次加密提交和TEE硬體隔離,提供了更高效的隱私分析。該方案基於晶格加密,客戶端可在單條訊息中提交資料,伺服器僅能解密聚合結果;TEE 進一步驗證協議執行。Google 已將此技術用於 SafetyCore、Pixel Recorder、Gboard 等 Android 裝置,以在不洩露使用者內容的前提下評估模型效能並提升安全性。