跳到正文

#Google

RSS
今日 2 則
今天10月1日週四
  1. Google DeepMind72

    Gemini 4 Argon 釋出:開啟前沿智慧新時代

    Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。

    推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。

  2. Google DeepMind63

    Google DeepMind 釋出 SynthID Bio 為生成式生物學引入水印技術

    Google DeepMind 推出了 SynthID Bio,這是一種專為合成生物學開發的水印技術,可在保持蛋白質生物功能的同時,將不可見的標記直接嵌入胺基酸序列和預測的 3D 結構中。該技術通過了溼實驗室對靶向蛋白質的測試,並對 AlphaFold 3 的擴散網路及 Evo 2 基因組模型進行了適配,旨在加強生物安全性並確保科學資料的完整性。

9月30日週三
  1. cloudflare blog75

    網際網路擁有第二個受眾

    Cloudflare 說明網際網路正出現第二個受眾——AI 代理,導致超過一半流量來自軟體而非人類。為此,Cloudflare 推出了 AI Crawl Control、BotBase、Web Bot Auth 等工具,並在 2026 年推出 Monetization Gateway,讓站點能識別、計費並從 AI 代理中獲得收入。

    推薦理由:Cloudflare推出面向 AI 代理的流量控制與計費方案,幫助站點在 AI 時代實現收入恢復,並提供視覺化監控與統一計費介面。

  2. Google Research60

    Google Research 推出 Diffusion Controller:統一併簡化 AI 影像生成的連續控制框架

    Google Research 推出了 Diffusion Controller 框架,將擴散模型的去噪過程重構為連續控制問題,用輕量級附加網路實現了對影像生成軌跡的平滑動態調整。實驗表明,其輕量級灰盒版本在匹配人類偏好的指標上表現優異,而白盒微調版本則取得了更高的勝率。

    推薦理由:原文介紹了將影像生成去噪過程建模為連續控制問題的框架,並展示了其在灰盒和白盒環境下的效能表現,讀者可以據此瞭解如何兼顧生成畫質與對齊控制。

9月25日週五
  1. Google Research71

    Google Research 推出自動化長影片生成的多智慧體框架

    Google Research 介紹了用於自動化長影片生成的多智慧體框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四個核心元件。該框架通過全域性最佳化和世界狀態追蹤解決語義漂移與級聯失敗問題,能夠將創意轉化為分鐘級、具備多鏡頭敘事一致性的影片。

    推薦理由:該研究通過多智慧體框架解決長影片生成中的視覺一致性問題,為提升影片擴散模型的長時序敘事能力提供了可複用的系統架構參考。

  2. Google DeepMind64

    Google DeepMind 釋出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 釋出 Gemini 3.8 Live with Live Avatar,為對話式 AI 帶來近即時的視覺形象與流媒體影片支援。該功能原生耦合了即時對話與低延遲影片生成,具備精確唇形同步、動態視覺形象、非同步工具呼叫以及跨 97 種語言的原生語音同步能力,現已在 Gemini Enterprise 中可用。

9月24日週四
  1. NVIDIA Blog64

    NVIDIA 如何聯合全球研究機構釋出超 2800 種病毒蛋白質複合物的預測 3D 結構

    NVIDIA 聯合 Google DeepMind 及歐洲生物資訊研究所(EMBL-EBI)等全球研究機構,通過 AlphaFold Database 免費釋出了覆蓋超 2,800 種病毒的蛋白質複合物預測 3D 結構資料集。

    推薦理由:原文介紹了由 NVIDIA 與 Google DeepMind 等機構合作開源的病毒蛋白質複合物預測資料集,讀者可以據此瞭解 AI 在生物學研究中的最新應用進展。

  2. Google DeepMind62

    Google DeepMind 釋出帶有安全伺服器端記憶體的 Private AI Compute 技術更新

    Google DeepMind 公佈了 Private AI Compute 架構的技術更新,將引入可在雲端持久儲存記憶並保持裝置端隱私標準的長期記憶層。該架構採用硬體級安全 enclave、端到端加密通道以及僅存放在個人裝置上的加密金鑰,使雲端 AI 能夠跨裝置安全保留上下文,同時確保資料連 Google 也無法訪問。

9月23日週三
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 語音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言的自然語言提示詞聲音設計、30 秒聲音復刻以及逐行臺詞精細導演。

    推薦理由:官方釋出的最新語音生成模型提供了細粒度的臺詞導演和聲音定製能力,讀者可以據此評估其在多語言配音與智慧體互動中的實際表現。

  2. Vercel Blog66

    Gemini 3.8 TTS模型現已在AI Gateway上線

    Gemini 3.8 Flash‑Lite TTS 與 Gemini 3.8 Flash TTS 現已在 AI Gateway 上線,支援 100 多種語言的文本轉語音,支援長篇朗讀、交付控制和雙人對話。

    推薦理由:Gemini 3.8 TTS模型已在AI Gateway上線,支援100多種語言、長篇朗讀和雙人對話,開發者可通過AI SDK輕鬆生成語音。

9月19日週六
  1. Google Research53

    Google Research 推出 MilleMiglia:面向中長途物流的現實例項生成器

    Google Research 介紹了 MilleMiglia,這是一個旨在為中長途物流配送問題建立現實基準的 C++ 例項生成器。該工具通過結合空間分佈、需求和車輛排程等統計模型,生成隱私安全且符合實際的物流網路資料。相關原始碼與文件已在 GitHub 開源,以推動運籌學與供應鏈最佳化領域的後續研究。

9月18日週五
  1. Google Research63

    Google Research 推出基於生成式 UI 的定製化互動學習模擬研究專案

    Google Research 推出了可讓教師建立定製化、互動式教育模擬實驗的最新研究,利用針對教育最佳化的生成式 UI 動態生成符合課程目標的學習互動。官方同時釋出了包含 30 多箇中學 STEM 課程英文學習互動的樣本庫,並面向使用 Google Workspace for Education 的學校開放試點計劃以收集反饋。

    推薦理由:原文介紹了該研究成果及配套的試點專案,讀者可以從中瞭解大模型在定製化教學互動模擬方面的最新進展。

9月17日週四
9月16日週三
  1. NVIDIA Blog55

    Emerald AI、Google 與 NVIDIA 聯合成立 AI 能源管理聯盟

    Emerald AI、Google 和 NVIDIA 宣佈成立 AI 能源管理聯盟(AEMA),旨在推進能夠根據電網狀況動態管理用電需求的資料中心建設。該聯盟採用技術中立和基於效能的標準,致力於制定清晰的執行規則、標準化技術要求並最佳化電網互聯路徑。通過匯聚計算與電力價值鏈的各方生態夥伴,AEMA 將共同推動兼顧AI基礎設施擴充套件與電網可靠性的可行方案。

  2. Google DeepMind66

    Google DeepMind 釋出 Gemini 3.8 Live 與 3.8 Live Extended Thinking 語音模型

    Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。

    推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。

9月15日週二
  1. Vercel Blog78

    Gemini 3.8 Live 模型現已可於 AI Gateway 使用

    Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking 現已可於 AI Gateway 使用,支援即時語音互動與多模態功能。

    推薦理由:Gemini 3.8 Live 及其擴充套件思考功能可即時語音互動,開發者可透過 AI Gateway 直接使用 WebSocket 進行即時對話,提升語音助手與多模態應用的互動體驗。

9月11日週五
  1. Google Research64

    ToolGrad:通過文本梯度實現高效工具使用資料集生成

    Google Research 介紹了 ToolGrad 框架,這是一種採用“先生成工具使用鏈、再反向標註使用者提示詞”的答案優先範式,能夠以更低成本高效生成複雜的智慧體工具使用資料集。

    推薦理由:該研究提出了一種反向生成智慧體工具使用資料集的方法,通過文本梯度迭代構建工作流,為解決合成數據成本與可擴充套件性瓶頸提供了新路徑。

9月8日週二
  1. Google DeepMind89

    Google DeepMind 釋出 AlphaGenome Atlas:人類基因組變異預測圖譜

    Google DeepMind 推出了 AlphaGenome Atlas 平臺,包含人類基因組中 90 億種單核苷酸變異的預測效應,並同步釋出了 AlphaGenome Variant Impact 評分。該平臺提供網站埠、API 以及 Google Antigravity 中的 skill,旨在幫助學術研究人員理解基因變異對分子生物學的影響。

    推薦理由:該平臺預先計算了人類基因組中所有可能單核苷酸變異的分子效應預測併發布了配套評分指標,為研究人員快速評估基因變異影響提供了新資源。

9月4日週五
  1. Google Research57

    Google Research 評估代表性不足群體中基因組預測的遷移學習

    Google Research 評估了多基因風險評分(PRS)在非歐洲目標群體中的表現,發現當目標群體樣本量較小時,利用歐洲群體進行遷移學習可提升統計效能,但隨著目標群體樣本量增大,外部資料池化的收益反而會減弱。研究表明,這一臨界點取決於具體性狀的遺傳保守性,且先進的多源群體方法需要相當規模的目標群體樣本才能超越簡單方法。

  2. Google Research74

    Google Research 釋出雄性果蠅完整大腦連線圖譜

    Google Research 與 HHMI Janelia 及多所高校合作,釋出了包含超過 16.6 萬個神經元和 1.25 億個突觸連線的雄性果蠅完整大腦及中樞神經系統連線圖譜。該圖譜利用 AI 技術將電子顯微鏡影像重建為 3D 結構,並經過人工校對驗證,為研究大腦工作機制提供了重要資源。相關成果已發表在 Cell 期刊上。

    推薦理由:該研究釋出了迄今規模最大的完整雄性果蠅大腦及中樞神經系統連線圖譜,為神經科學研究提供了重要基礎資源。

9月3日週四
  1. Google DeepMind84

    Google DeepMind 釋出全球天氣大模型 WeatherNext 3

    Google DeepMind 和 Google Research 釋出全新的全球天氣大模型 WeatherNext 3,支援每小時即時衛星資料輸入並提供高達 5 公里解析度的預測。該模型在降水預測精度上取得顯著提升,並增加了清潔能源變數預測,現已整合至 Search、Gemini、Maps 和 Cloud 等產品中。

    推薦理由:該模型通過融合即時衛星資料與高解析度網格,提升了全球天氣預報的精度和更新頻率,為清潔能源規劃和區域氣象服務提供了更可靠的資料支援。

  2. Google DeepMind63

    Google DeepMind 推出 Fairwind Program 計劃

    Google DeepMind 宣佈推出 Fairwind Program,這是一個面向政府機構和可信合作伙伴的有限訪問計劃,旨在通過 Gemini 3.8 Flash Cyber 與 CodeMender 框架提供自主發現和修復漏洞的先進網路安全能力。該計劃首批覆蓋全球 650 多個合作伙伴,支援在組織的安全雲環境中幾分鐘內生成經過驗證的修復補丁。

    推薦理由:Google DeepMind 推出的 Fairwind Program 為政府和企業提供了基於特定 Gemini 模型的自動化漏洞修復能力,讀者可以藉此瞭解大模型在網路安全防護中的具體落地形態。

9月2日週三
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智慧體影片理解功能

    Google DeepMind 推出了適用於 Gemini 最新模型的智慧體影片理解功能,通過動態檢索視覺幀、音訊和字幕,將影片分析的 token 消耗降低最高 88%、成本降低最高 66%,並將準確率提升最高 7%。

    推薦理由:原文公佈了功能特性與具體最佳化資料,讀者可以據此瞭解該技術如何降低影片處理成本。

9月1日週二
  1. Google Research63

    Google Research 釋出 TimesFM-3:支援多變數預測的零樣本時間序列基座模型

    Google Research 推出 TimesFM-3,這是一個擁有 3.3 億引數、原生支援多變數預測的零樣本時間序列基座模型。該模型採用解碼器架構與交替注意力機制,支援單次前向傳遞生成整個預測區間,在 Gift-Eval、FEV-Bench 和 Time 等基準測試中表現優於其他預訓練基座模型,目前已在 GitHub 和 Hugging Face 上線。

    推薦理由:谷歌釋出了面向多變數時間序列預測的基座模型 TimesFM-3,它通過交替注意力架構和單次前向傳遞實現了零樣本預測,在多項公開基準測試中表現領先。

8月28日週五
  1. Google Research62

    Google Research 推出行星預測引擎自動化全球地理空間建模

    Google Research 推出了行星預測引擎(PPE),這是一種作為 Google Earth AI 一部分的新型實驗性研究功能,能夠根據自然語言查詢自主執行從資料發現到模型訓練的完整地理空間預測工作流。該系統通過智慧地理空間資料選擇、多模態資料集策劃以及自動化模型構建三個模組化階段運作,在公共衛生、糧食安全、環境風險和社會經濟等多項預測任務的基準測試中超越了人工專家基線。

    推薦理由:原文介紹了該系統如何將地理空間建模流程縮短至數分鐘並提升多項預測任務的準確率,讀者可以據此評估其在複雜環境和人道主義應對中的應用潛力。

  2. Google DeepMind68

    Google DeepMind 釋出 Gemini Omni 1.1 Flash 影片生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,帶來場景延伸、首尾幀插值、4K 超解析度升級、360p 高效草稿生成及影片參考等多項專業級影片生成與控制功能,現已通過 Gemini API 及 Google AI Studio 面向開發者開放。

    推薦理由:原文給出了新模型的生成能力與接入方式,讀者可以據此瞭解其在影片製作中的具體控制選項。

8月27日週四
  1. Google DeepMind60

    Google DeepMind 推出全球首個雙盲 AI 評測機制

    Google DeepMind 推出全球首個專有前沿級別 AI 模型的雙盲評測,通過密碼學安全環境防止模型在測試前接觸到評測問題。該機制與新加坡人工智慧安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隱私保護環境中對 Gemini Flash Lite 模型進行保密基準測試,以提升評測的完整性。

    推薦理由:原文給出了基於密碼學環境開展模型評測的方案,讀者可以據此評估它將如何解決行業中普遍存在的基準汙染問題。

  2. Google Research62

    GlucoFM:用於連續血糖監測的基礎模型

    Google Research 推出了 GlucoFM,這是一個用於連續血糖監測的自監督基礎模型,採用雙流設計將較慢的血糖趨勢與短期偏差明確分離。在多項臨床預測任務評估中,GlucoFM 的 PR-AUC 表現優於對比模型,並且在餐後血糖響應預測、跨資料集遷移以及少樣本適應場景中展現出優勢。

    推薦理由:Google Research 推出的 GlucoFM 能夠有效分離動態並提升臨床預測準確率,為研究人員在代謝健康資料建模時提供了可參考的新方法。

  3. Google DeepMind75

    Google DeepMind 釋出語音轉文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,這是其迄今最精準的語音轉文本模型,支援即時流式傳輸與預錄音頻處理,字錯誤率在流式傳輸和非流式場景下分別達到 4.0% 和 2.6%。該模型支援超過 85 種語言的自動檢測與轉錄,具備智慧糾錯、自定義詞彙識別及多說話人識別等功能,目前已在 Google AI Studio 等平臺面向開發者開放公測。

    推薦理由:官方推出的最新語音轉文本模型給出了具體的錯誤率和多語言支援資料,讀者可以據此評估其實際語音互動效能。

8月26日週三
8月22日週六
  1. Google Research50

    AI工具實現可穿戴感測器資料候選生物標誌物優先順序排序

    Google Research釋出了Biomarker Discovery Framework,一套多代理系統,結合假設生成、統計分析、模型訓練、對抗驗證和文獻推理,在9,279個可穿戴感測器資料樣本中識別出41個精神健康和25個代謝疾病的候選數字生物標誌物,並在與人口統計特徵結合後提升預測效能。專家評估顯示,該框架在質量維度上優於同類AI系統。

8月21日週五
8月17日週一
  1. Google Research65

    Google Research 推出 PhotoScan:通過智慧手機影像估算心臟代謝風險

    Google Research 推出了 PhotoScan,這是一個通過標準 2D 智慧手機照片估算 3D 身體成分指標(如體脂率、A/G 比和 V/S 比)的深度學習框架。該模型在英國生物銀行資料上進行預訓練,並利用 677 名成人的佇列進行了微調;獨立驗證顯示其在預測胰島素抵抗方面達到了接近 DXA 掃描的準確度。

    推薦理由:該研究展示了利用普通手機影像估算身體成分和評估胰島素抵抗的新方案,為降低代謝健康篩查門檻提供了技術參考。

8月14日週五
  1. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。

    推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。

8月12日週三
  1. Google DeepMind62

    Google DeepMind 釋出手語轉文本模型 SL2T

    Google DeepMind 釋出了多語言手語轉文本翻譯模型 SL2T,並將其整合到 Gboard 和 Pixel 11 的 Live Transcribe 中。該模型支援將美國手語直接轉換為英語文本,它基於超過 10 萬小時的資料訓練,通過處理姿勢關節點來保護隱私並實現流式輸出。

    推薦理由:該模型將手語翻譯直接帶入消費級產品,為聽障使用者提供了更自然的手語輸入方式。

  2. Google Research63

    空書架還是丟了鑰匙?研究稱檢索是大語言模型引數化真實性的瓶頸

    Google Research 介紹了知識 profiling 行為框架和 WikiProfile 基準,用以衡量大語言模型的編碼與檢索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事實已被編碼,但模型仍無法直接檢索其中 26% 至 34% 的事實。這說明事實性錯誤主要源於知識無法可靠呼叫的檢索失敗,而非知識未被編碼的儲存缺失。

    推薦理由:研究指出前沿大語言模型的知識編碼已接近飽和,準確率瓶頸在於檢索而非儲存,為後續訓練與推理最佳化提供了新方向。