跳到正文

#Google

RSS
今日 7 則
今天10月1日週四
  1. Demis Hassabis (@demishassabis)66

    DeepMind 宣佈 Gemini 4 Argon 前沿 AI 模型,首批釋出給政府與網路防禦者。 新模型:Gemini 4 Argon,DeepMind 的前沿 AI 模型。 首批釋出:透過 Fairwind Program,先行提供給政府與可信賴的網路防禦者。 未來可用性:更廣泛的可用性將在不久後推出。

    推薦理由:Gemini 4 Argon 代表 DeepMind 在前沿 AI 領域的又一突破,先行向政府與網路防禦者開放,提示其在安全與責任部署方面的先行實踐。

  2. TechCrunch · AI63

    Google 釋出 Gemini 4 Argon,稱其為最強模型

    Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。

  3. Ars Technica · AI60

    Google公佈 Gemini 4 Argon AI 模型,但尚未開放使用

    Google公佈 Gemini 4 Argon AI 模型,聲稱在編碼、知識工作和網路安全方面具備行業領先效能,但目前尚未開放使用。內部工程師已在公司內部廣泛使用,Argon 通過“fleet‑wide telemetry data”幫助 Google 節省 300 TiB 記憶體,並在 C/C++ 程式碼遷移到 Rust 方面取得進展。

  4. The Verge · AI67

    Google 釋出 Gemini 4,稱其能力強大僅限可信網路防禦者使用

    Google 今日公佈 Gemini 4 Argon,稱其在複雜工作流程中的表現優於 OpenAI 與 Anthropic 的競爭模型。該模型目前僅向“可信網路防禦者”開放,Google 已在內部工作流中使用,幫助完成大規模程式碼庫遷移。公司釋出對比圖表顯示 Gemini 4 在多項基準上領先,並計劃在更廣泛推廣前加強安全防護。

  5. Google DeepMind72

    Gemini 4 Argon 釋出:開啟前沿智慧新時代

    Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。

    推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。

9月30日週三
  1. The Decoder66

    Anthropic 稱智譜開源 GLM-5.3 漏洞利用能力接近 Claude Mythos Preview

    Anthropic 評估顯示智譜的開源模型 GLM-5.3 在漏洞利用和網路攻擊能力上幾乎趕上了 Claude Mythos Preview。測試表明,GLM-5.3 在 ExploitBench 和內部二進位制測試中表現接近,且由於其開源權重,安全防護極易通過技術手段被剝離。美國機構 CAISI 的獨立評估也指出 GLM-5.3 是迄今為止網路能力最強的開源模型。

9月29日週二
9月25日週五
  1. Latent Space66

    Runway 的 WorldPrompt 與即時世界的工程實現

    Runway 介紹了其最新的世界模型 GWM Worlds 2 以及提出的輸入格式 WorldPrompt,並闡述了其如何通過自迴歸擴散和蒸餾方法實現 720p 24fps 的即時互動式影片和音訊生成。文章還探討了真實物理模擬、長上下文、誤差累積等工程挑戰,以及在遊戲、機器人和智慧體模擬等領域的潛在應用。

9月24日週四
  1. Simon Willison42

    Gemini 3.8 TTS Playground 演示平臺

    Google 釋出了 Gemini 3.8 TTS 的兩個新模型 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,支援 2,000+ 語音並可通過 30 秒樣本建立自定義聲音。Gemini 3.8 TTS Playground 允許使用者在瀏覽器中構建單聲道或多說話人對話,生成 1m18s 音訊僅需約 20 秒,成本 2.74 美分。

9月16日週三
  1. Google DeepMind66

    Google DeepMind 釋出 Gemini 3.8 Live 與 3.8 Live Extended Thinking 語音模型

    Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。

    推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。

9月15日週二
  1. Vercel Blog78

    Gemini 3.8 Live 模型現已可於 AI Gateway 使用

    Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking 現已可於 AI Gateway 使用,支援即時語音互動與多模態功能。

    推薦理由:Gemini 3.8 Live 及其擴充套件思考功能可即時語音互動,開發者可透過 AI Gateway 直接使用 WebSocket 進行即時對話,提升語音助手與多模態應用的互動體驗。

9月3日週四
  1. Google DeepMind84

    Google DeepMind 釋出全球天氣大模型 WeatherNext 3

    Google DeepMind 和 Google Research 釋出全新的全球天氣大模型 WeatherNext 3,支援每小時即時衛星資料輸入並提供高達 5 公里解析度的預測。該模型在降水預測精度上取得顯著提升,並增加了清潔能源變數預測,現已整合至 Search、Gemini、Maps 和 Cloud 等產品中。

    推薦理由:該模型通過融合即時衛星資料與高解析度網格,提升了全球天氣預報的精度和更新頻率,為清潔能源規劃和區域氣象服務提供了更可靠的資料支援。

9月1日週二
  1. Google Research63

    Google Research 釋出 TimesFM-3:支援多變數預測的零樣本時間序列基座模型

    Google Research 推出 TimesFM-3,這是一個擁有 3.3 億引數、原生支援多變數預測的零樣本時間序列基座模型。該模型採用解碼器架構與交替注意力機制,支援單次前向傳遞生成整個預測區間,在 Gift-Eval、FEV-Bench 和 Time 等基準測試中表現優於其他預訓練基座模型,目前已在 GitHub 和 Hugging Face 上線。

    推薦理由:谷歌釋出了面向多變數時間序列預測的基座模型 TimesFM-3,它通過交替注意力架構和單次前向傳遞實現了零樣本預測,在多項公開基準測試中表現領先。

8月28日週五
  1. Google DeepMind68

    Google DeepMind 釋出 Gemini Omni 1.1 Flash 影片生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,帶來場景延伸、首尾幀插值、4K 超解析度升級、360p 高效草稿生成及影片參考等多項專業級影片生成與控制功能,現已通過 Gemini API 及 Google AI Studio 面向開發者開放。

    推薦理由:原文給出了新模型的生成能力與接入方式,讀者可以據此瞭解其在影片製作中的具體控制選項。

8月27日週四
  1. Google DeepMind75

    Google DeepMind 釋出語音轉文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,這是其迄今最精準的語音轉文本模型,支援即時流式傳輸與預錄音頻處理,字錯誤率在流式傳輸和非流式場景下分別達到 4.0% 和 2.6%。該模型支援超過 85 種語言的自動檢測與轉錄,具備智慧糾錯、自定義詞彙識別及多說話人識別等功能,目前已在 Google AI Studio 等平臺面向開發者開放公測。

    推薦理由:官方推出的最新語音轉文本模型給出了具體的錯誤率和多語言支援資料,讀者可以據此評估其實際語音互動效能。

8月14日週五
  1. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。

    推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。

8月12日週三
  1. Google DeepMind62

    Google DeepMind 釋出手語轉文本模型 SL2T

    Google DeepMind 釋出了多語言手語轉文本翻譯模型 SL2T,並將其整合到 Gboard 和 Pixel 11 的 Live Transcribe 中。該模型支援將美國手語直接轉換為英語文本,它基於超過 10 萬小時的資料訓練,通過處理姿勢關節點來保護隱私並實現流式輸出。

    推薦理由:該模型將手語翻譯直接帶入消費級產品,為聽障使用者提供了更自然的手語輸入方式。

8月6日週四
  1. Google DeepMind66

    Google DeepMind 釋出 WeatherNext AI 模型並實現氣旋預測突破

    Google DeepMind 推出了 WeatherNext AI 模型,在氣旋的路徑、強度和風力結構預測上達到了 SOTA 精度,平均可提供額外一天的預警時間。該研究成果已在 Nature 發表,團隊宣佈開源 WeatherNext 2 與 WeatherNext Cyclones 模型程式碼及權重。

    推薦理由:該模型實現了氣旋路徑和強度預測的大幅準確率提升,並開源了程式碼與權重,為氣象研究和防災減災提供了新工具。

7月30日週四
  1. Google DeepMind86

    Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人

    DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。

  2. Google DeepMind62

    Google Flow Music 推出 Lyria 3.5,提升音樂性、歌詞、聲樂與創作控制

    Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。

    推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。

7月21日週二
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延遲支撐大規模 AI 智慧體工作流。

    推薦理由:官方釋出了三個新的 Gemini Flash 系列模型,給出了詳細的效能指標與價格,讀者可以據此評估其在智慧體工作流和高吞吐任務中的成本與效率。

7月17日週五
  1. Google DeepMind63

    Google DeepMind 釋出 Gemini 3.5 Flash Cyber 網路安全模型

    Google DeepMind 推出了基於 3.5 Flash 構建並針對網路安全任務微調的輕量化模型 Gemini 3.5 Flash Cyber,旨在幫助防禦者快速發現、驗證和修補軟體漏洞。

    推薦理由:Google DeepMind 推出了專為網路安全微調的輕量化模型,通過支援高頻率和多輪呼叫,在多個安全基準上展現了優於 mainline 模型和部分競品的漏洞挖掘能力。

7月1日週三
  1. Google DeepMind76

    Google DeepMind 釋出 Nano Banana 2 Lite 與 Gemini Omni Flash 模型

    Google DeepMind 推出兩款新模型:速度最快且最具成本效益的影像模型 Nano Banana 2 Lite,以及用於高質量影片生成和對話式編輯的 Gemini Omni Flash。

    推薦理由:Google DeepMind 推出 Nano Banana 2 Lite 與 Gemini Omni Flash 兩款新模型,為開發者串聯影像生成與影片編輯提供了低成本且高效的新方案。

6月30日週二
  1. Google Research63

    Google Research 釋出 TabFM:面向表格資料的零樣本基礎模型

    Google Research 推出了 TabFM,這是一個專為表格資料分類和迴歸設計的零樣本基礎模型。該模型通過將表格預測轉換為上下文學習問題,消除了傳統機器學習中的手動模型訓練、超引數調優和複雜特徵工程,能夠在單次前向傳遞中對未見過的表格生成高質量預測。

    推薦理由:Google Research 釋出了面向表格資料的零樣本基礎模型 TabFM,讀者可以據此瞭解大模型架構如何簡化分類和迴歸的工作流。

6月27日週六
  1. Google Research65

    Google Research:利用凍結的多Token預測技術在 Pixel 裝置上加速 Gemini Nano 模型

    Google Research 宣佈推出一項新架構,將多Token預測(MTP)技術應用到已部署且權重被凍結的 Gemini Nano v3 模型上。該方法採用零複製架構直接利用主模型的鍵值快取,在 Pixel 9 和 10 系列裝置上實現了 50% 或更高的推理速度提升,並減少了能耗。

    推薦理由:谷歌研究團隊通過在已凍結的 Gemini Nano 模型上應用多Token預測架構,在不增加記憶體冗餘的前提下顯著提升了端側裝置的推理速度與能效。

6月11日週四
  1. Google DeepMind75

    Google DeepMind 釋出 DiffusionGemma 開源文本擴散模型

    Google DeepMind 釋出了採用 Apache 2.0 協議開源的實驗性模型 DiffusionGemma,這是一款基於 Gemma 4 家族和 Gemini 擴散研究的 26B MoE 文本擴散模型,可在專用 GPU 上實現高達 4 倍的文本生成速度。

    推薦理由:該模型採用文本擴散架構實現數倍於傳統自迴歸模型的推理速度,為開發者探索本地即時互動工作流提供了新的硬體利用方式與微調路徑。

6月9日週二
  1. Google DeepMind81

    Gemini 3.5 Live Translate 即時語音翻譯實現流暢自然

    Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。

    推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。

  2. Google DeepMind86

    推出 Gemma 4 12B:無編碼器統一多模態模型

    DeepMind 推出 Gemma 4 12B,這是一款無編碼器的統一多模態模型,能夠直接在配備 16GB VRAM 的筆記本上執行。它在保持與 26B MoE 近似的推理效能的同時,顯著降低了記憶體佔用,並首次支援原生音訊輸入。

    推薦理由:Gemma 4 12B 以無編碼器的多模態架構實現低記憶體、強推理,適配本地 16GB VRAM 機器,讀者可據此評估在邊緣裝置上的部署可能。

5月18日週一
  1. Google DeepMind86

    Google DeepMind 釋出 Gemini Omni 與首款模型 Gemini Omni Flash

    Google DeepMind 推出了全新多模態模型 Gemini Omni,併發布了該系列首款模型 Gemini Omni Flash,支援通過影像、音訊、影片和文本組合輸入生成及編輯影片。該模型已向 Gemini app、Google Flow 以及 YouTube Shorts 使用者推出,未來還將通過 API 提供給開發者和企業客戶。

    推薦理由:原文介紹了新模型的具體輸入組合和釋出範圍,讀者可以據此評估多模態影片生成與編輯的最新能力邊界。

5月16日週六
  1. Google DeepMind64

    Google DeepMind 介紹 WeatherNext 如何協助美國國家颶風中心預測颶風梅利莎

    Google DeepMind 的天氣模型 WeatherNext 成功提前五天預測了 2025 年颶風梅利莎在牙買加增強至五級強颶風的路徑與強度。該模型通過結合全球天氣模式與極端熱帶氣旋資料集,兼顧了傳統模型難以同時做到的路徑與強度預測能力。

    推薦理由:文章詳細記錄了 AI 天氣模型在颶風預報中的實際表現與提前天數,讀者可以據此評估其在極端氣象預測中的應用潛力。

4月16日週四
  1. Google DeepMind73

    Gemini 3.1 Flash TTS 釋出:下一代表達式 AI 語音模型

    Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表達力和音質,支援 70+ 語言和多說話人對話,並通過細粒度音訊標籤讓開發者可用自然語言控制語音風格。該模型在人工分析 TTS 評測中獲得 1,211 Elo 分,並已在 Gemini API、Vertex AI 及 Google AI Studio 預覽。

    推薦理由:Gemini 3.1 Flash TTS 通過細粒度音訊標籤提升可控性與表達力,支援 70+ 語言,支援多說話人對話,適合企業與開發者構建多語種語音應用,且在人工分析 TTS 評測中獲得 1,211 Elo 分。

4月13日週一
  1. Google DeepMind75

    Gemini Robotics-ER 1.6:通過增強具身推理驅動真實世界機器人任務

    Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。

    推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。

4月3日週五
  1. Google DeepMind69

    Gemma 4 釋出:最強開源模型

    Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。

    推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。