Google 釋出 Gemini 4 Argon,稱其為最強模型
Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。
Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。
Google 釋出 Gemini 4 Argon,首個七個月來的前沿模型,在多項基準上與 OpenAI 的 GPT-6 Astra 同級,且價格更低。Argon 支援文本、影像、影片、音訊輸入,輸出文本,並通過 Long Decode Continuation 解決長響應超時。
Simon Willison 釋出了 Photo Scrubber,一款利用 MediaPipe 與 GPT-6 Astra 自動識別並模糊照片中人臉的實驗性工具。它使用 Google 的 MediaPipe C++ 庫編譯為 WebAssembly,並採用 BlazeFace 人臉檢測模型,同時支援後設資料移除。
Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。
推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。
AWS 介紹瞭如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一個三智慧體協作的音樂製作管線,實現 GPU 音樂生成、音訊處理與合規篩查。文章詳細講解了容量提供者配置、共享會話的多智慧體同機協作、多日持久化儲存以及各智慧體的獨立部署流程。
推薦理由:文章給出了基於 Amazon Bedrock AgentCore Runtime Instances 部署多智慧體音樂製作管線的具體步驟與架構設計,讀者可以據此瞭解長週期持久化與多智慧體協同的實現方式。
Dazzle 是 Marissa Mayer 推出的個人 AI 助手,利用手機相機膠捲中的照片來獲取使用者上下文。它能根據照片識別興趣愛好、旅行地點等,併為日程、旅行、禮物等提供個性化建議;同時強調只使用非敏感影像資訊以保障隱私。
Condé Nast 聯合 AWS Generative AI Innovation Center 基於 Amazon Bedrock 和 Amazon OpenSearch Service 構建了多模態影片檢索方案。該方案採用 TwelveLabs Marengo 嵌入模型對超過 14萬個影片進行跨影片轉寫、視覺和音訊的語義索引。這使得單次內容檢索時間從 250 分鐘縮短至 2 分鐘以內。
Latent Space 釋出的 AINews 彙總了多款前沿模型動態,其中 Claude Opus 5.5 在 SimpleBench 領先,並在視覺和程式碼生成任務上表現突出;同時涵蓋 GPT-6 家族、Gemini 3.8 Flash、Xiaomi MiMo-V2.6-Pro 以及智慧體、檢索和推理效率等生態進展。
xAI 的 Grok 4.7 現已在 Amazon Bedrock 上線,支援 500K 上下文視窗、四級推理努力程度配置及圖文輸入。該模型可通過 Responses、Chat Completions 和 Converse API 進行呼叫,並提供 US 區域和 Global 跨區域推理配置選項。
推薦理由:原文介紹了 xAI Grok 4.7 在 Amazon Bedrock 上的可用性與整合細節,讀者可以據此瞭解該模型在 Bedrock 上的呼叫方式與配置選項。
本文介紹瞭如何在 Amazon SageMaker HyperPod 上使用開源強化學習框架 SkyRL,配合 GRPO 演算法對 Qwen3-VL-8B 視覺語言模型進行多模態強化學習後訓練。
Runway 介紹了其最新的世界模型 GWM Worlds 2 以及提出的輸入格式 WorldPrompt,並闡述了其如何通過自迴歸擴散和蒸餾方法實現 720p 24fps 的即時互動式影片和音訊生成。文章還探討了真實物理模擬、長上下文、誤差累積等工程挑戰,以及在遊戲、機器人和智慧體模擬等領域的潛在應用。
Google Research 介紹了用於自動化長影片生成的多智慧體框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四個核心元件。該框架通過全域性最佳化和世界狀態追蹤解決語義漂移與級聯失敗問題,能夠將創意轉化為分鐘級、具備多鏡頭敘事一致性的影片。
推薦理由:該研究通過多智慧體框架解決長影片生成中的視覺一致性問題,為提升影片擴散模型的長時序敘事能力提供了可複用的系統架構參考。
Google DeepMind 釋出 Gemini 3.8 Live with Live Avatar,為對話式 AI 帶來近即時的視覺形象與流媒體影片支援。該功能原生耦合了即時對話與低延遲影片生成,具備精確唇形同步、動態視覺形象、非同步工具呼叫以及跨 97 種語言的原生語音同步能力,現已在 Gemini Enterprise 中可用。
本文介紹了 AWS WhisperX Deep Learning Container(DLC)的使用方法,演示如何在 Amazon SageMaker AI 上部署即時和非同步端點,實現詞級時間戳和說話人標籤的轉寫。
推薦理由:本文展示瞭如何在 SageMaker 上部署 WhisperX,實現精準的詞級時間戳和說話人標籤,幫助使用者快速構建可搜尋、可稽核的音訊轉寫系統。
Liquid AI 針對視覺語言模型 LFM2.5-VL-3B 釋出了實驗性的 DSpark 草稿模型,通過引入投機解碼路徑實現推理加速。該草稿模型包含 2.8 億引數(增量 8.9%),在端側和 GPU 上解碼速度最高可提升 3.13 倍,並且首日即整合支援 llama.cpp、MLX-VLM 和 SGLang。
NVIDIA 聯合 Google DeepMind 及歐洲生物資訊研究所(EMBL-EBI)等全球研究機構,通過 AlphaFold Database 免費釋出了覆蓋超 2,800 種病毒的蛋白質複合物預測 3D 結構資料集。
推薦理由:原文介紹了由 NVIDIA 與 Google DeepMind 等機構合作開源的病毒蛋白質複合物預測資料集,讀者可以據此瞭解 AI 在生物學研究中的最新應用進展。
Meta 在 2026 年 Connect 大會上釋出了個人智慧體 Muse,並推出支援語音和即時影片互動的新款眼鏡硬體及定價 1,299 美元的 VR 眼鏡。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言的自然語言提示詞聲音設計、30 秒聲音復刻以及逐行臺詞精細導演。
推薦理由:官方釋出的最新語音生成模型提供了細粒度的臺詞導演和聲音定製能力,讀者可以據此評估其在多語言配音與智慧體互動中的實際表現。
Gemini 3.8 Flash‑Lite TTS 與 Gemini 3.8 Flash TTS 現已在 AI Gateway 上線,支援 100 多種語言的文本轉語音,支援長篇朗讀、交付控制和雙人對話。
推薦理由:Gemini 3.8 TTS模型已在AI Gateway上線,支援100多種語言、長篇朗讀和雙人對話,開發者可通過AI SDK輕鬆生成語音。
小米釋出 MiMo-V2.6 系列原生全模態開源模型,其中 Pro 版本擁有 1.02T 總引數和 42B 啟用引數,RL 訓練成本約 300 萬美元。該系列同時開源了訓練環境、程式碼及技術報告,旨在降低強化學習訓練門檻。
MiMo V2.6 Pro、Flash 與 Pro UltraSpeed 三款來自小米的模型現已在 AI Gateway 上可用。它們支援文本、影像、音訊和影片輸入,並具備推理、工具呼叫、JSON 輸出、提示快取等功能,擁有 1M-token 上下文視窗和最高 128K 輸出 token。
summary_zh: GLM 5.3 FlashX 現已於 AI Gateway 上可用,提供約 200 tokens/second 的推理速度,適用於編碼代理、工具迴圈與互動式應用。
NVIDIA 釋出的 Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中表現領先,在 Qwen3-VL 上實現了較 GB300 NVL72 最高 3.7 倍的吞吐量提升。
Google DeepMind 推出了 AlphaGenome Atlas 平臺,包含人類基因組中 90 億種單核苷酸變異的預測效應,並同步釋出了 AlphaGenome Variant Impact 評分。該平臺提供網站埠、API 以及 Google Antigravity 中的 skill,旨在幫助學術研究人員理解基因變異對分子生物學的影響。
推薦理由:該平臺預先計算了人類基因組中所有可能單核苷酸變異的分子效應預測併發布了配套評分指標,為研究人員快速評估基因變異影響提供了新資源。
Google DeepMind 和 Google Research 釋出全新的全球天氣大模型 WeatherNext 3,支援每小時即時衛星資料輸入並提供高達 5 公里解析度的預測。該模型在降水預測精度上取得顯著提升,並增加了清潔能源變數預測,現已整合至 Search、Gemini、Maps 和 Cloud 等產品中。
推薦理由:該模型通過融合即時衛星資料與高解析度網格,提升了全球天氣預報的精度和更新頻率,為清潔能源規劃和區域氣象服務提供了更可靠的資料支援。
Hugging Face 團隊推出了 NeoMME,這是一個包含 260M 和 800M 引數的多語言多模態基礎編碼器系列。該模型不使用單獨的視覺塔或因果語言模型,而是通過單個雙向 Transformer 同時處理文本 token 和原始影像塊。
推薦理由:原文釋出了不依賴獨立視覺塔的多模態雙向編碼器,讀者可以瞭解其單塔架構和檢索效能。
Google Research 聯合 NASA JPL 推出了 MAPL-EMIT 深度學習框架,利用 Swin-S transformer 架構處理高光譜輻射測量資料,實現了甲烷羽流的自動檢測、定量增強預測和源頭定位。
Google DeepMind 推出了適用於 Gemini 最新模型的智慧體影片理解功能,通過動態檢索視覺幀、音訊和字幕,將影片分析的 token 消耗降低最高 88%、成本降低最高 66%,並將準確率提升最高 7%。
推薦理由:原文公佈了功能特性與具體最佳化資料,讀者可以據此瞭解該技術如何降低影片處理成本。
Microsoft Research 釋出了 GigaPath-Flash 與 GigaTIME-Flash 兩款高效病理基礎模型。GigaPath-Flash 採用 22M 引數 ViT‑S tile encoder 與 21M 引數 LongNet slide encoder,推理成本比原版低 50 倍,效能僅落後 3%。
Google DeepMind 推出了 Gemini Omni 1.1 Flash,帶來場景延伸、首尾幀插值、4K 超解析度升級、360p 高效草稿生成及影片參考等多項專業級影片生成與控制功能,現已通過 Gemini API 及 Google AI Studio 面向開發者開放。
推薦理由:原文給出了新模型的生成能力與接入方式,讀者可以據此瞭解其在影片製作中的具體控制選項。
Google Research 推出了 GlucoFM,這是一個用於連續血糖監測的自監督基礎模型,採用雙流設計將較慢的血糖趨勢與短期偏差明確分離。在多項臨床預測任務評估中,GlucoFM 的 PR-AUC 表現優於對比模型,並且在餐後血糖響應預測、跨資料集遷移以及少樣本適應場景中展現出優勢。
推薦理由:Google Research 推出的 GlucoFM 能夠有效分離動態並提升臨床預測準確率,為研究人員在代謝健康資料建模時提供了可參考的新方法。
Google Research 推出了 AgentHands,這是一個在 XR 中為智慧體對話生成互動式手勢的研究原型。該系統通過多維度分類法與工作流,將 LLM 的推理結果對映為與語音同步的 3D 手勢,提升了空間定位、複雜動作理解及安全性提示的效果。
Google Research 推出 Mobility-Embedded POIs (ME-POIs) 框架,將聚合匿名移動模式與文本描述融合,顯著提升地點屬性預測。在公開基準上,ME-POIs 使訪問意圖預測提升 81.9%,價格等級分類提升 75.1%,繁忙度估計準確率提升 24.7%。
Sentence Transformers 釋出 v6.0 版本,首次引入第四種模型型別 MultiVectorEncoder,用於支援 ColBERT 風格的後期互動檢索。該版本允許開發者通過熟悉的 API 直接載入各類 PyLate、ColBERT 以及 ColPali 視覺文件檢索模型的檢查點,無需經過複雜的格式轉換。
推薦理由:該版本新增了對多向量檢索模型的原生支援,讀者可以通過標準介面直接載入多種主流模型的檢查點並完成檢索與重排。
Google Research 推出了 PhotoScan,這是一個通過標準 2D 智慧手機照片估算 3D 身體成分指標(如體脂率、A/G 比和 V/S 比)的深度學習框架。該模型在英國生物銀行資料上進行預訓練,並利用 677 名成人的佇列進行了微調;獨立驗證顯示其在預測胰島素抵抗方面達到了接近 DXA 掃描的準確度。
推薦理由:該研究展示了利用普通手機影像估算身體成分和評估胰島素抵抗的新方案,為降低代謝健康篩查門檻提供了技術參考。
OlmoEarth Studio 推出自定義嵌入向量匯出功能,支援使用者從其開源地球觀測基礎模型計算並匯出緊湊的數值表示。該功能允許通過介面或 API 按需生成輕量級 Cloud-Optimized GeoTIFFs,適用於相似性檢索、少樣本分割、變化檢測和無監督探索等下游任務。
Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。
推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。
Google DeepMind 釋出了多語言手語轉文本翻譯模型 SL2T,並將其整合到 Gboard 和 Pixel 11 的 Live Transcribe 中。該模型支援將美國手語直接轉換為英語文本,它基於超過 10 萬小時的資料訓練,通過處理姿勢關節點來保護隱私並實現流式輸出。
推薦理由:該模型將手語翻譯直接帶入消費級產品,為聽障使用者提供了更自然的手語輸入方式。
Google Research 推出了 AMIE 的即時影片配置版本 AMIE (Video),能夠基於 Gemini 和 Project Astra 進行同步臨床影片問診,感知非引導性的臨床非語言線索並進行即時診斷推理。
推薦理由:這項研究展示了多模態醫療AI在影片問診中的專家級表現,為遠端醫療系統的架構設計提供了實證參考。
Microsoft Research 推出了研究模型 CARE-X,這是一款旨在兼顧自由文本推理與確定性輸出的統一胸部 X 光 VLM。該模型結合了生成式與判別式能力,並通過強化學習(DAPO)在多工設定中最佳化臨床準確性。研究還線上路實驗中搭配了 Qwen3-VL-4B-Instruct 與確定性測量工具以評估效能。