Google 釋出 Gemini 4 Argon,稱其為最強模型
Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。
Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。
Google 今日公佈 Gemini 4 Argon,稱其在複雜工作流程中的表現優於 OpenAI 與 Anthropic 的競爭模型。該模型目前僅向“可信網路防禦者”開放,Google 已在內部工作流中使用,幫助完成大規模程式碼庫遷移。公司釋出對比圖表顯示 Gemini 4 在多項基準上領先,並計劃在更廣泛推廣前加強安全防護。
OpenAI 與 Synopsys 簽署多年戰略合作,聯合研發名為 GPT‑Synopsys 的專用 AI 模型,用於晶片設計與驗證。該模型將 OpenAI 的技術與 Synopsys 的 EDA 工具結合,直接操作工具並在 OpenAI 基礎設施上執行。雙方表示將共同營銷並分攤收入,且客戶資料不用於訓練並將加密儲存。早期與半導體客戶的測試已在進行中。
Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。
推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。
Amazon Bedrock 在印度推出 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5 的境內推理支援,允許客戶通過孟買和海得拉巴區域處理本地資料。該功能採用地理跨區域推理,在 ap-south-1 和 ap-south-2 之間路由請求,以滿足資料本地化合規需求。
Ling 3.1 Flash 是 InclusionAI 推出的混合推理語言模型,現已在 AI Gateway 上免費使用至 2026 年 10 月 13 日。
推薦理由:Ling 3.1 Flash 提供 262K token 上下文視窗和 560B 引數的混合推理能力,專為編碼與多步分析設計,讀者可評估其在 AI Gateway 上的應用潛力與成本優勢。
GPT-6.1 Sol 現已在 Amazon Bedrock 上全面可用,為編碼、計算機使用和專業工作負載帶來更強的推理能力。該模型在 DeepSWE v1.1 上以約五分之一的單任務成本實現了接近 GPT-6 Astra 的表現,並在複雜文件分析和多步驟工作流上超越了 GPT-6 Sol。
推薦理由:原文公佈了模型在亞馬遜雲科技平臺上的可用性和基準表現,讀者可以據此評估其在自動化工作流中的價效比與落地可行性。
GPT 6.1 Sol 實現了接近 Astra 級別的智慧,而價格降至五分之一。這是 Simon Willison 在 2026 年 9 月 29 日釋出的月度簡報中披露的相關 LLM 進展。
xAI 的 Grok 4.7 現已在 Amazon Bedrock 上線,支援 500K 上下文視窗、四級推理努力程度配置及圖文輸入。該模型可通過 Responses、Chat Completions 和 Converse API 進行呼叫,並提供 US 區域和 Global 跨區域推理配置選項。
推薦理由:原文介紹了 xAI Grok 4.7 在 Amazon Bedrock 上的可用性與整合細節,讀者可以據此瞭解該模型在 Bedrock 上的呼叫方式與配置選項。
Ember-1 是 Fireworks 基於 Kimi K3 開發的研究預覽推理模型,現已在 AI Gateway 上提供。該模型在相同質量評估下比 Kimi K3 生成 token 少約 40%,支援 1M-token 上下文視窗、文本與影像輸入、工具呼叫以及隱式提示快取。
本文介紹瞭如何在 Amazon SageMaker HyperPod 上使用開源強化學習框架 SkyRL,配合 GRPO 演算法對 Qwen3-VL-8B 視覺語言模型進行多模態強化學習後訓練。
AWS 團隊詳細介紹了面向生產環境的大語言模型質量保障架構,通過自適應管道編排、跨賬戶多模型故障轉移、即時流式評估、複合評估框架以及資料準確性驗證五項技術,在 Amazon Bedrock 上實現了約 99% 的數值準確率並支援即時流式響應。文章重點闡述瞭如何通過三階段自適應處理、獨立配額空間網格、生產者消費者併發模式及兩階段級聯驗證來解決模型幻覺、API 限流和驗證延遲等工程挑戰。
推薦理由:文章詳細拆解了五項用於保障大語言模型生產環境質量的技術實現,幫助開發者在實際業務中平衡準確率與響應延遲。
Harvey 藉助 GPT-6 Astra 生成結構化且具備上下文感知能力的法律文書,從而讓律師能夠專注於策略制定。
MiMo V2.6 Pro、Flash 與 Pro UltraSpeed 三款來自小米的模型現已在 AI Gateway 上可用。它們支援文本、影像、音訊和影片輸入,並具備推理、工具呼叫、JSON 輸出、提示快取等功能,擁有 1M-token 上下文視窗和最高 128K 輸出 token。
Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。
推薦理由:Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。
NVIDIA 釋出的 Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中表現領先,在 Qwen3-VL 上實現了較 GB300 NVL72 最高 3.7 倍的吞吐量提升。
Jev 是 TypeSafe AI 的一個機率決策模型,現在已可在 Vercel 的 AI Gateway 上使用。 - 速度與成本:在工作流程評估中,Jev 的執行速度比 LLM 高 193.6 倍,成本低 444.6 倍。
Salesforce 推出了首個 CRM 推理模型 Koa,該模型基於 NVIDIA Nemotron 3 Super 構建並使用 NVIDIA NeMo 工具鏈進行訓練。
Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。
推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。
OpenAI 分享了一個 AI 生成的 Navier–Stokes 世紀獎問題的解決方案,包含書面說明和 Lean 形式化證明。
推薦理由:OpenAI 通過 AI 生成的證明展示了在數學領域應用 LLM 的潛力,讀者可瞭解 AI 在嚴謹推理中的可行性。
Google DeepMind 釋出 Gemini 3.8 Flash 與 3.8 Flash Cyber 兩款新模型,帶來更強的長程推理、編碼和智慧體任務能力。
推薦理由:原文公佈了新模型的架構變動、基準成績與具體定價,讀者可以據此評估它在成本與長程智慧上的價效比。
Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。
Granite 4.2 是 IBM 推出的三種規模(3B、8B、30B)的稠密解碼器推理 LLM,基於 Granite‑4.1 預訓練模型,使用約 15T 令牌的五階段訓練策略,擴充套件上下文視窗至 512K,並通過監督微調和多階段強化學習(包括 agentic RL)實現鏈式思考、工具呼叫與低成本思考模式。
推薦理由:Granite 4.2 通過多階段 RL 訓練實現強推理與工具呼叫能力,讀者可瞭解其技術細節與效能提升。
一項研究表明,大模型在網路安全領域帶來了大幅加速,在數學研究中帶來了較小加速,而在 AI 自身研究中尚未帶來可測量的加速。多所高校研究者聯合推出了 SPADE,這是一個通過自我對弈協同演化環境合成與智慧體能力的通用框架。該框架在 30B 規模下利用 Qwen3 骨幹網路進行了測試,在遊戲和工具使用環境評測中均提升了效能。
Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。
推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。
Google Research 介紹了知識 profiling 行為框架和 WikiProfile 基準,用以衡量大語言模型的編碼與檢索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事實已被編碼,但模型仍無法直接檢索其中 26% 至 34% 的事實。這說明事實性錯誤主要源於知識無法可靠呼叫的檢索失敗,而非知識未被編碼的儲存缺失。
推薦理由:研究指出前沿大語言模型的知識編碼已接近飽和,準確率瓶頸在於檢索而非儲存,為後續訓練與推理最佳化提供了新方向。
Multiverse Computing 在其最新論文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出離線 Top‑100 logits 快取與分塊 KL 損失兩項改進。
推薦理由:本文提出的離線Top‑K logits快取和分塊KL損失顯著降低視訊記憶體需求,使大規模LLM蒸餾可在單GPU上完成,降低成本並提升實驗效率。
Google Research 在其 Willow 超導處理器上演示了利用強化學習實現量子計算機持續校準的方法,顯著降低了邏輯錯誤率。實驗中,RL 訓練將錯誤率降低 3.5 倍,最終邏輯錯誤率低至每千個糾錯週期不到一次,並在數百量子位元的模擬中驗證了可擴充套件性。該方法將量子錯誤檢測事件作為主動學習訊號,展示了可持續計算的新範式。
推薦理由:通過強化學習實現量子計算機持續校準,顯著降低邏輯錯誤率,展示了可擴充套件的自適應控制方法,為未來大規模量子計算提供可行路徑。
Mistral AI 釋出 Leanstral 1.5,這是一款採用 Apache-2.0 許可證、擁有 119B 總引數和 6B 啟用引數的開源形式化驗證模型。該模型經過中訓練、監督微調與 CISPO 強化學習,在 miniF2F、PutnamBench 以及 FATE-H 和 FATE-X 等基準測試中取得顯著效能提升,並支援通過 Hugging Face 和免費 API 獲取。
推薦理由:文章詳細說明了 Leanstral 1.5 的引數規模、訓練階段與測試集表現,讀者可以據此評估該開源形式化驗證模型在數學推理和程式碼驗證上的實際效能。
2026 年,Berkeley Artificial Intelligence Research (BAIR) Lab 慶祝其畢業生的成就。他們的研究涵蓋機器人、LLM、計算機視覺、生成模型、AI 安全、人機互動、科學與醫療 AI,並已發表影響力論文、構建實用系統、指導同輩。畢業生正投身學術、工業研究實驗室及創業公司,期待未來發展。
Google Research 探討了大語言模型中推理如何解鎖引數化知識,通過控制實驗揭示了計算緩衝區效應和事實啟動兩大機制。研究表明,即使面對簡單的單跳問題,啟用推理也能幫助模型召回原本難以觸及的正確答案。不過,推理階段產生的中途幻覺會顯著降低最終答案的正確率。
推薦理由:研究揭示了推理如何解鎖大語言模型的引數化知識,並指出了中間事實對準確率的關鍵影響。
DeepMind 推出 Gemma 4 12B,這是一款無編碼器的統一多模態模型,能夠直接在配備 16GB VRAM 的筆記本上執行。它在保持與 26B MoE 近似的推理效能的同時,顯著降低了記憶體佔用,並首次支援原生音訊輸入。
推薦理由:Gemma 4 12B 以無編碼器的多模態架構實現低記憶體、強推理,適配本地 16GB VRAM 機器,讀者可據此評估在邊緣裝置上的部署可能。
Mistral AI 推出 128B 開源旗艦模型 Mistral Medium 3.5,具備 256k 上下文視窗、可配置推理強度以及從頭訓練的視覺編碼器,並在 SWE-Bench Verified 上取得 77.6% 的成績。
推薦理由:Mistral Medium 3.5 的釋出和雲端非同步智慧體能力的上線,展示瞭如何通過長上下文與多工具呼叫降低開發者的任務阻塞成本。
Adaptive Parallel Reasoning 提出讓模型自行決定何時並行拆分、執行緒數量和協調方式,以提升推理效率。ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法已實現多執行緒並行推理,減少上下文旋轉和推理延遲。此範式可在數學、編碼和代理任務中顯著降低推理時間,避免上下文旋轉問題。
作者 Jack Clark 撰文分析認為,基於軟體工程、基準測試和智慧體自主執行時間的進展,AI 系統有較大可能在 2028 年底前實現端到端自動化的 AI 研發。文章指出,當前模型在程式碼生成、復現論文、Kaggle 競賽和核心最佳化等任務上的能力顯著提升,正在逐步承擔原本需要人類完成的大量工程與科學實驗工作。
Google Research 推出了 ReasoningBank 智慧體記憶框架,通過從成功和失敗經驗中提取結構化推理模式來實現測試期自我進化。該方法通過記憶感知測試期擴充套件(MaTTS)機制,在網頁瀏覽和軟體工程基準測試中顯著提升了智慧體的成功率和執行效率。
推薦理由:文章介紹了從成功與失敗經驗中提取結構化推理模式的記憶框架,讀者可以據此瞭解如何通過記憶增強智慧體的測試期擴充套件能力。
GRASP 是一種新的梯度規劃器,針對學習到的世界模型實現長時序規劃。它通過將軌跡提升到虛擬狀態實現並行最佳化、在狀態迭代中加入噪聲以增強探索、並重塑梯度以避免脆弱的狀態輸入梯度,從而顯著提升規劃魯棒性和速度。實驗顯示在 Push‑T 任務中,GRASP 在更長時間步上取得更高成功率且耗時更短。詳情見論文 https://arxiv.org/abs/2602.00475。
推薦理由:GRASP 通過提升狀態、加入噪聲與梯度重塑,解決了大規模世界模型長時序規劃的梯度爆炸與不穩定問題。
Google Research 介紹了 Simula 框架,這是一種採用第一性原理構建整個合成數據集的種子無關且具身智慧的方法。該框架通過全域性多元化、區域性多元化、複雜化和質量檢查四個可控軸來分解生成過程,並在多個領域評估中展示了最佳化資料屬性對下游效能的提升。
推薦理由:文章介紹了通過第一性原理構建合成數據集的 Simula 框架,為解決稀缺領域的資料瓶頸提供了可程式設計的工作流方案。
Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。
推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。
Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。
推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。