Google 釋出 Gemini 4 Argon,稱其為最強模型
Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。
Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。
Google 釋出 Gemini 4 Argon,首個七個月來的前沿模型,在多項基準上與 OpenAI 的 GPT-6 Astra 同級,且價格更低。Argon 支援文本、影像、影片、音訊輸入,輸出文本,並通過 Long Decode Continuation 解決長響應超時。
Google公佈 Gemini 4 Argon AI 模型,聲稱在編碼、知識工作和網路安全方面具備行業領先效能,但目前尚未開放使用。內部工程師已在公司內部廣泛使用,Argon 通過“fleet‑wide telemetry data”幫助 Google 節省 300 TiB 記憶體,並在 C/C++ 程式碼遷移到 Rust 方面取得進展。
Google 今日公佈 Gemini 4 Argon,稱其在複雜工作流程中的表現優於 OpenAI 與 Anthropic 的競爭模型。該模型目前僅向“可信網路防禦者”開放,Google 已在內部工作流中使用,幫助完成大規模程式碼庫遷移。公司釋出對比圖表顯示 Gemini 4 在多項基準上領先,並計劃在更廣泛推廣前加強安全防護。
OpenAI 與 Synopsys 簽署多年戰略合作,聯合研發名為 GPT‑Synopsys 的專用 AI 模型,用於晶片設計與驗證。該模型將 OpenAI 的技術與 Synopsys 的 EDA 工具結合,直接操作工具並在 OpenAI 基礎設施上執行。雙方表示將共同營銷並分攤收入,且客戶資料不用於訓練並將加密儲存。早期與半導體客戶的測試已在進行中。
Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。
推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。
Google DeepMind 推出了 SynthID Bio,這是一種專為合成生物學開發的水印技術,可在保持蛋白質生物功能的同時,將不可見的標記直接嵌入胺基酸序列和預測的 3D 結構中。該技術通過了溼實驗室對靶向蛋白質的測試,並對 AlphaFold 3 的擴散網路及 Evo 2 基因組模型進行了適配,旨在加強生物安全性並確保科學資料的完整性。
AWS 宣佈 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform 上可用,具備更高的編碼與知識工作效率及更低的單任務成本。該模型適合處理範圍明確的持續工作負載,支援與 Claude Opus 5.5 搭配使用以兼顧複雜判斷與快速執行,使用者可通過控制台或 API 進行呼叫。
推薦理由:原文公佈了該模型在特定平臺上的可用性與技術改進,讀者可以據此評估其在自動化任務中的成本與效能表現。
Ling 3.1 Flash 是 InclusionAI 推出的混合推理語言模型,現已在 AI Gateway 上免費使用至 2026 年 10 月 13 日。
推薦理由:Ling 3.1 Flash 提供 262K token 上下文視窗和 560B 引數的混合推理能力,專為編碼與多步分析設計,讀者可評估其在 AI Gateway 上的應用潛力與成本優勢。
GPT-6.1 Sol 現已在 Amazon Bedrock 上全面可用,為編碼、計算機使用和專業工作負載帶來更強的推理能力。該模型在 DeepSWE v1.1 上以約五分之一的單任務成本實現了接近 GPT-6 Astra 的表現,並在複雜文件分析和多步驟工作流上超越了 GPT-6 Sol。
推薦理由:原文公佈了模型在亞馬遜雲科技平臺上的可用性和基準表現,讀者可以據此評估其在自動化工作流中的價效比與落地可行性。
GPT 6.1 Sol 實現了接近 Astra 級別的智慧,而價格降至五分之一。這是 Simon Willison 在 2026 年 9 月 29 日釋出的月度簡報中披露的相關 LLM 進展。
OpenAI 釋出了 GPT-6.1 Sol 模型,其效能接近旗艦模型 Astra,但成本僅為其五分之一。API 定價為每百萬輸入 token 2 美元、輸出 10 美元,快取輸入為 0.10 美元。該模型在 agentic coding、電腦操作和辦公任務上接近 Astra,Plus、Pro 等使用者已可在 ChatGPT Work 和 Codex 中使用,API 名稱為 gpt-6.1-sol。
NVIDIA 釋出開源表格基礎模型 Kumo Tabular,採用 Transformer 架構,無需訓練、調參或特徵工程即可在單次前向傳播中完成分類與迴歸預測。該模型提供 28M 到 215M 三種引數規模,完全基於人工合成數據進行預訓練,並在 TabArena、BeyondArena、TALENT 和 ScoringBench 四個基準測試中排名第一。
推薦理由:該模型不經微調即可直接預測表格資料,讀者可以據此評估它在企業級結構化資料預測任務中的應用潛力。
OpenAI 釋出 GPT-6.1 Sol,具備接近 Astra 的編碼、電腦操作和專業工作智慧,且 API 輸入輸出 token 價格降至 Astra 標準價格的五分之一。
推薦理由:原文給出了新模型的定位、核心能力與價格降幅,讀者可以據此判斷它會怎樣改變日常開發與專業工作流。
Latent Space 釋出的 AINews 彙總了多款前沿模型動態,其中 Claude Opus 5.5 在 SimpleBench 領先,並在視覺和程式碼生成任務上表現突出;同時涵蓋 GPT-6 家族、Gemini 3.8 Flash、Xiaomi MiMo-V2.6-Pro 以及智慧體、檢索和推理效率等生態進展。
OpenAI 的 GPT-6.1 Sol 現已在 Vercel AI Gateway 上上線。該模型在編碼、電腦使用和專業工作方面相較 GPT-6 Sol 有顯著提升,能夠更好地閱讀複雜文件、執行多步工作流、除錯程式碼、處理業務任務,並從包含表格和圖表的 PDF 中提取答案。
推薦理由:GPT-6.1 Sol 在 AI Gateway 上提供更精準的編碼與文件處理能力,並以更低成本滿足多步工作流需求。
Anthropic 釋出了 Claude Sonnet 5.5,該模型執行速度提升 30% 以上且成本降低最多 30%,在各項基準測試中表現優於 Sonnet 5 並已應用於 claude.ai 免費層級。它在部分編碼任務中接近 Opus 5.5 的水平,同時 Anthropic 預告 Haiku 5.5 將在未來幾週內推出。
Hcompany 釋出全新智慧體模型系列 Holo4,包含 27B dense 與 35B-A3B Mixture of Experts 兩個尺寸,並同步推出更新版 Holotron4 Nano。該系列模型支援 GUI、程式碼、MCP 與 API 等多種互動介面,在 OSWorld 2.0 等基準測試中表現優異,相關權重與軌跡資料已在 Hugging Face 開源。
推薦理由:文章公佈了新模型的大小、介面和基準測試表現,讀者可以據此瞭解其在複雜工作流中的表現。
Claude Sonnet 5.5 已在 Vercel AI Gateway 上上線,支援 anthropic/claude-sonnet-5.5 模型標識。該版本在日常工作中提升文件、幻燈片、電子表格的質量,並在編碼任務中加入多步檢查。
GPT-6 Astra 完成 50 個標籤頁的稅務工作簿的速度達到了 GPT-5.6 Sol 的 2 倍。其對使用者意圖更強的理解能力,讓 Basis 在實際應用中擁有了更高的信心。
Ember-1 是 Fireworks 基於 Kimi K3 開發的研究預覽推理模型,現已在 AI Gateway 上提供。該模型在相同質量評估下比 Kimi K3 生成 token 少約 40%,支援 1M-token 上下文視窗、文本與影像輸入、工具呼叫以及隱式提示快取。
Pixel Canary 現已在 AI Gateway 以 stealth/pixel-canary 形式上線,限時免費。該模型擅長編碼,尤其是前端開發與移動應用設計。
Google 釋出了 Gemini 3.8 TTS 的兩個新模型 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,支援 2,000+ 語音並可通過 30 秒樣本建立自定義聲音。Gemini 3.8 TTS Playground 允許使用者在瀏覽器中構建單聲道或多說話人對話,生成 1m18s 音訊僅需約 20 秒,成本 2.74 美分。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言的自然語言提示詞聲音設計、30 秒聲音復刻以及逐行臺詞精細導演。
推薦理由:官方釋出的最新語音生成模型提供了細粒度的臺詞導演和聲音定製能力,讀者可以據此評估其在多語言配音與智慧體互動中的實際表現。
Anthropic 釋出了 Claude Opus 5.5,主打 Fable 5.1 級能力與更低執行成本,隨後 OpenAI 推出了降價幅度和價效比更高的 GPT-6 Sol 與 Luna 模型。兩家實驗室均在效率最佳化與定價上展開競爭,同時社群也圍繞基準評測和多Agent擴充套件展開了廣泛討論。
推薦理由:文章梳理了兩家頭部廠商最新旗艦及平價模型的效能與定價策略,讀者可據此對比當前前沿模型的綜合性價比。
Gemini 3.8 Flash‑Lite TTS 與 Gemini 3.8 Flash TTS 現已在 AI Gateway 上線,支援 100 多種語言的文本轉語音,支援長篇朗讀、交付控制和雙人對話。
推薦理由:Gemini 3.8 TTS模型已在AI Gateway上線,支援100多種語言、長篇朗讀和雙人對話,開發者可通過AI SDK輕鬆生成語音。
Anthropic 釋出了 Claude Opus 5.5,其輸入輸出價格較前代降低 20%,快取讀取價格降低 60%,並在高思考級別下遇到了超出最大輸出 token 限制的問題;隨後 OpenAI 釋出了 GPT-6 Sol 與 GPT-6 Luna,價格降至同級前代型號的一半。兩家廠商通過密集釋出新模型和大幅降價,進一步加劇了 AI 模型的市場價格戰。
推薦理由:文章記錄了多款旗艦模型密集釋出與降價的情況,讀者可以據此瞭解當前各大廠商在推理模型定價與效能上的最新競爭格局。
OpenAI 釋出了 GPT-6 Sol 與 Luna 兩個新模型,為日常工作提供了不同能力與成本平衡的選擇。
推薦理由:官方推出了兩個新模型,為日常工作提供了不同能力與成本的平衡選擇。
小米釋出 MiMo-V2.6 系列原生全模態開源模型,其中 Pro 版本擁有 1.02T 總引數和 42B 啟用引數,RL 訓練成本約 300 萬美元。該系列同時開源了訓練環境、程式碼及技術報告,旨在降低強化學習訓練門檻。
OpenAI 的 GPT‑6 Sol 與 GPT‑6 Luna 現已在 AI Gateway 上線,價格低於 GPT‑6 Astra。Sol 適用於複雜編碼與持續性探究的 agent 工作流,Luna 則是低成本的高頻重複工作選項。兩者相較 GPT‑5.6 在事實可靠性、直白溝通和減少誤導性編碼宣告方面都有提升。使用時只需傳入模型 ID,即可在模型演練區體驗。
推薦理由:GPT‑6 Sol 與 Luna 在 AI Gateway 上線,價格更低且在程式碼與專業工作中提升事實可靠性,讀者可評估其高頻工作流價值。
Anthropic 的 Claude Opus 5.5 已在 AI Gateway 上上線,支援 1M-token 上下文視窗和 128K 輸出 token。與 Opus 5 相比,速度提升約 30%,成本降低約 40%。
推薦理由:Opus 5.5 在速度和成本上相較前代提升顯著,適合需要大上下文和長任務的智慧體工作,其 1M-token 上下文視窗和 128K 輸出令長任務更易監督,且支援自動工具選擇,提升開發效率。對開發者而言,Opus 5.5 的速度與成本優勢可顯著降低專案迭代週期。
TypeSafe AI 近期推出了名為 Jev 的 System One 決策模型,它接收非結構化文本輸入並返回對應類別的浮點數置信度分數。Jev 僅對輸入收費且價格低至每百萬 token 0.042 美元,支援 Yes/No、多選和評分三類問題並在後臺並行評估。作者指出 Jev 的黑盒特性和偏差問題需要謹慎對待,但社群已圍繞其展開了豐富的創意應用和開源復現嘗試。
推薦理由:原文介紹了 TypeSafe AI 推出的決策模型 Jev 及其獨特的工作機制和定價模式,讀者可以藉此瞭解這類新型模型在分類與檢索重排場景中的應用與侷限。
TypeSafe AI 創始人兼 CEO Diogo Almeida 推出了旨在提升生產環境可靠性的 System One 模型 Jev。該模型採用名為 RLCD(Reinforcement Learning for Calibrated Decisions)的未公開新技術,優化了 System One 任務中的機率校準,以應對傳統 LLM 的幻覺與對齊問題。
Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。
推薦理由:Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。
summary_zh: GLM 5.3 FlashX 現已於 AI Gateway 上可用,提供約 200 tokens/second 的推理速度,適用於編碼代理、工具迴圈與互動式應用。
Latent Space 釋出了最新一期 AINews,重點報道了多項前沿 AI 進展:OpenAI 推出了模型失配披露機制,Databricks 針對約 3500 名工程師部署了 GPT-6 Astra,部分團隊開始在生產環境評估智慧體編碼的成本與收益。同時,開源與推理基礎設施持續演進,多款開源模型及量化工具在社群獲得廣泛討論。
推薦理由:原文梳理了近期前沿模型的工程落地表現與行業動態,有助於讀者直接評估智慧體在實際生產環境中的成本與效能表現。
Salesforce 推出了首個 CRM 推理模型 Koa,該模型基於 NVIDIA Nemotron 3 Super 構建並使用 NVIDIA NeMo 工具鏈進行訓練。
Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。
推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。
NVIDIA 在 AI Infra Summit 上釋出了 Vera Rubin 架構與 DSX 平臺,其中 Vera Rubin NVL72 系統在 MLPerf Inference v6.1 預覽測試中展現出顯著的吞吐量優勢。多項生態合作與基準測試顯示,新平臺通過電源最佳化和軟體協同,大幅提升了每瓦 tokens 產出與 agentic ワークロード的執行效率。
推薦理由:原文公佈了 Vera Rubin 架構在多個基準測試中的效能表現,讀者可以據此評估新一代 AI 基礎設施在能效和吞吐量上的提升幅度。
Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking 現已可於 AI Gateway 使用,支援即時語音互動與多模態功能。
推薦理由:Gemini 3.8 Live 及其擴充套件思考功能可即時語音互動,開發者可透過 AI Gateway 直接使用 WebSocket 進行即時對話,提升語音助手與多模態應用的互動體驗。