推薦理由:Gemini 4 Argon 代表 DeepMind 在前沿 AI 領域的又一突破,先行向政府與網路防禦者開放,提示其在安全與責任部署方面的先行實踐。
#Agent
RSS 訂閱#Agent
RSSDemis Hassabis (@demishassabis)@demishassabis精選AI 評分6666 Ars Technica · AIAI 評分6060 Google公佈 Gemini 4 Argon AI 模型,但尚未開放使用
Google公佈 Gemini 4 Argon AI 模型,聲稱在編碼、知識工作和網路安全方面具備行業領先效能,但目前尚未開放使用。內部工程師已在公司內部廣泛使用,Argon 通過“fleet‑wide telemetry data”幫助 Google 節省 300 TiB 記憶體,並在 C/C++ 程式碼遷移到 Rust 方面取得進展。
TechCrunch · AI精選AI 評分8383 OpenAI 推出 GPT-6.1 Sol,幾乎匹配 GPT-6 Astra,成本更低
OpenAI 在 DevDay 事件中釋出 GPT-6.1 Sol,聲稱其在代理式編碼、計算機使用和專業工作中的智慧水平幾乎與 GPT-6 Astra 相當,但標準輸入輸出 token 價格僅為其五分之一。
推薦理由:GPT-6.1 Sol 以五分之一的成本接近 GPT-6 Astra 的效能,為開發者提供更經濟的高效代理模型。
Vercel Blog精選AI 評分6565 Ling 3.1 Flash 現已在 AI Gateway 上可用
Ling 3.1 Flash 是 InclusionAI 推出的混合推理語言模型,現已在 AI Gateway 上免費使用至 2026 年 10 月 13 日。
推薦理由:Ling 3.1 Flash 提供 262K token 上下文視窗和 560B 引數的混合推理能力,專為編碼與多步分析設計,讀者可評估其在 AI Gateway 上的應用潛力與成本優勢。
AWS Machine Learning Blog精選AI 評分6666 GPT-6.1 Sol 現已登陸 Amazon Bedrock
GPT-6.1 Sol 現已在 Amazon Bedrock 上全面可用,為編碼、計算機使用和專業工作負載帶來更強的推理能力。該模型在 DeepSWE v1.1 上以約五分之一的單任務成本實現了接近 GPT-6 Astra 的表現,並在複雜文件分析和多步驟工作流上超越了 GPT-6 Sol。
推薦理由:原文公佈了模型在亞馬遜雲科技平臺上的可用性和基準表現,讀者可以據此評估其在自動化工作流中的價效比與落地可行性。
Vercel Blog精選AI 評分7171 GPT-6.1 Sol 在 AI Gateway 上可用
OpenAI 的 GPT-6.1 Sol 現已在 Vercel AI Gateway 上上線。該模型在編碼、電腦使用和專業工作方面相較 GPT-6 Sol 有顯著提升,能夠更好地閱讀複雜文件、執行多步工作流、除錯程式碼、處理業務任務,並從包含表格和圖表的 PDF 中提取答案。
推薦理由:GPT-6.1 Sol 在 AI Gateway 上提供更精準的編碼與文件處理能力,並以更低成本滿足多步工作流需求。
Hugging Face Blog精選AI 評分8383 Hcompany 釋出 Holo4 系列智慧體模型與 Holotron4 Nano
Hcompany 釋出全新智慧體模型系列 Holo4,包含 27B dense 與 35B-A3B Mixture of Experts 兩個尺寸,並同步推出更新版 Holotron4 Nano。該系列模型支援 GUI、程式碼、MCP 與 API 等多種互動介面,在 OSWorld 2.0 等基準測試中表現優異,相關權重與軌跡資料已在 Hugging Face 開源。
推薦理由:文章公佈了新模型的大小、介面和基準測試表現,讀者可以據此瞭解其在複雜工作流中的表現。
Vercel BlogAI 評分6161 Claude Sonnet 5.5 在 AI Gateway 上可用
Claude Sonnet 5.5 已在 Vercel AI Gateway 上上線,支援 anthropic/claude-sonnet-5.5 模型標識。該版本在日常工作中提升文件、幻燈片、電子表格的質量,並在編碼任務中加入多步檢查。
Vercel Blog精選AI 評分6767 GPT‑6 Sol 與 Luna 在 AI Gateway 上線
OpenAI 的 GPT‑6 Sol 與 GPT‑6 Luna 現已在 AI Gateway 上線,價格低於 GPT‑6 Astra。Sol 適用於複雜編碼與持續性探究的 agent 工作流,Luna 則是低成本的高頻重複工作選項。兩者相較 GPT‑5.6 在事實可靠性、直白溝通和減少誤導性編碼宣告方面都有提升。使用時只需傳入模型 ID,即可在模型演練區體驗。
推薦理由:GPT‑6 Sol 與 Luna 在 AI Gateway 上線,價格更低且在程式碼與專業工作中提升事實可靠性,讀者可評估其高頻工作流價值。
Vercel Blog精選AI 評分7878 Claude Opus 5.5 在 AI Gateway 上可用
Anthropic 的 Claude Opus 5.5 已在 AI Gateway 上上線,支援 1M-token 上下文視窗和 128K 輸出 token。與 Opus 5 相比,速度提升約 30%,成本降低約 40%。
推薦理由:Opus 5.5 在速度和成本上相較前代提升顯著,適合需要大上下文和長任務的智慧體工作,其 1M-token 上下文視窗和 128K 輸出令長任務更易監督,且支援自動工具選擇,提升開發效率。對開發者而言,Opus 5.5 的速度與成本優勢可顯著降低專案迭代週期。
Vercel Blog精選AI 評分7272 Jev 是 AI Gateway 歷史上最快被採用的模型
Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。
推薦理由:Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。
NVIDIA BlogAI 評分3131 NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中展現領先效能
NVIDIA 釋出的 Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中表現領先,在 Qwen3-VL 上實現了較 GB300 NVL72 最高 3.7 倍的吞吐量提升。
OpenAI News精選AI 評分8686 OpenAI 釋出 GPT-6 Astra 模型
OpenAI 推出 GPT-6 Astra,作為其迄今為止最具智慧與對齊能力的模型,現已在 ChatGPT Work、Codex 及 API 中可用。該模型在計算機使用、瀏覽、軟體工程及網路安全等專業任務上表現領先,API 定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。
推薦理由:原文公佈了新模型的各項能力基準、定價及企業級安全控制,讀者可以據此評估其在複雜工作流中的成本效益。
Google DeepMind精選AI 評分8686 Google DeepMind 釋出 Gemini 3.8 Flash 與 3.8 Flash Cyber 模型
Google DeepMind 釋出 Gemini 3.8 Flash 與 3.8 Flash Cyber 兩款新模型,帶來更強的長程推理、編碼和智慧體任務能力。
推薦理由:原文公佈了新模型的架構變動、基準成績與具體定價,讀者可以據此評估它在成本與長程智慧上的價效比。
Google DeepMind精選AI 評分7474 Gemini 3.7 Flash 推出
Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。
推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。
Google DeepMind精選AI 評分8686 Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人
DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。
推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。
Google DeepMind精選AI 評分8484 Google DeepMind 釋出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延遲支撐大規模 AI 智慧體工作流。
推薦理由:官方釋出了三個新的 Gemini Flash 系列模型,給出了詳細的效能指標與價格,讀者可以據此評估其在智慧體工作流和高吞吐任務中的成本與效率。
Google DeepMind精選AI 評分6363 Google DeepMind 釋出 Gemini 3.5 Flash Cyber 網路安全模型
Google DeepMind 推出了基於 3.5 Flash 構建並針對網路安全任務微調的輕量化模型 Gemini 3.5 Flash Cyber,旨在幫助防禦者快速發現、驗證和修補軟體漏洞。
推薦理由:Google DeepMind 推出了專為網路安全微調的輕量化模型,通過支援高頻率和多輪呼叫,在多個安全基準上展現了優於 mainline 模型和部分競品的漏洞挖掘能力。
Hugging Face Blog精選AI 評分8181 Thinking Machines 釋出 Inkling 與 Inkling‑Small 模型
Thinking Machines 在 Hugging Face 釋出了 Inkling 與 Inkling‑Small 兩個多模態 LLM。Inkling 是 1T 引數、1M 上下文視窗的開源模型,支援影像、文本、音訊輸入,並具備 agentic 能力。
推薦理由:Inkling 通過支援 1M 上下文視窗和多模態輸入,提供了大規模開源模型的高效推理與部署方案,幫助開發者快速構建跨模態推理應用。在 Hugging Face 平臺上可一鍵部署,支援多種推理引擎,滿足大規模推理需求,並提供 1M 上下文視窗的高效推理體驗,適合多模態推理與微調場景。
Mistral AI精選AI 評分8787 Mistral AI 釋出 Mistral Medium 3.5 與 Vibe 雲端非同步智慧體
Mistral AI 推出 128B 開源旗艦模型 Mistral Medium 3.5,具備 256k 上下文視窗、可配置推理強度以及從頭訓練的視覺編碼器,並在 SWE-Bench Verified 上取得 77.6% 的成績。
推薦理由:Mistral Medium 3.5 的釋出和雲端非同步智慧體能力的上線,展示瞭如何通過長上下文與多工具呼叫降低開發者的任務阻塞成本。
Google DeepMind精選AI 評分8484 Google DeepMind 釋出 Gemini 3.5 模型的首款型號 3.5 Flash
Google DeepMind 正式推出 Gemini 3.5 模型系列的首款型號 3.5 Flash,主打前沿智慧與高速推理,重點提升智慧體和編碼任務表現。3.5 Flash 在 Terminal-Bench 2.1 等基準上表現優於 Gemini 3.1 Pro,速度達到其他前沿模型的 4 倍,目前已全面向全球使用者、開發者及企業推出。
Google DeepMind精選AI 評分6969 Gemma 4 釋出:最強開源模型
Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。
推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。
Mistral AI精選AI 評分8484 釋出 Mistral Small 4
Mistral AI 釋出了 Mistral Small 4,這是一款統一推理、多模態與編碼功能的模型,採用 119B 引數、256k 上下文視窗,支援可配置推理強度,提供 40% 的延遲降低和 3 倍的吞吐量提升。該模型採用 Apache 2.0 許可,支援 vLLM、llama.cpp、SGLang 等開源框架,並已加入 NVIDIA Nemotron 聯盟。
推薦理由:Mistral Small 4 將推理、多模態與編碼功能統一,提供可配置推理強度和高效推理,幫助使用者在單一模型中完成多種任務。
Mistral AI精選AI 評分6868 Leanstral 釋出開源可信 Vibe 編碼基礎
Leanstral 是 Mistral AI 推出的首款專為 Lean 4 設計的開原始碼代理,採用 6B 活躍引數,支援在 Mistral Vibe 中零設定使用,並提供免費 API 端點。
推薦理由:Leanstral 以 6B 引數實現高效 Lean 4 程式碼生成,成本低於主流模型,展示了開原始碼代理在正式驗證場景中的可行性。
Mistral AI精選AI 評分8686 Mistral AI 釋出開源語音理解模型 Voxtral
Mistral AI 釋出了開源語音理解模型 Voxtral,包含面向生產的 24B 規格與面向端側的 3B 規格,均採用 Apache 2.0 協議開源。該系列模型支援 32k 上下文、長達 30 至 40 分鐘的音訊處理、內建問答與摘要、多語言處理及函式呼叫功能,並在多項語音轉寫和理解基準測試中表現優異。
推薦理由:該模型提供了兩種尺寸並開源,讀者可以根據自身算力條件選擇合適的版本進行本地部署或呼叫 API。
Mistral AI精選AI 評分6262 Mistral AI 釋出 Devstral Medium 並升級 Devstral Small
Mistral AI 與 All Hands AI 合作推出了 Devstral Medium 並升級了 Devstral Small 1.1。Devstral Small 1.1 採用 Apache 2.0 協議開源,在 SWE-Bench Verified 上獲得 53.6% 的分數;Devstral Medium 在 API 上線,得分達 61.6%,支援私有化部署與自定義微調。
推薦理由:該釋出提供了兩款程式碼智慧體新模型的詳細效能和價格資訊,讀者可以藉此評估它們在特定開發任務中的價效比。
Mistral AI精選AI 評分8383 Mistral AI 釋出 Devstral
Devstral 是 Mistral AI 與 All Hands AI 合作推出的面向軟體工程的智慧體 LLM,已在 SWE-Bench Verified 上取得 46.8% 的得分。
推薦理由:Devstral 在 SWE-Bench Verified 上顯著領先開源模型,並可在單張 RTX 4090 上本地部署,適合企業私有程式碼庫。