Google DeepMind 釋出 Gemini 3.5 模型的首款型號 3.5 Flash
Google DeepMind 正式推出 Gemini 3.5 模型系列的首款型號 3.5 Flash,主打前沿智慧與高速推理,重點提升智慧體和編碼任務表現。3.5 Flash 在 Terminal-Bench 2.1 等基準上表現優於 Gemini 3.1 Pro,速度達到其他前沿模型的 4 倍,目前已全面向全球使用者、開發者及企業推出。
Google DeepMind 正式推出 Gemini 3.5 模型系列的首款型號 3.5 Flash,主打前沿智慧與高速推理,重點提升智慧體和編碼任務表現。3.5 Flash 在 Terminal-Bench 2.1 等基準上表現優於 Gemini 3.1 Pro,速度達到其他前沿模型的 4 倍,目前已全面向全球使用者、開發者及企業推出。
Google DeepMind 釋出了基於 Gemini 構建的協作式多智慧體 AI 系統 Co-Scientist,旨在通過生成、辯論和演化科學假說來加速生命科學等領域的科研突破。該系統由生成、接近度、反射、排名、演化和元審查等多個專業智慧體組成,並引入了類似 AlphaGo 的積分制辯論機制來驗證和篩選最有潛力的研究方向。目前該系統正通過全新實驗工具逐步向研究人員開放。
推薦理由:Google DeepMind 釋出了基於 Gemini 構建的多智慧體科學研究系統 Co-Scientist,讀者可以瞭解其通過模擬科學辯論生成和演化假說的具體架構與應用效果。
Google DeepMind 總結了 Gemini 驅動的編碼智慧體 AlphaEvolve 在科學研究、AI 基礎設施最佳化及商業應用等領域的最新進展。該系統在基因組學測序錯誤校正、電網最佳化、量子物理模擬以及下一代 TPU 晶片設計等多個場景中顯著提升了效能和效率,並正通過 Google Cloud 向各行業企業開放應用。
推薦理由:原文梳理了該系統一年來的應用成果與商業拓展,讀者可以據此瞭解其在科學研究和工程基礎設施中的落地成效。
作者 Jack Clark 撰文分析認為,基於軟體工程、基準測試和智慧體自主執行時間的進展,AI 系統有較大可能在 2028 年底前實現端到端自動化的 AI 研發。文章指出,當前模型在程式碼生成、復現論文、Kaggle 競賽和核心最佳化等任務上的能力顯著提升,正在逐步承擔原本需要人類完成的大量工程與科學實驗工作。
Mistral AI 宣佈 Workflows 進入公開預覽階段,作為 Studio 的一部分為企業 AI 提供持久化執行、可觀測性和容錯能力。開發者使用 Python 編寫工作流,支援通過 Le Chat 觸發,底層基於 Temporal 構建並採用控制面與資料面分離的部署模型。
推薦理由:原文給出了架構設計和落地案例,讀者可以據此評估其在生產環境中的編排能力。
Google Research 推出了 ReasoningBank 智慧體記憶框架,通過從成功和失敗經驗中提取結構化推理模式來實現測試期自我進化。該方法通過記憶感知測試期擴充套件(MaTTS)機制,在網頁瀏覽和軟體工程基準測試中顯著提升了智慧體的成功率和執行效率。
推薦理由:文章介紹了從成功與失敗經驗中提取結構化推理模式的記憶框架,讀者可以據此瞭解如何通過記憶增強智慧體的測試期擴充套件能力。
Google DeepMind 宣佈與 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 達成合作,共同加速企業的 AI 驅動轉型並推動前沿技術的大規模應用。合作重點包括構建行業專屬的 AI 方案、讓合作伙伴獲得前沿模型(如 Gemini 系列)的早期訪問許可權以及對接 AI 領導層。
Google Research 釋出 ConvApparel 資料集,旨在衡量並彌合 LLM 驅動的使用者模擬器的真實性差距。該資料集包含 4,000+ 人機多輪對話,近 15,000 輪,覆蓋服裝購物場景。通過雙代理收集協議、人口統計對齊、人類相似度評分和反事實驗證三大支柱,評估 Prompted、ICL 與 SFT 模擬器的真實性。
Google Research 推出兩款 AI 代理——PaperVizAgent 與 ScholarPeer,分別用於生成高質量學術圖表和自動化同行評審。
推薦理由:兩款 AI 代理在圖表生成和同行評審上顯著優於現有基線,展示了多代理協作在科研流程中的潛力,為科研人員減輕行政負擔,提升工作效率。
Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。
推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。
Mistral AI 推出了專為人類開發者與智慧體共同設計的命令列工具 Spaces,通過將互動式輸入轉化為標誌、建立基於外掛的結構化資料介面以及自動生成專案上下文檔案,實現了工具的高效協同與自主執行。
推薦理由:文章介紹了 Mistral AI 開發 Spaces 命令列工具的經驗,闡述了通過將互動式輸入對映為標誌、設計基於外掛的資料結構以及生成專案上下文檔案,使開發者工具同時適配人類與智慧體,從而提升整體可複用性的設計原則。
Google Research 在 The Check Up 活動上公佈了醫療健康領域的最新研究進展,涵蓋個性化醫療、臨床協作、開發者生態、公共衛生及生物醫學發現。
推薦理由:Google Research 公佈了醫療健康領域的最新研究成果與進展,讀者可以據此瞭解其技術在臨床、公共衛生和生物醫藥方面的實際應用方向。
Mistral AI 推出 Forge,一套面向企業的 AI 模型構建系統,幫助組織在自有資料上訓練、微調並持續改進專屬模型。Forge 覆蓋預訓練、後訓練、強化學習等全生命週期,支援 dense 與 MoE 架構、多模態輸入,並以 Agent 為先設計,適用於政府、金融、軟體、製造等多行業場景。
推薦理由:Forge 讓企業能在自有資料上訓練專屬模型,提升內部流程自動化與合規性,並通過持續強化學習實現模型與業務目標的動態對齊。
Mistral AI 釋出了 Mistral Small 4,這是一款統一推理、多模態與編碼功能的模型,採用 119B 引數、256k 上下文視窗,支援可配置推理強度,提供 40% 的延遲降低和 3 倍的吞吐量提升。該模型採用 Apache 2.0 許可,支援 vLLM、llama.cpp、SGLang 等開源框架,並已加入 NVIDIA Nemotron 聯盟。
推薦理由:Mistral Small 4 將推理、多模態與編碼功能統一,提供可配置推理強度和高效推理,幫助使用者在單一模型中完成多種任務。
Leanstral 是 Mistral AI 推出的首款專為 Lean 4 設計的開原始碼代理,採用 6B 活躍引數,支援在 Mistral Vibe 中零設定使用,並提供免費 API 端點。
推薦理由:Leanstral 以 6B 引數實現高效 Lean 4 程式碼生成,成本低於主流模型,展示了開原始碼代理在正式驗證場景中的可行性。
Google Research 在 Beth Israel Deaconess Medical Center 進行了一項單中心前瞻性可行性研究,評估其對話式診斷 AI AMIE 在門診前訪談中的安全性與實用性。研究共招募 100 名成人患者,零安全停機事件,AMIE 的診斷準確率在前 7 名中達 90%,並獲得患者與醫生的高度接受度。
推薦理由:該研究首次在真實臨床環境中驗證了對話式診斷 AI 的可行性與安全性,為未來大規模臨床試驗奠定基礎,並顯示患者與醫生接受度高,提示其在臨床決策支援中的價值。
Mistral AI 推出了基於開源編碼助手 Vibe 構建的自主測試智慧體,能夠自動為 Ruby on Rails 程式碼庫生成、驗證和改進 RSpec 測試。該智慧體通過倉庫級上下文、分類技能檔案以及 RuboCop 和 SimpleCov 自定義工具,在包含 275 個檔案的真實程式碼庫測試中實現了 100% 的程式碼覆蓋率和通過率。
推薦理由:原文介紹了團隊如何基於開源編碼助手構建自主測試生成智慧體,讀者可以瞭解如何通過上下文工程、專用技能和自定義工具來擴充套件智慧體能力。
Mistral AI 釋出終端原生編碼智慧體 Mistral Vibe 2.0,搭載 Devstral 2 模型系列並帶來自定義子智慧體、多項選擇澄清、斜槓命令技能與統一智慧體模式。該版本現已上線 Le Chat Pro 與 Team 計劃,支援按量付費和自帶 API 金鑰,Devstral 2 也同步轉入 Mistral Studio 的付費 API 訪問。
推薦理由:官方釋出了基於新模型的程式碼智慧體重大升級,使用者可以根據具體需求自定義子智慧體和工作流。
Mistral AI 推出面向企業的生產級 AI 平臺 Mistral AI Studio,旨在解決企業 AI 從原型落地到生產環境的可靠性、可觀測性和治理難題。該平臺構建了三大核心支柱:提供流量監控與評估的 Observability、基於 Temporal 構建且具備狀態容錯的 Agent Runtime,以及用於全生命週期資產版本控制與審計的 AI Registry。
推薦理由:原文介紹了 Mistral AI Studio 的三大支柱與功能,讀者可以據此瞭解其如何解決企業 AI 從原型走向生產的落地瓶頸。
Le Chat 釋出了 20+ 以上安全 MCP 聯結器和記憶功能,支援在聊天中直接搜尋、總結並操作 Databricks、Snowflake、GitHub 等企業工具,並可跨會話保持個性化上下文。聯結器目錄覆蓋資料、生產力、開發、自動化、商務等領域,使用者可自定義擴充套件並在本地或雲端部署。記憶功能在免費計劃中可用,支援快速匯入 ChatGPT 記憶並提供完整的增刪改控制。
推薦理由:Le Chat 新增 20+ MCP 聯結器和記憶功能,幫助企業在聊天中直接操作關鍵工具並保持上下文記憶。
Mistral AI 釋出了開源語音理解模型 Voxtral,包含面向生產的 24B 規格與面向端側的 3B 規格,均採用 Apache 2.0 協議開源。該系列模型支援 32k 上下文、長達 30 至 40 分鐘的音訊處理、內建問答與摘要、多語言處理及函式呼叫功能,並在多項語音轉寫和理解基準測試中表現優異。
推薦理由:該模型提供了兩種尺寸並開源,讀者可以根據自身算力條件選擇合適的版本進行本地部署或呼叫 API。
Mistral AI 與 All Hands AI 合作推出了 Devstral Medium 並升級了 Devstral Small 1.1。Devstral Small 1.1 採用 Apache 2.0 協議開源,在 SWE-Bench Verified 上獲得 53.6% 的分數;Devstral Medium 在 API 上線,得分達 61.6%,支援私有化部署與自定義微調。
推薦理由:該釋出提供了兩款程式碼智慧體新模型的詳細效能和價格資訊,讀者可以藉此評估它們在特定開發任務中的價效比。
Mistral AI 釋出了企業級 AI 編碼助手 Mistral Code,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四款模型,提供 IDE 外掛、本地化部署及企業級管理工具。
推薦理由:官方推出的企業級編碼助手整合了多款主力模型與本地部署選項,讀者可以據此瞭解其在安全合規與多步驟推理方面的架構設計。
Mistral AI 釋出全新的 Agents API,提供程式碼執行、網頁搜尋、影像生成、文件庫與 MCP 工具等內建聯結器,支援持久化記憶、多智慧體協作編排及狀態化對話管理。
推薦理由:官方推出的 Agents API 整合了內建聯結器與 MCP 工具,為開發者構建企業級智慧體提供了完整的端到端框架。
Devstral 是 Mistral AI 與 All Hands AI 合作推出的面向軟體工程的智慧體 LLM,已在 SWE-Bench Verified 上取得 46.8% 的得分。
推薦理由:Devstral 在 SWE-Bench Verified 上顯著領先開源模型,並可在單張 RTX 4090 上本地部署,適合企業私有程式碼庫。
Mistral AI 推出基於 Mistral Large 2 的 TranscriptToPRDTicket 智慧體工作流,能夠將會議記錄自動轉化為產品需求文件(PRD)並在 Linear 或 Jira 等專案管理工具中生成開發任務。
推薦理由:官方通過公開的端到端實現方案展示瞭如何利用大模型將會議紀要轉化為產品需求文件和開發任務,為團隊最佳化產品開發流程提供了可複用的工程參考。