跳到正文

#Agent

RSS
今日 5 則
7月28日週二
  1. Google DeepMind86

    Gemini Robotics 2 為機器人帶來全身智慧

    DeepMind 在部落格中釋出 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身視覺‑語言‑動作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。

    推薦理由:Gemini Robotics 2 通過全身控制、精細操作和多機器人協作,展示了在複雜任務中的智慧執行能力,並能在數小時內適配新機器人身體。

7月22日週三
7月21日週二
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延遲支撐大規模 AI 智慧體工作流。

    推薦理由:官方釋出了三個新的 Gemini Flash 系列模型,給出了詳細的效能指標與價格,讀者可以據此評估其在智慧體工作流和高吞吐任務中的成本與效率。

7月17日週五
  1. Google DeepMind63

    Google DeepMind 釋出 Gemini 3.5 Flash Cyber 網路安全模型

    Google DeepMind 推出了基於 3.5 Flash 構建並針對網路安全任務微調的輕量化模型 Gemini 3.5 Flash Cyber,旨在幫助防禦者快速發現、驗證和修補軟體漏洞。

    推薦理由:Google DeepMind 推出了專為網路安全微調的輕量化模型,通過支援高頻率和多輪呼叫,在多個安全基準上展現了優於 mainline 模型和部分競品的漏洞挖掘能力。

7月16日週四
  1. Hugging Face Blog84

    Hugging Face 披露 2026 年 7 月安全事件

    Hugging Face 官方披露了一起在 2026 年 7 月發生的由自治智慧體驅動的生產基礎設施入侵事件。攻擊者利用資料集處理流程中的程式碼執行路徑獲取初始訪問許可權,隨後在多個內部叢集中進行橫向移動。Hugging Face 通過自主 AI 系統檢測並剖析了該事件,修復了根本漏洞,撤銷並輪換了受影響的憑據。

7月15日週三
  1. Hugging Face Blog81

    Thinking Machines 釋出 Inkling 與 Inkling‑Small 模型

    Thinking Machines 在 Hugging Face 釋出了 Inkling 與 Inkling‑Small 兩個多模態 LLM。Inkling 是 1T 引數、1M 上下文視窗的開源模型,支援影像、文本、音訊輸入,並具備 agentic 能力。

    推薦理由:Inkling 通過支援 1M 上下文視窗和多模態輸入,提供了大規模開源模型的高效推理與部署方案,幫助開發者快速構建跨模態推理應用。在 Hugging Face 平臺上可一鍵部署,支援多種推理引擎,滿足大規模推理需求,並提供 1M 上下文視窗的高效推理體驗,適合多模態推理與微調場景。

7月7日週二
  1. Berkeley AI Research62

    Intelligence is Free, Now What? Data Systems for, of, and by Agents

    伯克利人工智慧研究院(BAIR)團隊探討了推理成本大幅下降後資料系統面臨的新機遇與新挑戰,指出未來資料系統需要圍繞 Agent 的互動、底層協同及自主合成三個維度進行徹底重構。文章重點分析了 Agent 推理帶來的高併發複雜查詢需求、多 Agent 協作所需的狀態管理機制以及利用 Agent 從零自主合成專用資料系統的方法。

    推薦理由:文章探討了零成本推理時代對資料系統的影響,提出了面向、由和基於 Agent 的三大數據系統設計方向,為理解未來智慧基礎設施演進提供了前瞻視角。

  2. Hugging Face Blog85

    Hugging Face 釋出 LeRobot v0.6.0:引入世界模型與統一評測

    LeRobot v0.6.0 引入了世界模型策略、全新的視覺語言動作模型和統一的獎勵模型 API,同時帶來了六大模擬評測基準、全新的部署命令列工具以及深度感知和資料自動標註能力。此次更新還優化了資料集載入速度,實現了完全分片資料並行訓練和雲端訓練支援,並大幅精簡了基礎安裝包的依賴。

    推薦理由:該版本閉環了機器人學習流程,使用者可以據此瞭解開源機器人框架在世界模型和評測方面的新能力。

6月25日週四
  1. Google DeepMind64

    Google DeepMind 推出 Gemini 3.5 Flash 內建 computer use 功能

    Google DeepMind 宣佈在 Gemini 3.5 Flash 中內建 computer use 功能,使其能夠跨瀏覽器、移動端和桌面環境執行智慧體任務。該功能支援長週期和企業自動化場景,並通過對抗性訓練與可選的企業安全保護系統來降低提示詞注入等風險。開發者現可通過 Gemini API 和 Gemini Enterprise Agent Platform 開始構建相關應用。

    推薦理由:官方將 computer use 能力直接整合至主模型,開發者可據此構建能跨平臺操作的自定義智慧體。

6月24日週三
6月23日週二
  1. Mistral AI81

    Mistral AI 釋出 Mistral OCR 4 文件解析模型

    Mistral AI 釋出 Mistral OCR 4 模型,提供文件解析功能,除提取文本外還返回邊界框、塊分類和行內建信度分數。該模型支援 170 種語言,可在單容器中執行以用於自託管部署,並通過 API 或 Document AI 提供支援。

    推薦理由:該模型支援多語言及單容器私有化部署,為企業級檢索和智慧體工作流提供了帶邊界框和置信度的結構化文件解析能力。

6月16日週二
6月10日週三
6月5日週五
  1. Google Research64

    Gemini Enterprise Agent Platform 釋出 Agentic RAG 提升可靠響應

    Google Research 推出了 Gemini Enterprise Agent Platform 的 Agentic RAG,利用多代理協同、規劃與足夠上下文機制,提升多源多跳查詢的準確率至 34%,在跨語料庫實驗中保持 90.1% 的高準確率,且延遲與單語料庫版本相近。該功能已作為公開預覽提供。

    推薦理由:該系統在多源多跳查詢中將準確率提升至 34%,為企業工作流提供更可靠的答案,並在跨語料庫場景下保持 90.1% 的高準確率。

5月29日週五
  1. Google Research69

    Google Research 在 I/O 2026 上開啟新發現時代

    Google Research 在 I/O 2026 上公佈了多款 AI 工具與模型,涵蓋科研加速、健康應用、邊緣計算與氣候預測等領域。

    推薦理由:Google Research 在 I/O 2026 上公佈多款 AI 工具與模型,展示了從科研到產品的快速落地與實際影響,凸顯代理式編碼與多模態推理在科學與日常應用中的變革潛力,併為全球科研社群提供了可擴充套件的實驗平臺。

5月28日週四
  1. Mistral AI68

    Mistral AI 在 AI Now Summit 2026 釋出工業工程 AI 堆疊與 Vibe 代理

    Mistral AI 在 AI Now Summit 2026 釋出面向工業工程的全棧 AI 解決方案,並與空中客車、BMW集團和 ASML 合作,支援從設計到生產的安全高效工作流。新推出的 Vibe 代理可處理長週期任務,如編碼與研究;法國 Les Ulis 10 MW 資料中心將於 2026 年第三季度投入使用,提升推理與安全控制。

    推薦理由:Mistral 推出面向工業工程的 AI 堆疊和 Vibe 代理,展示如何在航空、汽車和半導體領域實現安全、高效的設計與生產。

  2. Mistral AI74

    Vibe 開始工作

    Vibe 是 Mistral 推出的統一 AI 代理,兼顧工作與編碼。它提供 Work Mode 處理多步企業任務(如收件箱、日曆、研究、文件起草)以及 Code Mode 進行遠端編碼(從功能開發到拉取請求),並可通過 VS Code、CLI 和 Web 進行無縫協作。

    推薦理由:Vibe 將工作與編碼整合為單一智慧體,支援多步任務、視覺化推理與可擴充套件部署,適合企業與個人使用

5月23日週六
  1. Mistral AI57

    Mistral AI 宣佈收購 Physics AI 企業 Emmi AI

    Mistral AI 宣佈達成最終協議收購 Physics AI 企業 Emmi AI,以增強其在工業製造與工程領域的 AI 轉型能力。Emmi AI 的團隊與模型將加入 Mistral 的科學與應用 AI 團隊,雙方將共同構建面向工程師的智慧體,推進即時模擬和數字孿生技術的應用。

5月22日週五
  1. Mistral AI87

    Mistral AI 釋出 Mistral Medium 3.5 與 Vibe 雲端非同步智慧體

    Mistral AI 推出 128B 開源旗艦模型 Mistral Medium 3.5,具備 256k 上下文視窗、可配置推理強度以及從頭訓練的視覺編碼器,並在 SWE-Bench Verified 上取得 77.6% 的成績。

    推薦理由:Mistral Medium 3.5 的釋出和雲端非同步智慧體能力的上線,展示瞭如何通過長上下文與多工具呼叫降低開發者的任務阻塞成本。

  2. Mistral AI83

    Mistral AI 釋出 Studio 平臺 Connectors 功能

    Mistral AI 在 Studio 中推出 Connectors 功能,支援開發者使用內建與自定義 MCP 構建企業級 AI 應用。該功能提供 API/SDK 接入、直接工具呼叫、人機協同審批流及統一的集中註冊管理,適用於各類對話、智慧體及複雜工作流。

    推薦理由:該功能將企業級資料整合統一封裝為可重用的 MCP 實體,減少了重複開發和鑑權成本,為構建複雜智慧體工作流提供了標準化方案。

5月18日週一
  1. Google DeepMind86

    Google DeepMind 釋出 Antigravity 2.0 獨立桌面應用

    Google DeepMind 推出了全新獨立桌面應用 Google Antigravity 2.0,專為智慧體最佳化的體驗而設計,擺脫了傳統整合開發環境的束縛。該應用由 Gemini 模型驅動,引入了動態子代理、非同步任務管理、JSON 鉤子、定時任務以及基於專案的許可權管理等核心功能。

    推薦理由:該版本脫離了傳統開發環境並引入了獨立桌面應用形態,讀者可以據此瞭解智慧體工具如何向通用知識工作擴充套件。

5月17日週日
5月16日週六
  1. Google DeepMind54

    Co-Scientist 在衰老研究中開闢新路徑

    Calico Life Sciences 利用 DeepMind 的 Co-Scientist 工具,生成並驗證了關於 ISR 通過代謝調控的新假設,實驗結果揭示了 ISR 在衰老與疾病中的重要作用。該工具幫助研究人員篩選高質量假設並最佳化實驗設計,推動了衰老生物學研究的進展。

  2. Google DeepMind59

    加速肝病機制發現

    DeepMind 的 Co-Scientist 工具幫助愛丁堡大學生物工程師 Filippo Menolascina 迅速梳理肝臟生物學與藥理學文獻,生成可驗證的機制假設,並篩選潛在組合療法。該工具在研究 MASH(代謝功能相關脂肪性肝炎)時,提出 NLRP3 炎症小體是炎症與代謝耦合的關鍵橋梁,實驗驗證後為靶向雙重療法提供了新思路。

5月12日週二
  1. Google DeepMind86

    Google DeepMind 釋出多智慧體科學研究系統 Co-Scientist

    Google DeepMind 釋出了基於 Gemini 構建的協作式多智慧體 AI 系統 Co-Scientist,旨在通過生成、辯論和演化科學假說來加速生命科學等領域的科研突破。該系統由生成、接近度、反射、排名、演化和元審查等多個專業智慧體組成,並引入了類似 AlphaGo 的積分制辯論機制來驗證和篩選最有潛力的研究方向。目前該系統正通過全新實驗工具逐步向研究人員開放。

    推薦理由:Google DeepMind 釋出了基於 Gemini 構建的多智慧體科學研究系統 Co-Scientist,讀者可以瞭解其通過模擬科學辯論生成和演化假說的具體架構與應用效果。

5月6日週三
  1. Google DeepMind63

    Google DeepMind 公佈 Gemini 驅動的智慧體 AlphaEvolve 跨領域應用成果

    Google DeepMind 總結了 Gemini 驅動的編碼智慧體 AlphaEvolve 在科學研究、AI 基礎設施最佳化及商業應用等領域的最新進展。該系統在基因組學測序錯誤校正、電網最佳化、量子物理模擬以及下一代 TPU 晶片設計等多個場景中顯著提升了效能和效率,並正通過 Google Cloud 向各行業企業開放應用。

    推薦理由:原文梳理了該系統一年來的應用成果與商業拓展,讀者可以據此瞭解其在科學研究和工程基礎設施中的落地成效。

4月27日週一
  1. Mistral AI77

    Mistral AI 釋出企業級 AI 編排層 Workflows

    Mistral AI 宣佈 Workflows 進入公開預覽階段,作為 Studio 的一部分為企業 AI 提供持久化執行、可觀測性和容錯能力。開發者使用 Python 編寫工作流,支援通過 Le Chat 觸發,底層基於 Temporal 構建並採用控制面與資料面分離的部署模型。

    推薦理由:原文給出了架構設計和落地案例,讀者可以據此評估其在生產環境中的編排能力。

4月22日週三
  1. Google Research64

    ReasoningBank:使智慧體能夠從經驗中學習

    Google Research 推出了 ReasoningBank 智慧體記憶框架,通過從成功和失敗經驗中提取結構化推理模式來實現測試期自我進化。該方法通過記憶感知測試期擴充套件(MaTTS)機制,在網頁瀏覽和軟體工程基準測試中顯著提升了智慧體的成功率和執行效率。

    推薦理由:文章介紹了從成功與失敗經驗中提取結構化推理模式的記憶框架,讀者可以據此瞭解如何通過記憶增強智慧體的測試期擴充套件能力。

4月21日週二
  1. Google DeepMind28

    Google DeepMind 宣佈與行業領袖合作加速 AI 轉型

    Google DeepMind 宣佈與 Accenture、Bain & Company、BCG、Deloitte 和 McKinsey 達成合作,共同加速企業的 AI 驅動轉型並推動前沿技術的大規模應用。合作重點包括構建行業專屬的 AI 方案、讓合作伙伴獲得前沿模型(如 Gemini 系列)的早期訪問許可權以及對接 AI 領導層。

4月9日週四
  1. Google Research46

    ConvApparel:衡量並彌合用戶模擬器的真實性差距

    Google Research 釋出 ConvApparel 資料集,旨在衡量並彌合 LLM 驅動的使用者模擬器的真實性差距。該資料集包含 4,000+ 人機多輪對話,近 15,000 輪,覆蓋服裝購物場景。通過雙代理收集協議、人口統計對齊、人類相似度評分和反事實驗證三大支柱,評估 Prompted、ICL 與 SFT 模擬器的真實性。

4月3日週五
  1. Google DeepMind69

    Gemma 4 釋出:最強開源模型

    Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。

    推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。

3月31日週二
  1. Mistral AI65

    Mistral AI 釋出 Spaces:為人類與智慧體構建的命令列工具

    Mistral AI 推出了專為人類開發者與智慧體共同設計的命令列工具 Spaces,通過將互動式輸入轉化為標誌、建立基於外掛的結構化資料介面以及自動生成專案上下文檔案,實現了工具的高效協同與自主執行。

    推薦理由:文章介紹了 Mistral AI 開發 Spaces 命令列工具的經驗,闡述了通過將互動式輸入對映為標誌、設計基於外掛的資料結構以及生成專案上下文檔案,使開發者工具同時適配人類與智慧體,從而提升整體可複用性的設計原則。

3月18日週三
  1. Google Research61

    Google Research 在 The Check Up 活動上公佈醫療健康 AI 最新突破

    Google Research 在 The Check Up 活動上公佈了醫療健康領域的最新研究進展,涵蓋個性化醫療、臨床協作、開發者生態、公共衛生及生物醫學發現。

    推薦理由:Google Research 公佈了醫療健康領域的最新研究成果與進展,讀者可以據此瞭解其技術在臨床、公共衛生和生物醫藥方面的實際應用方向。

  2. Mistral AI69

    Mistral AI 推出 Forge 企業級 AI 模型構建系統

    Mistral AI 推出 Forge,一套面向企業的 AI 模型構建系統,幫助組織在自有資料上訓練、微調並持續改進專屬模型。Forge 覆蓋預訓練、後訓練、強化學習等全生命週期,支援 dense 與 MoE 架構、多模態輸入,並以 Agent 為先設計,適用於政府、金融、軟體、製造等多行業場景。

    推薦理由:Forge 讓企業能在自有資料上訓練專屬模型,提升內部流程自動化與合規性,並通過持續強化學習實現模型與業務目標的動態對齊。

3月17日週二
  1. Mistral AI84

    釋出 Mistral Small 4

    Mistral AI 釋出了 Mistral Small 4,這是一款統一推理、多模態與編碼功能的模型,採用 119B 引數、256k 上下文視窗,支援可配置推理強度,提供 40% 的延遲降低和 3 倍的吞吐量提升。該模型採用 Apache 2.0 許可,支援 vLLM、llama.cpp、SGLang 等開源框架,並已加入 NVIDIA Nemotron 聯盟。

    推薦理由:Mistral Small 4 將推理、多模態與編碼功能統一,提供可配置推理強度和高效推理,幫助使用者在單一模型中完成多種任務。

  2. Mistral AI68

    Leanstral 釋出開源可信 Vibe 編碼基礎

    Leanstral 是 Mistral AI 推出的首款專為 Lean 4 設計的開原始碼代理,採用 6B 活躍引數,支援在 Mistral Vibe 中零設定使用,並提供免費 API 端點。

    推薦理由:Leanstral 以 6B 引數實現高效 Lean 4 程式碼生成,成本低於主流模型,展示了開原始碼代理在正式驗證場景中的可行性。

3月12日週四
  1. Google Research66

    AMIE 對話式診斷 AI 在真實臨床環境中的可行性研究

    Google Research 在 Beth Israel Deaconess Medical Center 進行了一項單中心前瞻性可行性研究,評估其對話式診斷 AI AMIE 在門診前訪談中的安全性與實用性。研究共招募 100 名成人患者,零安全停機事件,AMIE 的診斷準確率在前 7 名中達 90%,並獲得患者與醫生的高度接受度。

    推薦理由:該研究首次在真實臨床環境中驗證了對話式診斷 AI 的可行性與安全性,為未來大規模臨床試驗奠定基礎,並顯示患者與醫生接受度高,提示其在臨床決策支援中的價值。

3月11日週三
  1. Mistral AI66

    Mistral AI 推出自主 Rails 測試智慧體:為不願寫測試的開發者自動編寫 RSpec

    Mistral AI 推出了基於開源編碼助手 Vibe 構建的自主測試智慧體,能夠自動為 Ruby on Rails 程式碼庫生成、驗證和改進 RSpec 測試。該智慧體通過倉庫級上下文、分類技能檔案以及 RuboCop 和 SimpleCov 自定義工具,在包含 275 個檔案的真實程式碼庫測試中實現了 100% 的程式碼覆蓋率和通過率。

    推薦理由:原文介紹了團隊如何基於開源編碼助手構建自主測試生成智慧體,讀者可以瞭解如何通過上下文工程、專用技能和自定義工具來擴充套件智慧體能力。