Gemini Robotics 2 為機器人帶來全身智慧
DeepMind 在部落格中釋出 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身視覺‑語言‑動作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。
推薦理由:Gemini Robotics 2 通過全身控制、精細操作和多機器人協作,展示了在複雜任務中的智慧執行能力,並能在數小時內適配新機器人身體。
DeepMind 在部落格中釋出 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身視覺‑語言‑動作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。
推薦理由:Gemini Robotics 2 通過全身控制、精細操作和多機器人協作,展示了在複雜任務中的智慧執行能力,並能在數小時內適配新機器人身體。
Hugging Face 釋出了對 Nunchaku 4 位元擴散推理的原生支援,允許使用者通過標準 from_pretrained 方法直接載入量化檢查點,無需本地 CUDA 編譯。
推薦理由:原文介紹瞭如何在主流擴散模型庫中原生載入 4 位元量化檢查點,這為在消費級硬體上執行大模型提供了輕量化方案。
Hugging Face 推出開源、低成本的機器人運算元據採集系統 Grabette,允許使用者通過手持夾爪和相機快速錄製任務並自動生成機器人就緒的資料集。該系統包含手持錄製裝置 Grabette 與配套的機器人夾爪端側執行器 Gripette,採用模組化標準感測器構建,並已接入 Hugging Face Hub 與 LeRobot 訓練生態。
推薦理由:該開源系統降低了機器人運算元據的採集門檻,為社群協作收集具身智慧訓練資料提供了低成本方案。
Hugging Face 釋出了 Real World VoiceEQ,一個評估語音 AI 人類質量的基準,涵蓋 60 多項指標,覆蓋 40 多個模型。該基準基於 100 萬條人類評分,評估 15+ 維度的 ASR、TTS、S2S 和 Speech Understanding,幫助開發者識別情感、背景噪聲等細粒度缺陷。
推薦理由:Real World VoiceEQ 提供了超過 60 項指標的真實人類評估,幫助開發者識別模型在情感、背景噪聲等方面的細粒度缺陷。
Google DeepMind 推出由 Gemini 驅動的網路應用 ATL Saathi 的即時試點,為全印度的 Atal Tinkering Labs 教師提供 24/7 的規劃與培訓助手。該應用由 Gemini 3.5 Flash 模型提供底層智慧,首批在全國 100 所試點學校推出。
Mistral AI 推出的 Studio 提示詞與技能系統現已上線,為企業提供集中化的生產資產管理、版本控制與審計日誌功能。團隊可在不經工程流水線的情況下快速迭代並安全部署至生產環境。
Hugging Face 宣佈 vLLM 的 transformers 建模後端在多項架構測試中達到或超過 vLLM 手動編寫的原生實現速度。該後端通過 torch.fx 進行模型圖靜態分析並在執行時動態應用特定層融合,使模型作者無需編寫額外程式碼即可直接獲得原生級推理吞吐量。
推薦理由:原文提供了將原生模型直接應用於高效能推理的具體方法與效能對比,讀者可以據此評估新後端在實際部署中的收益。
Hugging Face 宣佈與 Amazon SageMaker AI 推出深度連結整合,支援開發者通過單次點選將模型直接匯入 SageMaker Studio 工作流。該功能提供預載入模型上下文、自動配置許可權以及 GPU 配額可見性,簡化了從模型發現到企業微調和端點部署的路徑。
Hugging Face 與微軟在 Microsoft Build 2026 上宣佈推出 Foundry Managed Compute 以及 Hugging Face 模型的精選目錄,每週更新並支援一鍵部署到託管計算平臺。該平臺提供企業級安全治理、多模態支援、統一端點和自動化執行時升級,讓企業能夠在 Azure 中安全、便捷地執行開源模型。
推薦理由:微軟與 Hugging Face 合作在 Microsoft Foundry 中推出了託管計算與精選開源模型目錄,讀者可以藉此瞭解開源模型在企業級雲平臺中的部署與運維方案。
LeRobot v0.6.0 引入了世界模型策略、全新的視覺語言動作模型和統一的獎勵模型 API,同時帶來了六大模擬評測基準、全新的部署命令列工具以及深度感知和資料自動標註能力。此次更新還優化了資料集載入速度,實現了完全分片資料並行訓練和雲端訓練支援,並大幅精簡了基礎安裝包的依賴。
推薦理由:該版本閉環了機器人學習流程,使用者可以據此瞭解開源機器人框架在世界模型和評測方面的新能力。
Hugging Face 與 SkyPilot 共同推出原生的 Hugging Face Storage 儲存後端,支援通過單一 hf:// 統一方案在任意雲端或叢集上掛載 Hub 上的模型與資料集。該方案具備零資料出口費、基於 Xet 的重複資料刪除以及按需惰性讀取等特性,可將模型直接載入至異構 GPU 資源中進行開發、訓練或推理。
推薦理由:原文介紹了 Hugging Face Storage 作為 SkyPilot 儲存後端的具體接入方式,讀者可以據此評估跨雲訓練和零出口費用的實際收益。
Hugging Face 推出了 🤗 Kernels 專案的重大更新,新增了名為 kernel 的 Hub 倉庫型別,並帶來改進的安全機制、重構的 CLI、更廣泛的框架與後端支援,以及對智慧體核心開發的基礎支援。
推薦理由:官方對自定義核心專案進行了重大改版並引入了新的倉庫型別,為開發者瞭解核心分發與安全機制提供了參考。
Hugging Face 與 Cerebras 聯合推出將開源語音 AI 架構與高速推理相結合的即時語音方案,實現自然的語音到語音互動。該開源級聯語音堆疊由 Nvidia Parakeet 進行語音識別、Cerebras 執行 Google DeepMind 的 Gemma 4 31B 模型進行推理、以及 Alibaba 的 Qwen3TTS 生成語音,並已應用於 Reachy Mini 機器人。
推薦理由:原文展示了開源語音流水線如何結合硬體推理速度,讀者可以評估這種架構在低延遲互動中的表現。
IBM Research 釋出了 ScarfBench,一個用於評估 AI 代理在企業 Java 框架遷移任務中的基準。該基準包含 34 個應用、102 個框架實現、204 個遷移任務,約 151K 行程式碼。
Google Research 釋出了擴充套件後的建築級屋頂反射率資料集,覆蓋全球 50 多個城市,旨在幫助城規劃者實施清涼屋頂解決方案以緩解極端熱浪。該資料集通過全新的高解析度 Heat Resilience Earth Engine App 公開提供,結合衛星資料與機器學習模型實現了 30 釐米的高空間解析度。
Every Eval Ever 與 Hugging Face Community Evals 達成互通,通過推出的轉換工具支援將評估結果同步至 Hugging Face 模型頁面並自動關聯完整記錄。該工具包含格式轉換、衝突審計與本地預覽功能,目前已支援 MMLU-Pro、GPQA、HLE 和 GSM8K 等官方基準。
推薦理由:原文介紹了 Every Eval Ever 與 Hugging Face Community Evals 的互通方案,為評估結果的跨平臺展示和溯源提供了可複用的自動化工具。
Google DeepMind 宣佈在 Gemini 3.5 Flash 中內建 computer use 功能,使其能夠跨瀏覽器、移動端和桌面環境執行智慧體任務。該功能支援長週期和企業自動化場景,並通過對抗性訓練與可選的企業安全保護系統來降低提示詞注入等風險。開發者現可通過 Gemini API 和 Gemini Enterprise Agent Platform 開始構建相關應用。
推薦理由:官方將 computer use 能力直接整合至主模型,開發者可據此構建能跨平臺操作的自定義智慧體。
Mistral AI 推出了多項聯結器新功能,包括工作空間和組織級別的增強管理員控制、帶聯結器範圍的 API 金鑰以及多賬戶連線。同時引入了用於排查連線故障的偵錯程式,並將聯結器整合到 Workflows 和 Vibe Code 中,支援超過 60 種預構建整合與自定義 MCP 選項。
Google DeepMind 與英國政府及多方合作伙伴共同推出了一款基於 Gemini 構建的 AI 規劃原型工具,旨在將房屋建設申請的處理時間縮短一半。該工具能夠整合資料、識別本地政策、總結反饋並起草評估報告,同時保持規劃官員的最終決策權,計劃於 2027 年面向全國所有地方議會推廣。
Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。
推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。
Google Research 推出了 Gemini Enterprise Agent Platform 的 Agentic RAG,利用多代理協同、規劃與足夠上下文機制,提升多源多跳查詢的準確率至 34%,在跨語料庫實驗中保持 90.1% 的高準確率,且延遲與單語料庫版本相近。該功能已作為公開預覽提供。
推薦理由:該系統在多源多跳查詢中將準確率提升至 34%,為企業工作流提供更可靠的答案,並在跨語料庫場景下保持 90.1% 的高準確率。
Google Research公開了其水文模型框架,供各國氣象機構在GitHub上使用和構建AI洪水預報模型。該框架基於PyTorch實現LSTM網路,支援使用Caravan資料集訓練,並已在Czech Hydrometeorological Institute驗證,提升預測時效6天。
推薦理由:Google公開的水文框架讓各國氣象機構可自行訓練AI洪水預報模型,提升預測時效並降低技術門檻。
Google Research 在 I/O 2026 上公佈了多款 AI 工具與模型,涵蓋科研加速、健康應用、邊緣計算與氣候預測等領域。
推薦理由:Google Research 在 I/O 2026 上公佈多款 AI 工具與模型,展示了從科研到產品的快速落地與實際影響,凸顯代理式編碼與多模態推理在科學與日常應用中的變革潛力,併為全球科研社群提供了可擴充套件的實驗平臺。
Mistral AI 在 AI Now Summit 2026 釋出面向工業工程的全棧 AI 解決方案,並與空中客車、BMW集團和 ASML 合作,支援從設計到生產的安全高效工作流。新推出的 Vibe 代理可處理長週期任務,如編碼與研究;法國 Les Ulis 10 MW 資料中心將於 2026 年第三季度投入使用,提升推理與安全控制。
推薦理由:Mistral 推出面向工業工程的 AI 堆疊和 Vibe 代理,展示如何在航空、汽車和半導體領域實現安全、高效的設計與生產。
Vibe 是 Mistral 推出的統一 AI 代理,兼顧工作與編碼。它提供 Work Mode 處理多步企業任務(如收件箱、日曆、研究、文件起草)以及 Code Mode 進行遠端編碼(從功能開發到拉取請求),並可通過 VS Code、CLI 和 Web 進行無縫協作。
推薦理由:Vibe 將工作與編碼整合為單一智慧體,支援多步任務、視覺化推理與可擴充套件部署,適合企業與個人使用
Mistral AI 公佈 Search Toolkit,開源框架整合搜尋、檢索與評估,支援多源索引、即時資料拉取,相容 BM25、向量檢索及混合模式,內建 recall、precision、MRR、NDCG 等指標,適用於 RAG 與智慧體場景,可在雲端、本地或邊緣部署。
推薦理由:Search Toolkit 將搜尋、檢索和評估整合到單一框架,幫助企業減少工程時間並提升檢索質量;其可在雲端、邊緣或本地部署,支援多源索引與即時資料拉取,適用於 RAG 與智慧體場景。
Mistral AI 宣佈推出物理 AI 基礎能力,將 Emmi AI 整合至企業級產品棧中。該能力旨在通過資料驅動的模型在單張 GPU 上於數秒內直接預測物理行為,從而實現加速產品設計、加速工裝流程設計以及構建即時數字孿生。
推薦理由:該產品將物理 AI 引入企業解決方案,讀者可以瞭解其如何通過單次前向傳播將模擬模擬時間從數小時縮短至數秒。
Mistral AI 在 Studio 中推出 Connectors 功能,支援開發者使用內建與自定義 MCP 構建企業級 AI 應用。該功能提供 API/SDK 接入、直接工具呼叫、人機協同審批流及統一的集中註冊管理,適用於各類對話、智慧體及複雜工作流。
推薦理由:該功能將企業級資料整合統一封裝為可重用的 MCP 實體,減少了重複開發和鑑權成本,為構建複雜智慧體工作流提供了標準化方案。
Google 釋出由 Gemini 驅動的科研輔助工具 Empirical Research Assistance(ERA),可用於編寫和最佳化科學程式碼,並在《Nature》雜誌上發表了相關論文。
推薦理由:Google 推出基於 Gemini 的科研輔助工具 Empirical Research Assistance,讀者可以瞭解其在多學科科學發現中的應用例項和開放入口。
Co-Scientist 幫助生物學家 Omar Abudayyeh 和 Jonathan Gootenberg 在基因篩選實驗中快速識別並驗證了多種可逆轉細胞衰老的基因因素。它掃描數萬篇論文,提出超過20個新穎可行的基因靶點,其中部分已在實驗中證明能使細胞恢復年輕狀態並提升功能。除此之外,Co-Scientist 將資料分析時間從長達六個月壓縮至僅幾天。
Google DeepMind 推出了將 Project Genie 與 Google Street View 結合的新街景接地功能,允許使用者利用真實街景影像生成互動虛擬環境,並面向全球 Google AI Ultra 訂閱者逐步開放。新功能通過 Maps Imagery Grounding 技術支援,目前美國地區的街景影像已可用。
推薦理由:該產品更新將世界模型與街景資料結合,為使用者和智慧體提供了在現實地點基礎上生成互動環境的新能力。
Google DeepMind 推出了全新獨立桌面應用 Google Antigravity 2.0,專為智慧體最佳化的體驗而設計,擺脫了傳統整合開發環境的束縛。該應用由 Gemini 模型驅動,引入了動態子代理、非同步任務管理、JSON 鉤子、定時任務以及基於專案的許可權管理等核心功能。
推薦理由:該版本脫離了傳統開發環境並引入了獨立桌面應用形態,讀者可以據此瞭解智慧體工具如何向通用知識工作擴充套件。
Google DeepMind 釋出 Gemini for Science,推出面向科學研究的全新工具與實驗功能,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上的三個實驗性原型工具。
推薦理由:原文介紹了面向科研場景的全新工具集與實驗功能,讀者可以從中瞭解通用智慧體如何加速科學發現流程。
Google DeepMind 在 Search、Gemini、Chrome、Pixel 及 Cloud 等產品中擴充套件了內容透明度與驗證工具,並深化與行業夥伴的合作。官方將 SynthID 數字水印與 C2PA 內容憑證技術整合到更多生成式媒體工具及硬體裝置中,並在 Google Cloud 上推出 AI 內容檢測 API。
推薦理由:文章詳細披露了數字水印與內容憑證技術在多端產品及企業API中的落地範圍,為評估跨平臺內容溯源的實際可用性提供了直接依據。
劍橋大學教授 Clare Bryant 利用 Co-Scientist 探尋病原體跨物種傳播引發嚴重人類疾病的分子開關。在輸入研究資助申請書與未發表實驗材料後,該工具生成並篩選出候選蛋白質與特定胺基酸假設。這套原本需要兩到三年實驗才能完成的精準定位工作,目前有望在六個月內完成。
Calico Life Sciences 利用 DeepMind 的 Co-Scientist 工具,生成並驗證了關於 ISR 通過代謝調控的新假設,實驗結果揭示了 ISR 在衰老與疾病中的重要作用。該工具幫助研究人員篩選高質量假設並最佳化實驗設計,推動了衰老生物學研究的進展。
Co-Scientist 通過整合機械工程與化學生物學工具,幫助Raman與Flynn快速評估ALS研究方向。它壓縮文獻並結合細胞表面RNA對映,快速生成可測試假設並評估實驗可行性。兩位研究者利用該工具迭代合作,聚焦 RNA 基礎機制,力圖開發針對 ALS 的 RNA 相關藥物。
Google DeepMind 的天氣模型 WeatherNext 成功提前五天預測了 2025 年颶風梅利莎在牙買加增強至五級強颶風的路徑與強度。該模型通過結合全球天氣模式與極端熱帶氣旋資料集,兼顧了傳統模型難以同時做到的路徑與強度預測能力。
推薦理由:文章詳細記錄了 AI 天氣模型在颶風預報中的實際表現與提前天數,讀者可以據此評估其在極端氣象預測中的應用潛力。
Google DeepMind 釋出了基於 Gemini 構建的協作式多智慧體 AI 系統 Co-Scientist,旨在通過生成、辯論和演化科學假說來加速生命科學等領域的科研突破。該系統由生成、接近度、反射、排名、演化和元審查等多個專業智慧體組成,並引入了類似 AlphaGo 的積分制辯論機制來驗證和篩選最有潛力的研究方向。目前該系統正通過全新實驗工具逐步向研究人員開放。
推薦理由:Google DeepMind 釋出了基於 Gemini 構建的多智慧體科學研究系統 Co-Scientist,讀者可以瞭解其通過模擬科學辯論生成和演化假說的具體架構與應用效果。
Google DeepMind 總結了 Gemini 驅動的編碼智慧體 AlphaEvolve 在科學研究、AI 基礎設施最佳化及商業應用等領域的最新進展。該系統在基因組學測序錯誤校正、電網最佳化、量子物理模擬以及下一代 TPU 晶片設計等多個場景中顯著提升了效能和效率,並正通過 Google Cloud 向各行業企業開放應用。
推薦理由:原文梳理了該系統一年來的應用成果與商業拓展,讀者可以據此瞭解其在科學研究和工程基礎設施中的落地成效。