每日論文雷達|2026-10-06 具身智慧
summary_zh: 每日論文雷達於 2026‑10‑06 收錄 846 篇具身智慧論文,篩選後剩 731 篇,其中 604 為新候選,最終挑選 30 篇進行追蹤。
summary_zh: 每日論文雷達於 2026‑10‑06 收錄 846 篇具身智慧論文,篩選後剩 731 篇,其中 604 為新候選,最終挑選 30 篇進行追蹤。
| 每日論文雷達於 2026‑10‑05 將 762 篇論文濾除重複後 656 篇,挑選 30 篇候選,精選前 10 篇進行重點分析,聚焦於 具身智慧(Embodied Intelligence) 研究。
summary_zh: 每日論文雷達於 2026-10-02 針對具身智慧領域整理 30 篇最新研究,涵蓋 VLA 模型、機器人速度場、分散式多機器人協同等主題。
微軟研究院推出了旨在應對生物學複雜性的 AI 研究系統 Quine,該系統結合了生物學世界模型與互動式工具掛載,用於連線科學工具、文獻和溼實驗室。在與 Broad 研究所的胰臟癌研究合作中,該系統在一週末內成功預測並優先篩選出能驅動腫瘤細胞狀態轉變的化合物,並通過了溼實驗驗證。微軟同時推出了 Quine Fellows 專案以招募首批科學家訪問該系統。
推薦理由:微軟研究院推出了面向生物學複雜性的 AI 研究系統 Quine,並將通過 Quine Fellows 專案向科學界開放,為生物醫藥研發提供新的計算與實驗加速路徑。
NVIDIA 釋出 Isaac ROS 5.0,這是一個基於 ROS 的 GPU 加速軟體包集合,旨在幫助人類與 AI 智慧體共同構建機器人。新版本引入了全新的智慧體工作流、對 ROS Lyrical 和 Ubuntu 24.04 的支援,以及用於設定和操縱的 NVIDIA Isaac 技能。
推薦理由:該版本引入了面向智慧體的工作流和新平臺支援,為開發者構建物理AI機器人應用提供了GPU加速能力。
NVIDIA 釋出首個面向物理 AI 的全棧安全系統 NVIDIA Halos,旨在為自動駕駛汽車和機器人提供覆蓋硬體、軟體、AI 行為、模擬與驗證等全生命週期的安全支撐。該系統分為自動駕駛與機器人兩大領域,整合了 DRIVE AGX Thor、Hyperion、IGX Thor、Halos OS 及模擬評估框架等軟硬體棧,並已獲得 TÜV SÜD 等機構的安全認證。
推薦理由:原文介紹了該全棧安全系統的架構和生態佈局,讀者可以據此瞭解自動駕駛與機器人安全標準的演進方向。
Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。
推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。
DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。
推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。
NVIDIA 推出 Cosmos-H-Dreams,這是一個針對手術機器人的即時、動作條件生成式模擬器。該模型將 Cosmos-H-Surgical-Simulator 的能力蒸餾為因果學生模型,並通過 FlashDreams 庫在單張 NVIDIA RTX PRO 6000 GPU 上實現每秒約 160 幀的互動式執行,支援在閉環中進行策略評估和資料生成。
推薦理由:官方推出的即時動作條件生成模擬器展示了手術機器人的互動式環境,讀者可以據此瞭解世界模型在醫療機器人領域的即時推理與應用進展。
Hugging Face 推出開源、低成本的機器人運算元據採集系統 Grabette,允許使用者通過手持夾爪和相機快速錄製任務並自動生成機器人就緒的資料集。該系統包含手持錄製裝置 Grabette 與配套的機器人夾爪端側執行器 Gripette,採用模組化標準感測器構建,並已接入 Hugging Face Hub 與 LeRobot 訓練生態。
推薦理由:該開源系統降低了機器人運算元據的採集門檻,為社群協作收集具身智慧訓練資料提供了低成本方案。
Mistral AI 釋出首款具身導航模型 Robostral Navigate,這是一個 8B 引數量的模型,僅需單個普通 RGB 攝像頭和自然語言指令即可讓機器人在複雜環境中自主導航。該模型在 R2R-CE 未見驗證集上取得 76.6% 的成功率,在完全使用模擬資料和高效字首快取技術訓練的基礎上,結合了基於指向的導航與線上強化學習。
推薦理由:該模型僅憑單個 RGB 攝像頭和 8B 引數量即在 R2R-CE 基準上取得領先成績,為具身智慧輕量化部署提供了新路徑。
2026 年,Berkeley Artificial Intelligence Research (BAIR) Lab 慶祝其畢業生的成就。他們的研究涵蓋機器人、LLM、計算機視覺、生成模型、AI 安全、人機互動、科學與醫療 AI,並已發表影響力論文、構建實用系統、指導同輩。畢業生正投身學術、工業研究實驗室及創業公司,期待未來發展。
Google DeepMind Accelerator: Robotics 選拔了來自歐洲的15家機器人初創公司,提供為期三個月的密集指導與技術支援,幫助其將 AI 整合到核心產品中,並將 Gemini 機器人模型納入其技術棧。
Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。
推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。