外骨骼時代的黎明
外骨骼技術在救援、工業、軍事與日常生活中的實際應用與未來發展 - 實際案例:西雅圖山地救援隊、IKEA、Ford、Boeing、Mazda、Toyota 等企業已在工地或倉儲使用 SuitX 或其他外骨骼,提升搬運力與工作效率。
外骨骼技術在救援、工業、軍事與日常生活中的實際應用與未來發展 - 實際案例:西雅圖山地救援隊、IKEA、Ford、Boeing、Mazda、Toyota 等企業已在工地或倉儲使用 SuitX 或其他外骨骼,提升搬運力與工作效率。
summary_zh: Tesla 的 Optimus 人形機器人預計於 2027 年底上市,單價約 $20,000,但目前仍未能即時改變人類生活。
OpenWAM 是一個開放式框架,允許在世界-動作模型中同時預測與控制,並支援多種生成順序與獨立訓練的動態模型。 - 架構:5B 影片專家 + 2B 動作專家在 Mixture‑of‑Transformers (MoT) 中共享注意力,並可靈活配置影片-動作互動程式(VTA、ATV、Joint 等)。
summary_zh: 每日論文雷達於 2026‑10‑06 收錄 846 篇具身智慧論文,篩選後剩 731 篇,其中 604 為新候選,最終挑選 30 篇進行追蹤。
Rho-1 是 Reka AI 發布的 19 引數億的全能模型,能在單一神經網路中處理文字、影像、影片和機器人控制。 - 多模態整合:同時處理四種模態,無需工具呼叫。
Safeworld 正式從隱身模式出來,推出針對生成式 AI 控制機器人的安全評估平臺。 - 投資規模:獲得超過 $12M 的種子輪資金,投資方包括 Shine Capital、a16z Speedrun 等。
| 每日論文雷達於 2026‑10‑05 將 762 篇論文濾除重複後 656 篇,挑選 30 篇候選,精選前 10 篇進行重點分析,聚焦於 具身智慧(Embodied Intelligence) 研究。
summary_zh: 每日論文雷達於 2026-10-02 針對具身智慧領域整理 30 篇最新研究,涵蓋 VLA 模型、機器人速度場、分散式多機器人協同等主題。
機器人學習研究者/工程師的絕佳機會加入 @theworldlabs ! ❤️🔥 00:00 來源:Fei-Fei Li (@drfeifei)
初創公司 Destro 結束隱秘狀態並獲得 800 萬美元種子輪融資,其核心是通過 AI 智慧層協調物流場景中的機器人與人類工人。Destro 採用基於開源視覺語言動作模型的 Vision 作業系統與 Mothership 作業系統,在 Yusen Logistics 的設施中開展了機器人與人工協同排程的試點部署。
微軟研究院推出了旨在應對生物學複雜性的 AI 研究系統 Quine,該系統結合了生物學世界模型與互動式工具掛載,用於連線科學工具、文獻和溼實驗室。在與 Broad 研究所的胰臟癌研究合作中,該系統在一週末內成功預測並優先篩選出能驅動腫瘤細胞狀態轉變的化合物,並通過了溼實驗驗證。微軟同時推出了 Quine Fellows 專案以招募首批科學家訪問該系統。
推薦理由:微軟研究院推出了面向生物學複雜性的 AI 研究系統 Quine,並將通過 Quine Fellows 專案向科學界開放,為生物醫藥研發提供新的計算與實驗加速路徑。
科學家 Michael Levin 提出了一篇探討非物理主義心智模型及柏拉圖式心智空間的論文,認為生物體與機器是抽象模式介入物理世界的介面。該研究通過異形機器人、人類氣管細胞培育的生物機器人等實驗,探討了演算法與生化生命在探索複雜性模式方面的共通性。這一框架或能為理解人類與 AI 心智在柏拉圖心智空間中的關係及對齊問題提供新視角。
特斯拉員工因擔心 Optimus 人形機器人最終將取代自身崗位而對訓練該機器人產生牴觸,促使特斯拉將資料收集責任轉移給專用團隊並設立了培訓中心。目前 Optimus 仍需針對受控環境中的特定任務進行程式設計,其 AI 能力尚不足以勝任通用操作。
NVIDIA 釋出 Isaac ROS 5.0,這是一個基於 ROS 的 GPU 加速軟體包集合,旨在幫助人類與 AI 智慧體共同構建機器人。新版本引入了全新的智慧體工作流、對 ROS Lyrical 和 Ubuntu 24.04 的支援,以及用於設定和操縱的 NVIDIA Isaac 技能。
推薦理由:該版本引入了面向智慧體的工作流和新平臺支援,為開發者構建物理AI機器人應用提供了GPU加速能力。
NVIDIA 釋出首個面向物理 AI 的全棧安全系統 NVIDIA Halos,旨在為自動駕駛汽車和機器人提供覆蓋硬體、軟體、AI 行為、模擬與驗證等全生命週期的安全支撐。該系統分為自動駕駛與機器人兩大領域,整合了 DRIVE AGX Thor、Hyperion、IGX Thor、Halos OS 及模擬評估框架等軟硬體棧,並已獲得 TÜV SÜD 等機構的安全認證。
推薦理由:原文介紹了該全棧安全系統的架構和生態佈局,讀者可以據此瞭解自動駕駛與機器人安全標準的演進方向。
| 每日論文雷達於 2026‑08‑28 針對具身智慧領域共檢索 779 篇文獻,並精選 10 篇代表性論文進行結構化分析。 - 文獻統計:去重後 663 篇,候選 638 篇,新進 267 篇,關鍵字匹配 27 篇。
summary_zh: 本日於 2026‑08‑27,StreamPI、GaussVLA、TacForcing 等三篇具身智慧相關論文被精選呈現,分別提出流式多模態時間建模、三維高斯空間標記與即時觸覺反饋等創新方法。
| 每日論文雷達於 2026‑08‑26 聚焦具身智慧領域,挑選 28 篇代表性研究進行精選。 - Hierarchical Skill Retrieval:提出階層式技能檢索機制,提升 Vision‑Language‑Action (VLA) 模型在新任務資料效率。
summary_zh: 本日收錄 10 篇具身智慧相關論文,涵蓋意圖蒸餾、反事實監督、提示許可權介面、空間定位介面、統一記憶控制、模態遮罩、未來潛在狀態推斷與長期模仿學習等關鍵技術。
summary_zh: 每日論文雷達於 2026-08-21 針對具身智慧領域統計 770 篇文獻,並挑選 10 篇代表性研究。 - 文獻統計:770 篇總檢索,664 篇去重後;時間視窗 627 篇,新增 212 篇候選。
summary_zh: 每日論文雷達於 2026‑08‑20 針對具身智慧領域,整理並精選 10 篇關鍵論文,涵蓋從機器人基礎模型到視覺‑觸覺策略的最新研究進展。
Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。
推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。
DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。
推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。
NVIDIA 推出 Cosmos-H-Dreams,這是一個針對手術機器人的即時、動作條件生成式模擬器。該模型將 Cosmos-H-Surgical-Simulator 的能力蒸餾為因果學生模型,並通過 FlashDreams 庫在單張 NVIDIA RTX PRO 6000 GPU 上實現每秒約 160 幀的互動式執行,支援在閉環中進行策略評估和資料生成。
推薦理由:官方推出的即時動作條件生成模擬器展示了手術機器人的互動式環境,讀者可以據此瞭解世界模型在醫療機器人領域的即時推理與應用進展。
Hugging Face 推出開源、低成本的機器人運算元據採集系統 Grabette,允許使用者通過手持夾爪和相機快速錄製任務並自動生成機器人就緒的資料集。該系統包含手持錄製裝置 Grabette 與配套的機器人夾爪端側執行器 Gripette,採用模組化標準感測器構建,並已接入 Hugging Face Hub 與 LeRobot 訓練生態。
推薦理由:該開源系統降低了機器人運算元據的採集門檻,為社群協作收集具身智慧訓練資料提供了低成本方案。
Mistral AI 釋出首款具身導航模型 Robostral Navigate,這是一個 8B 引數量的模型,僅需單個普通 RGB 攝像頭和自然語言指令即可讓機器人在複雜環境中自主導航。該模型在 R2R-CE 未見驗證集上取得 76.6% 的成功率,在完全使用模擬資料和高效字首快取技術訓練的基礎上,結合了基於指向的導航與線上強化學習。
推薦理由:該模型僅憑單個 RGB 攝像頭和 8B 引數量即在 R2R-CE 基準上取得領先成績,為具身智慧輕量化部署提供了新路徑。
2026 年,Berkeley Artificial Intelligence Research (BAIR) Lab 慶祝其畢業生的成就。他們的研究涵蓋機器人、LLM、計算機視覺、生成模型、AI 安全、人機互動、科學與醫療 AI,並已發表影響力論文、構建實用系統、指導同輩。畢業生正投身學術、工業研究實驗室及創業公司,期待未來發展。
Google DeepMind Accelerator: Robotics 選拔了來自歐洲的15家機器人初創公司,提供為期三個月的密集指導與技術支援,幫助其將 AI 整合到核心產品中,並將 Gemini 機器人模型納入其技術棧。
Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。
推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。