跳到正文

#具身智慧

RSS
今日 0 則
9月29日週二
  1. Microsoft Research62

    微軟釋出 AI 生物研究系統 Quine

    微軟研究院推出了旨在應對生物學複雜性的 AI 研究系統 Quine,該系統結合了生物學世界模型與互動式工具掛載,用於連線科學工具、文獻和溼實驗室。在與 Broad 研究所的胰臟癌研究合作中,該系統在一週末內成功預測並優先篩選出能驅動腫瘤細胞狀態轉變的化合物,並通過了溼實驗驗證。微軟同時推出了 Quine Fellows 專案以招募首批科學家訪問該系統。

    推薦理由:微軟研究院推出了面向生物學複雜性的 AI 研究系統 Quine,並將通過 Quine Fellows 專案向科學界開放,為生物醫藥研發提供新的計算與實驗加速路徑。

9月22日週二
  1. NVIDIA Blog63

    NVIDIA 釋出 Isaac ROS 5.0,推進具身智慧與開源機器人開發

    NVIDIA 釋出 Isaac ROS 5.0,這是一個基於 ROS 的 GPU 加速軟體包集合,旨在幫助人類與 AI 智慧體共同構建機器人。新版本引入了全新的智慧體工作流、對 ROS Lyrical 和 Ubuntu 24.04 的支援,以及用於設定和操縱的 NVIDIA Isaac 技能。

    推薦理由:該版本引入了面向智慧體的工作流和新平臺支援,為開發者構建物理AI機器人應用提供了GPU加速能力。

  2. NVIDIA Blog62

    NVIDIA 釋出面向物理 AI 的全棧安全系統 Halos

    NVIDIA 釋出首個面向物理 AI 的全棧安全系統 NVIDIA Halos,旨在為自動駕駛汽車和機器人提供覆蓋硬體、軟體、AI 行為、模擬與驗證等全生命週期的安全支撐。該系統分為自動駕駛與機器人兩大領域,整合了 DRIVE AGX Thor、Hyperion、IGX Thor、Halos OS 及模擬評估框架等軟硬體棧,並已獲得 TÜV SÜD 等機構的安全認證。

    推薦理由:原文介紹了該全棧安全系統的架構和生態佈局,讀者可以據此瞭解自動駕駛與機器人安全標準的演進方向。

8月13日週四
  1. Microsoft Research61

    Microsoft Research 推出 MindTopo 評測 VLM 的空間推理能力

    Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。

    推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。

7月30日週四
  1. Google DeepMind86

    Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人

    DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。

7月27日週一
  1. Hugging Face Blog63

    NVIDIA 釋出 Cosmos-H-Dreams 即時生成式手術機器人模擬器

    NVIDIA 推出 Cosmos-H-Dreams,這是一個針對手術機器人的即時、動作條件生成式模擬器。該模型將 Cosmos-H-Surgical-Simulator 的能力蒸餾為因果學生模型,並通過 FlashDreams 庫在單張 NVIDIA RTX PRO 6000 GPU 上實現每秒約 160 幀的互動式執行,支援在閉環中進行策略評估和資料生成。

    推薦理由:官方推出的即時動作條件生成模擬器展示了手術機器人的互動式環境,讀者可以據此瞭解世界模型在醫療機器人領域的即時推理與應用進展。

7月21日週二
  1. Hugging Face Blog65

    Hugging Face 釋出開源機器人運算元據採集系統 Grabette

    Hugging Face 推出開源、低成本的機器人運算元據採集系統 Grabette,允許使用者通過手持夾爪和相機快速錄製任務並自動生成機器人就緒的資料集。該系統包含手持錄製裝置 Grabette 與配套的機器人夾爪端側執行器 Gripette,採用模組化標準感測器構建,並已接入 Hugging Face Hub 與 LeRobot 訓練生態。

    推薦理由:該開源系統降低了機器人運算元據的採集門檻,為社群協作收集具身智慧訓練資料提供了低成本方案。

7月8日週三
  1. Mistral AI67

    Mistral AI 釋出首款具身導航模型 Robostral Navigate

    Mistral AI 釋出首款具身導航模型 Robostral Navigate,這是一個 8B 引數量的模型,僅需單個普通 RGB 攝像頭和自然語言指令即可讓機器人在複雜環境中自主導航。該模型在 R2R-CE 未見驗證集上取得 76.6% 的成功率,在完全使用模擬資料和高效字首快取技術訓練的基礎上,結合了基於指向的導航與線上強化學習。

    推薦理由:該模型僅憑單個 RGB 攝像頭和 8B 引數量即在 R2R-CE 基準上取得領先成績,為具身智慧輕量化部署提供了新路徑。

7月1日週三
  1. Berkeley AI Research23

    2026 BAIR 畢業生展示

    2026 年,Berkeley Artificial Intelligence Research (BAIR) Lab 慶祝其畢業生的成就。他們的研究涵蓋機器人、LLM、計算機視覺、生成模型、AI 安全、人機互動、科學與醫療 AI,並已發表影響力論文、構建實用系統、指導同輩。畢業生正投身學術、工業研究實驗室及創業公司,期待未來發展。

6月9日週二
4月13日週一
  1. Google DeepMind75

    Gemini Robotics-ER 1.6:通過增強具身推理驅動真實世界機器人任務

    Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。

    推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。