跳到正文

具身智能

AI 走进物理世界:人形机器人、具身基础模型与真实环境操作能力的进展追踪。

最新精選

第 1–9 條 · 共 9 條
9月29日週二
  1. Microsoft Research62

    微软发布 AI 生物研究系统 Quine

    微软研究院推出了旨在应对生物学复杂性的 AI 研究系统 Quine,该系统结合了生物学世界模型与交互式工具挂载,用于连接科学工具、文献和湿实验室。在与 Broad 研究所的胰腺癌研究合作中,该系统在一周末内成功预测并优先筛选出能驱动肿瘤细胞状态转变的化合物,并通过了湿实验验证。微软同时推出了 Quine Fellows 项目以招募首批科学家访问该系统。

    推薦理由:微软研究院推出了面向生物学复杂性的 AI 研究系统 Quine,并将通过 Quine Fellows 项目向科学界开放,为生物医药研发提供新的计算与实验加速路径。

9月22日週二
  1. NVIDIA Blog63

    NVIDIA 发布 Isaac ROS 5.0,推进具身智能与开源机器人开发

    NVIDIA 发布 Isaac ROS 5.0,这是一个基于 ROS 的 GPU 加速软件包集合,旨在帮助人类与 AI 智能体共同构建机器人。新版本引入了全新的智能体工作流、对 ROS Lyrical 和 Ubuntu 24.04 的支持,以及用于设置和操纵的 NVIDIA Isaac 技能。

    推薦理由:该版本引入了面向智能体的工作流和新平台支持,为开发者构建物理AI机器人应用提供了GPU加速能力。

  2. NVIDIA Blog62

    NVIDIA 发布面向物理 AI 的全栈安全系统 Halos

    NVIDIA 发布首个面向物理 AI 的全栈安全系统 NVIDIA Halos,旨在为自动驾驶汽车和机器人提供覆盖硬件、软件、AI 行为、仿真与验证等全生命周期的安全支撑。该系统分为自动驾驶与机器人两大领域,整合了 DRIVE AGX Thor、Hyperion、IGX Thor、Halos OS 及仿真评估框架等软硬件栈,并已获得 TÜV SÜD 等机构的安全认证。

    推薦理由:原文介绍了该全栈安全系统的架构和生态布局,读者可以据此了解自动驾驶与机器人安全标准的演进方向。

8月13日週四
  1. Microsoft Research61

    Microsoft Research 推出 MindTopo 评测 VLM 的空间推理能力

    Microsoft Research 推出了新基准 MindTopo,用于评估多模态大语言模型对连通性、包围、顺序、分离和结等拓扑概念的理解。研究发现,模型在静态图像识别上的表现明显优于需要跨动作维持空间关系的交互式规划任务。

    推薦理由:研究展示了当前多模态模型在静态拓扑识别与动态规划之间存在明显差距,为提升机器人和交互环境中的空间理解能力提供了新的评估基准。

7月30日週四
  1. Google DeepMind86

    Gemini Robotics ER 2:通过视频理解、任务编排与多机器人协作驱动机器人

    DeepMind 发布 Gemini Robotics ER 2,作为其最新的“具身推理”模型,支持持续视频理解、任务编排和多机器人协作。该模型可与任何低层 VLA 模型配合,实时调用工具(如 Google Search),并在执行过程中保持推理,显著提升任务完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通过视频理解和多机器人协作提升机器人任务完成率,展示了高效实时推理与安全控制的结合。

7月27日週一
  1. Hugging Face Blog63

    NVIDIA 发布 Cosmos-H-Dreams 实时生成式手术机器人模拟器

    NVIDIA 推出 Cosmos-H-Dreams,这是一个针对手术机器人的实时、动作条件生成式模拟器。该模型将 Cosmos-H-Surgical-Simulator 的能力蒸馏为因果学生模型,并通过 FlashDreams 库在单张 NVIDIA RTX PRO 6000 GPU 上实现每秒约 160 帧的交互式运行,支持在闭环中进行策略评估和数据生成。

    推薦理由:官方推出的实时动作条件生成模拟器展示了手术机器人的交互式环境,读者可以据此了解世界模型在医疗机器人领域的实时推理与应用进展。

7月21日週二
  1. Hugging Face Blog65

    Hugging Face 发布开源机器人操作数据采集系统 Grabette

    Hugging Face 推出开源、低成本的机器人操作数据采集系统 Grabette,允许用户通过手持夹爪和相机快速录制任务并自动生成机器人就绪的数据集。该系统包含手持录制设备 Grabette 与配套的机器人夹爪端侧执行器 Gripette,采用模块化标准传感器构建,并已接入 Hugging Face Hub 与 LeRobot 训练生态。

    推薦理由:该开源系统降低了机器人操作数据的采集门槛,为社区协作收集具身智能训练数据提供了低成本方案。

7月8日週三
  1. Mistral AI67

    Mistral AI 发布首款具身导航模型 Robostral Navigate

    Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 参数量的模型,仅需单个普通 RGB 摄像头和自然语言指令即可让机器人在复杂环境中自主导航。该模型在 R2R-CE 未见验证集上取得 76.6% 的成功率,在完全使用模拟数据和高效前缀缓存技术训练的基础上,结合了基于指向的导航与在线强化学习。

    推薦理由:该模型仅凭单个 RGB 摄像头和 8B 参数量即在 R2R-CE 基准上取得领先成绩,为具身智能轻量化部署提供了新路径。

4月13日週一
  1. Google DeepMind75

    Gemini Robotics-ER 1.6:通过增强具身推理驱动真实世界机器人任务

    Google DeepMind 推出了 Gemini Robotics-ER 1.6,这是其专为机器人设计的最新模型,提升了空间推理、多视角理解和仪表读取能力。该版本在安全性和物理约束遵守方面也有显著改进,并已通过 Gemini API 和 Google AI Studio 对开发者开放。

    推薦理由:Gemini Robotics-ER 1.6 通过增强空间推理和多视角理解,显著提升机器人在真实环境中的自主决策能力,并首次实现仪表读取功能,为工业设施监测提供更高精度。该模型在安全性和物理约束遵守方面也表现出显著改进,帮助机器人更安全地执行任务。