Google Research 推出 AMIE (Video) 实时视频临床问诊系统
Google Research 推出了 AMIE 的实时视频配置版本 AMIE (Video),能够基于 Gemini 和 Project Astra 进行同步临床视频问诊,感知非引导性的临床非语言线索并进行实时诊断推理。
Why Recommended: 这项研究展示了多模态医疗AI在视频问诊中的专家级表现,为远程医疗系统的架构设计提供了实证参考。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Google Research 推出了 AMIE 的实时视频配置版本 AMIE (Video),能够基于 Gemini 和 Project Astra 进行同步临床视频问诊,感知非引导性的临床非语言线索并进行实时诊断推理。
Why Recommended: 这项研究展示了多模态医疗AI在视频问诊中的专家级表现,为远程医疗系统的架构设计提供了实证参考。
Meta 推出了全新的 30B 参数开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议发布,专门面向本地智能体和隐私保护应用。该模型结合了 2B 的视觉感知编码器与 28B 的文本解码器,支持图像、视频理解以及多模态工具调用,并提供 transformers、llama.cpp 和 vLLM 的首日支持。
Why Recommended: 文章详细介绍了 Meta 开源多模态模型 Muse Glimmer 的架构设计与本地部署方法,读者可以据此了解其在端侧智能体和多模态任务中的应用潜力。
Mistral AI 发布了 Shieldstral,这是一款 3B 参数的开源多模态安全分类模型,采用 Apache 2.0 协议开源。该模型将内容审核转换为策略自适应的问答任务,允许在推理时通过自然语言指定策略,从而无需重新训练即可统一处理文本和图像安全评估。
Why Recommended: 该模型通过将内容审核转化为推理时的自然语言问答任务,避免了传统方案因固定分类体系而需要重新训练的限制。
DeepMind 发布 Gemini Robotics ER 2,作为其最新的“具身推理”模型,支持持续视频理解、任务编排和多机器人协作。该模型可与任何低层 VLA 模型配合,实时调用工具(如 Google Search),并在执行过程中保持推理,显著提升任务完成率和安全性。
Why Recommended: Gemini Robotics ER 2 通过视频理解和多机器人协作提升机器人任务完成率,展示了高效实时推理与安全控制的结合。
NVIDIA 推出 Cosmos-H-Dreams,这是一个针对手术机器人的实时、动作条件生成式模拟器。该模型将 Cosmos-H-Surgical-Simulator 的能力蒸馏为因果学生模型,并通过 FlashDreams 库在单张 NVIDIA RTX PRO 6000 GPU 上实现每秒约 160 帧的交互式运行,支持在闭环中进行策略评估和数据生成。
Why Recommended: 官方推出的实时动作条件生成模拟器展示了手术机器人的交互式环境,读者可以据此了解世界模型在医疗机器人领域的实时推理与应用进展。
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延迟支撑大规模 AI 智能体工作流。
Why Recommended: 官方发布了三个新的 Gemini Flash 系列模型,给出了详细的性能指标与价格,读者可以据此评估其在智能体工作流和高吞吐任务中的成本与效率。
Google Research 推出了 SensorFM,这是一个在大规模未标注可穿戴传感器数据上预训练的大型传感器基础模型。该模型使用超一万亿分钟的多模态传感器信号进行自监督训练,能够跨越心血管、代谢、睡眠和心理健康等多个领域进行通用表征,并支持构建更精准的个人健康智能体。
Why Recommended: 研究展示了如何利用大规模未标注传感器数据训练通用生理表征,读者可以了解其在多任务泛化和健康智能体中的表现。
Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 参数量的模型,仅需单个普通 RGB 摄像头和自然语言指令即可让机器人在复杂环境中自主导航。该模型在 R2R-CE 未见验证集上取得 76.6% 的成功率,在完全使用模拟数据和高效前缀缓存技术训练的基础上,结合了基于指向的导航与在线强化学习。
Why Recommended: 该模型仅凭单个 RGB 摄像头和 8B 参数量即在 R2R-CE 基准上取得领先成绩,为具身智能轻量化部署提供了新路径。
LeRobot v0.6.0 引入了世界模型策略、全新的视觉语言动作模型和统一的奖励模型 API,同时带来了六大仿真评测基准、全新的部署命令行工具以及深度感知和数据自动标注能力。此次更新还优化了数据集加载速度,实现了完全分片数据并行训练和云端训练支持,并大幅精简了基础安装包的依赖。
Why Recommended: 该版本闭环了机器人学习流程,用户可以据此了解开源机器人框架在世界模型和评测方面的新能力。
Google DeepMind 推出两款新模型:速度最快且最具成本效益的图像模型 Nano Banana 2 Lite,以及用于高质量视频生成和对话式编辑的 Gemini Omni Flash。
Why Recommended: Google DeepMind 推出 Nano Banana 2 Lite 与 Gemini Omni Flash 两款新模型,为开发者串联图像生成与视频编辑提供了低成本且高效的新方案。
Mistral AI 发布 Mistral OCR 4 模型,提供文档解析功能,除提取文本外还返回边界框、块分类和行内置信度分数。该模型支持 170 种语言,可在单容器中运行以用于自托管部署,并通过 API 或 Document AI 提供支持。
Why Recommended: 该模型支持多语言及单容器私有化部署,为企业级检索和智能体工作流提供了带边界框和置信度的结构化文档解析能力。
DeepMind 推出 Gemma 4 12B,这是一款无编码器的统一多模态模型,能够直接在配备 16GB VRAM 的笔记本上运行。它在保持与 26B MoE 近似的推理性能的同时,显著降低了内存占用,并首次支持原生音频输入。
Why Recommended: Gemma 4 12B 以无编码器的多模态架构实现低内存、强推理,适配本地 16GB VRAM 机器,读者可据此评估在边缘设备上的部署可能。
Google Research 推出了被动心率监测系统(PHRM),利用智能手机前置摄像头在日常面部解锁后进行视频采集,通过深度学习实现全肤色覆盖的心率与静息心率精准追踪。该研究结合实验室与真实世界评估,在各类肤色上均达到了与穿戴设备相当的准确率,并同步开源了相关数据集与“PHRM-mini”预训练模型供合规研究者申请使用。
Why Recommended: 研究推出了基于智能手机摄像头的被动心率监测系统,其准确率达到行业标准并开源了数据集与预训练模型。
Google Research 在 I/O 2026 上公布了多款 AI 工具与模型,涵盖科研加速、健康应用、边缘计算与气候预测等领域。
Why Recommended: Google Research 在 I/O 2026 上公布多款 AI 工具与模型,展示了从科研到产品的快速落地与实际影响,凸显代理式编码与多模态推理在科学与日常应用中的变革潜力,并为全球科研社区提供了可扩展的实验平台。
Google DeepMind 推出了将 Project Genie 与 Google Street View 结合的新街景接地功能,允许用户利用真实街景图像生成互动虚拟环境,并面向全球 Google AI Ultra 订阅者逐步开放。新功能通过 Maps Imagery Grounding 技术支持,目前美国地区的街景图像已可用。
Why Recommended: 该产品更新将世界模型与街景数据结合,为用户和智能体提供了在现实地点基础上生成互动环境的新能力。
Google DeepMind 推出了全新多模态模型 Gemini Omni,并发布了该系列首款模型 Gemini Omni Flash,支持通过图像、音频、视频和文本组合输入生成及编辑视频。该模型已向 Gemini app、Google Flow 以及 YouTube Shorts 用户推出,未来还将通过 API 提供给开发者和企业客户。
Why Recommended: 原文介绍了新模型的具体输入组合和发布范围,读者可以据此评估多模态视频生成与编辑的最新能力边界。
Google DeepMind 宣布推出 AI co-clinician 研究计划,旨在探索结合多模态能力的医疗人工智能系统,以辅助医生并提升远程医疗和临床决策的质量。该系统采用双Agent架构,在多项模拟临床评估与药物问答基准测试中展现出处理复杂医疗任务的潜力。
Why Recommended: 原文介绍了医用人工智能研究项目的架构与仿真评估结果,读者可以了解多模态技术在医疗场景中的实际表现与安全性保障。
Google DeepMind 推出了 Gemma 4,四种尺寸(E2B、E4B、26B MoE、31B Dense)支持多模态、长上下文(128K–256K)和 140+ 语言,具备高级推理、函数调用和代码生成能力,并以 Apache 2.0 许可免费开放,适用于从移动端到云端的多场景部署。
Why Recommended: Gemma 4 以高效参数利用率和多模态能力,成为最强开源模型之一,支持从移动端到云端的多场景部署,并提供 128K–256K 上下文窗口和 140+ 语言支持,兼具函数调用和结构化 JSON 输出,满足多行业需求。
Google DeepMind 发布了由 Gemini 驱动的 AI 鼠标指针实验项目与交互原则,旨在让用户无需切换窗口即可通过指向和语音在 Chrome 等产品中直接调用 AI 能力。
Why Recommended: 原文介绍了将 AI 融入鼠标指针的交互理念与实验功能,读者可以据此了解未来跨应用多模态交互的设计方向。
Google Research 宣布推出 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与网络端 XR Blocks 框架,将自然语言直接转换为物理感知的 Android XR 应用。该系统通过专用系统提示词和代码模板自动处理空间逻辑,让开发者能够在短时间内快速构建和测试空间计算原型。
Why Recommended: 原文公布了结合大模型与空间计算框架的具体实现方案,读者可以据此了解如何通过自然语言快速生成扩展现实应用。