Skip to content

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精選

第 21–40 條 · 共 88 條
Sep 2Wed
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 推出了适用于 Gemini 最新模型的智能体视频理解功能,通过动态检索视觉帧、音频和字幕,将视频分析的 token 消耗降低最高 88%、成本降低最高 66%,并将准确率提升最高 7%。

    Why Recommended: 原文公布了功能特性与具体优化数据,读者可以据此了解该技术如何降低视频处理成本。

Sep 1Tue
  1. Google Research63

    Google Research 发布 TimesFM-3:支持多变量预测的零样本时间序列基座模型

    Google Research 推出 TimesFM-3,这是一个拥有 3.3 亿参数、原生支持多变量预测的零样本时间序列基座模型。该模型采用解码器架构与交替注意力机制,支持单次前向传递生成整个预测区间,在 Gift-Eval、FEV-Bench 和 Time 等基准测试中表现优于其他预训练基座模型,目前已在 GitHub 和 Hugging Face 上线。

    Why Recommended: 谷歌发布了面向多变量时间序列预测的基座模型 TimesFM-3,它通过交替注意力架构和单次前向传递实现了零样本预测,在多项公开基准测试中表现领先。

Aug 28Fri
  1. Google Research62

    Google Research 推出行星预测引擎自动化全球地理空间建模

    Google Research 推出了行星预测引擎(PPE),这是一种作为 Google Earth AI 一部分的新型实验性研究功能,能够根据自然语言查询自主执行从数据发现到模型训练的完整地理空间预测工作流。该系统通过智能地理空间数据选择、多模态数据集策划以及自动化模型构建三个模块化阶段运作,在公共卫生、粮食安全、环境风险和社会经济等多项预测任务的基准测试中超越了人工专家基线。

    Why Recommended: 原文介绍了该系统如何将地理空间建模流程缩短至数分钟并提升多项预测任务的准确率,读者可以据此评估其在复杂环境和人道主义应对中的应用潜力。

  2. Google DeepMind68

    Google DeepMind 发布 Gemini Omni 1.1 Flash 视频生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,带来场景延伸、首尾帧插值、4K 超分辨率升级、360p 高效草稿生成及视频参考等多项专业级视频生成与控制功能,现已通过 Gemini API 及 Google AI Studio 面向开发者开放。

    Why Recommended: 原文给出了新模型的生成能力与接入方式,读者可以据此了解其在视频制作中的具体控制选项。

Aug 27Thu
  1. Google DeepMind60

    Google DeepMind 推出全球首个双盲 AI 评测机制

    Google DeepMind 推出全球首个专有前沿级别 AI 模型的双盲评测,通过密码学安全环境防止模型在测试前接触到评测问题。该机制与新加坡人工智能安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隐私保护环境中对 Gemini Flash Lite 模型进行保密基准测试,以提升评测的完整性。

    Why Recommended: 原文给出了基于密码学环境开展模型评测的方案,读者可以据此评估它将如何解决行业中普遍存在的基准污染问题。

  2. Google Research62

    GlucoFM:用于连续血糖监测的基础模型

    Google Research 推出了 GlucoFM,这是一个用于连续血糖监测的自监督基础模型,采用双流设计将较慢的血糖趋势与短期偏差明确分离。在多项临床预测任务评估中,GlucoFM 的 PR-AUC 表现优于对比模型,并且在餐后血糖响应预测、跨数据集迁移以及少样本适应场景中展现出优势。

    Why Recommended: Google Research 推出的 GlucoFM 能够有效分离动态并提升临床预测准确率,为研究人员在代谢健康数据建模时提供了可参考的新方法。

  3. Google DeepMind75

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,这是其迄今最精准的语音转文本模型,支持实时流式传输与预录音频处理,字错误率在流式传输和非流式场景下分别达到 4.0% 和 2.6%。该模型支持超过 85 种语言的自动检测与转录,具备智能纠错、自定义词汇识别及多说话人识别等功能,目前已在 Google AI Studio 等平台面向开发者开放公测。

    Why Recommended: 官方推出的最新语音转文本模型给出了具体的错误率和多语言支持数据,读者可以据此评估其实际语音交互性能。

Aug 17Mon
  1. Google Research65

    Google Research 推出 PhotoScan:通过智能手机影像估算心脏代谢风险

    Google Research 推出了 PhotoScan,这是一个通过标准 2D 智能手机照片估算 3D 身体成分指标(如体脂率、A/G 比和 V/S 比)的深度学习框架。该模型在英国生物银行数据上进行预训练,并利用 677 名成人的队列进行了微调;独立验证显示其在预测胰岛素抵抗方面达到了接近 DXA 扫描的准确度。

    Why Recommended: 该研究展示了利用普通手机影像估算身体成分和评估胰岛素抵抗的新方案,为降低代谢健康筛查门槛提供了技术参考。

Aug 14Fri
  1. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,这是其 Flash 系列最新的工作模型,专为编码和智能体设计。该模型在 FrontierCode、DeepSWE、WebDev Arena 等基准上显著提升准确率,且每百万输入 token 价格仅 $0.75,输出 $3.75,成本更低。

    Why Recommended: Gemini 3.7 Flash 在编码、网页开发和知识工作等领域显著提升准确率,并以更低成本提供高效工作流。

Aug 12Wed
  1. Google DeepMind62

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 发布了多语言手语转文本翻译模型 SL2T,并将其集成到 Gboard 和 Pixel 11 的 Live Transcribe 中。该模型支持将美国手语直接转换为英语文本,它基于超过 10 万小时的数据训练,通过处理姿势关节点来保护隐私并实现流式输出。

    Why Recommended: 该模型将手语翻译直接带入消费级产品,为听障用户提供了更自然的手语输入方式。

  2. Google Research63

    空书架还是丢了钥匙?研究称检索是大语言模型参数化真实性的瓶颈

    Google Research 介绍了知识 profiling 行为框架和 WikiProfile 基准,用以衡量大语言模型的编码与检索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事实已被编码,但模型仍无法直接检索其中 26% 至 34% 的事实。这说明事实性错误主要源于知识无法可靠调用的检索失败,而非知识未被编码的存储缺失。

    Why Recommended: 研究指出前沿大语言模型的知识编码已接近饱和,准确率瓶颈在于检索而非存储,为后续训练与推理优化提供了新方向。

  3. Google Research89

    Google Research 推出 AMIE (Video) 实时视频临床问诊系统

    Google Research 推出了 AMIE 的实时视频配置版本 AMIE (Video),能够基于 Gemini 和 Project Astra 进行同步临床视频问诊,感知非引导性的临床非语言线索并进行实时诊断推理。

    Why Recommended: 这项研究展示了多模态医疗AI在视频问诊中的专家级表现,为远程医疗系统的架构设计提供了实证参考。

Aug 6Thu
  1. Google DeepMind66

    Google DeepMind 发布 WeatherNext AI 模型并实现气旋预测突破

    Google DeepMind 推出了 WeatherNext AI 模型,在气旋的路径、强度和风力结构预测上达到了 SOTA 精度,平均可提供额外一天的预警时间。该研究成果已在 Nature 发表,团队宣布开源 WeatherNext 2 与 WeatherNext Cyclones 模型代码及权重。

    Why Recommended: 该模型实现了气旋路径和强度预测的大幅准确率提升,并开源了代码与权重,为气象研究和防灾减灾提供了新工具。

Jul 31Fri
  1. Google Research66

    Google Research 推出可验证自主研究框架 Science One 与证据链机制

    Google Research 推出了基于 Chain-of-Evidence 架构的自主科研框架 Science One,通过构建实时证据链与 CoE Audit 评估协议解决 AI 生成论文中的幻觉与不可复现问题。结果显示该框架在 MLE-Bench 等基准测试中实现了零幻觉引用与完全可验证的分数,同时达到了 SOTA 性能。

    Why Recommended: 原文介绍了通过证据链确保 AI 科研成果可验证的新框架,读者可以据此评估自主研究系统的可靠性边界。

Jul 30Thu
  1. Google DeepMind86

    Gemini Robotics ER 2:通过视频理解、任务编排与多机器人协作驱动机器人

    DeepMind 发布 Gemini Robotics ER 2,作为其最新的“具身推理”模型,支持持续视频理解、任务编排和多机器人协作。该模型可与任何低层 VLA 模型配合,实时调用工具(如 Google Search),并在执行过程中保持推理,显著提升任务完成率和安全性。

    Why Recommended: Gemini Robotics ER 2 通过视频理解和多机器人协作提升机器人任务完成率,展示了高效实时推理与安全控制的结合。

  2. Google DeepMind62

    Google Flow Music 推出 Lyria 3.5,提升音乐性、歌词、声乐与创作控制

    Google DeepMind 在 Google Flow Music 上发布了最新音乐生成模型 Lyria 3.5。该模型在旋律结构、歌词质量、声乐表现和发音方面都有显著提升,并新增了对节奏和时长的细粒度控制,帮助用户更轻松地创作符合预期的歌曲。

    Why Recommended: Lyria 3.5 在音乐生成方面提升了旋律、歌词、声乐质量,并提供更细粒度的节奏与时长控制,帮助创作者更精准地实现创意。

Jul 29Wed
  1. Berkeley AI Research65

    从 CUDA 到 MLX:K-Search 如何将数十年内核优化经验引入 Apple Silicon

    研究团队扩展了 K-Search 进化内核搜索框架并为其增加了 MLX 后端,通过结构化 CUDA 到 MLX 翻译层将 NVIDIA 生态的内核优化经验自动迁移至 Apple Silicon。实验表明,该方法在注意力内核上实现了接近专家的性能,在 Mamba SSM 内核的预填充阶段取得了约 20 倍的吞吐量提升。

    Why Recommended: 研究展示了如何通过结构化翻译层将 CUDA 优化经验迁移至 Apple Silicon,为异构硬件的高性能内核开发提供了可复用的方法。

Jul 28Tue
  1. Google DeepMind86

    Gemini Robotics 2 为机器人带来全身智能

    DeepMind 在博客中发布 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身视觉‑语言‑动作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。

    Why Recommended: Gemini Robotics 2 通过全身控制、精细操作和多机器人协作,展示了在复杂任务中的智能执行能力,并能在数小时内适配新机器人身体。

Jul 23Thu
  1. Google Research60

    SymptomAI:面向日常症状评估的对话式AI智能体研究

    Google Research 介绍了 SymptomAI,这是一种用于日常症状评估的对话式 AI 智能体,并在 13917 名参与者的全国规模研究中评估了其鉴别诊断性能。研究发现,由智能体主动引导提问的策略显著优于无引导的基线,且其生成的鉴别诊断结果在临床专家盲测中的准确率表现良好。此外,研究还发现 SymptomAI 的诊断结果与参与者 Fitbit 可穿戴设备的生物信号变化趋势相吻合。

    Why Recommended: 研究评估了基于大模型的对话式症状评估工具在真实患者人群中的诊断表现,并结合可穿戴设备生理指标进行了验证。

  2. Google Research70

    让量子计算机从错误中学习

    Google Research 在其 Willow 超导处理器上演示了利用强化学习实现量子计算机持续校准的方法,显著降低了逻辑错误率。实验中,RL 训练将错误率降低 3.5 倍,最终逻辑错误率低至每千个纠错周期不到一次,并在数百量子比特的模拟中验证了可扩展性。该方法将量子错误检测事件作为主动学习信号,展示了可持续计算的新范式。

    Why Recommended: 通过强化学习实现量子计算机持续校准,显著降低逻辑错误率,展示了可扩展的自适应控制方法,为未来大规模量子计算提供可行路径。