Skip to content

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精選

第 61–80 條 · 共 88 條
May 18Mon
  1. Google DeepMind86

    Google DeepMind 发布 Gemini Omni 与首款模型 Gemini Omni Flash

    Google DeepMind 推出了全新多模态模型 Gemini Omni,并发布了该系列首款模型 Gemini Omni Flash,支持通过图像、音频、视频和文本组合输入生成及编辑视频。该模型已向 Gemini app、Google Flow 以及 YouTube Shorts 用户推出,未来还将通过 API 提供给开发者和企业客户。

    Why Recommended: 原文介绍了新模型的具体输入组合和发布范围,读者可以据此评估多模态视频生成与编辑的最新能力边界。

  2. Google DeepMind86

    Google DeepMind 发布 Antigravity 2.0 独立桌面应用

    Google DeepMind 推出了全新独立桌面应用 Google Antigravity 2.0,专为智能体优化的体验而设计,摆脱了传统集成开发环境的束缚。该应用由 Gemini 模型驱动,引入了动态子代理、异步任务管理、JSON 钩子、定时任务以及基于项目的权限管理等核心功能。

    Why Recommended: 该版本脱离了传统开发环境并引入了独立桌面应用形态,读者可以据此了解智能体工具如何向通用知识工作扩展。

May 17Sun
  1. Google DeepMind63

    Google DeepMind 发布 Gemini for Science 科研工具集与实验功能

    Google DeepMind 发布 Gemini for Science,推出面向科学研究的全新工具与实验功能,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上的三个实验性原型工具。

    Why Recommended: 原文介绍了面向科研场景的全新工具集与实验功能,读者可以从中了解通用智能体如何加速科学发现流程。

  2. Google DeepMind67

    Google DeepMind 扩展内容透明度与验证工具

    Google DeepMind 在 Search、Gemini、Chrome、Pixel 及 Cloud 等产品中扩展了内容透明度与验证工具,并深化与行业伙伴的合作。官方将 SynthID 数字水印与 C2PA 内容凭证技术整合到更多生成式媒体工具及硬件设备中,并在 Google Cloud 上推出 AI 内容检测 API。

    Why Recommended: 文章详细披露了数字水印与内容凭证技术在多端产品及企业API中的落地范围,为评估跨平台内容溯源的实际可用性提供了直接依据。

May 16Sat
  1. Google DeepMind62

    Google DeepMind 博客:利用 Co-Scientist 发现治疗肝纤维化的老药新用方案

    Google DeepMind 报道了斯坦福大学遗传学家 Gary Peltz 利用 Co-Scientist 从现有药物文献中寻找肝纤维化治疗方案的研究。研究表明,Co-Scientist 提出的三个候选药物中有两个通过了实验室活体人类肝细胞测试,其中癌症药物 vorinostat 成功阻断了 91% 的肝损伤反应并促进了肝细胞再生。

    Why Recommended: 原文通过具体实验结果展示了 Co-Scientist 在老药新用研究中的应用成效,为理解 AI 在生物医药研发中的实际价值提供了具体参考。

  2. Google DeepMind64

    Google DeepMind 介绍 WeatherNext 如何协助美国国家飓风中心预测飓风梅利莎

    Google DeepMind 的天气模型 WeatherNext 成功提前五天预测了 2025 年飓风梅利莎在牙买加增强至五级强飓风的路径与强度。该模型通过结合全球天气模式与极端热带气旋数据集,兼顾了传统模型难以同时做到的路径与强度预测能力。

    Why Recommended: 文章详细记录了 AI 天气模型在飓风预报中的实际表现与提前天数,读者可以据此评估其在极端气象预测中的应用潜力。

May 12Tue
  1. Google DeepMind86

    Google DeepMind 发布多智能体科学研究系统 Co-Scientist

    Google DeepMind 发布了基于 Gemini 构建的协作式多智能体 AI 系统 Co-Scientist,旨在通过生成、辩论和演化科学假说来加速生命科学等领域的科研突破。该系统由生成、接近度、反射、排名、演化和元审查等多个专业智能体组成,并引入了类似 AlphaGo 的积分制辩论机制来验证和筛选最有潜力的研究方向。目前该系统正通过全新实验工具逐步向研究人员开放。

    Why Recommended: Google DeepMind 发布了基于 Gemini 构建的多智能体科学研究系统 Co-Scientist,读者可以了解其通过模拟科学辩论生成和演化假说的具体架构与应用效果。

May 6Wed
  1. Google DeepMind63

    Google DeepMind 公布 Gemini 驱动的智能体 AlphaEvolve 跨领域应用成果

    Google DeepMind 总结了 Gemini 驱动的编码智能体 AlphaEvolve 在科学研究、AI 基础设施优化及商业应用等领域的最新进展。该系统在基因组学测序错误校正、电网优化、量子物理模拟以及下一代 TPU 芯片设计等多个场景中显著提升了性能和效率,并正通过 Google Cloud 向各行业企业开放应用。

    Why Recommended: 原文梳理了该系统一年来的应用成果与商业拓展,读者可以据此了解其在科学研究和工程基础设施中的落地成效。

Apr 30Thu
  1. Google DeepMind64

    Google DeepMind 发布 AI co-clinician 医疗人工智能研究项目

    Google DeepMind 宣布推出 AI co-clinician 研究计划,旨在探索结合多模态能力的医疗人工智能系统,以辅助医生并提升远程医疗和临床决策的质量。该系统采用双Agent架构,在多项模拟临床评估与药物问答基准测试中展现出处理复杂医疗任务的潜力。

    Why Recommended: 原文介绍了医用人工智能研究项目的架构与仿真评估结果,读者可以了解多模态技术在医疗场景中的实际表现与安全性保障。

Apr 23Thu
  1. Google Research62

    Google 推出基于三维场景理解与生成式 AI 的照片视角重构功能

    Google 宣布在 Google Photos 的 Auto frame 功能中推出全新的照片视角重构方案,利用机器学习模型理解场景空间布局并借助生成式 AI 从新视角生成图像。该方法分为三维场景与相机估计、生成式补全与修饰两个阶段,通过估计三维点 map 并调整相机内外参来修复广角畸变和调整构图。

    Why Recommended: Google Research 公布了一种将照片解释为三维场景并自动调整相机视角与焦距的新方法,通过结合三维点图估计与生成式扩散模型,在 Google Photos 的 Auto frame 功能中实现了拍照后的视角重构与畸变修正。

Apr 22Wed
  1. Google DeepMind66

    Google DeepMind 推出 Decoupled DiLoCo:实现具弹性且分布式的 AI 训练新架构

    Google DeepMind 推出了 Decoupled DiLoCo 架构,通过将大规模训练拆分到异步运行的独立计算集群中,降低了跨数据中心训练的带宽需求并增强了硬件容错能力。测试表明,该架构使用 Gemma 4 模型在发生硬件故障时保持了高可用性,并成功在四个美国不同区域以低带宽完成了 120 亿参数模型的预训练。

    Why Recommended: 该架构通过异步计算与低带宽需求,解决了跨数据中心训练大模型的同步瓶颈与硬件故障痛点。

  2. Google Research64

    ReasoningBank:使智能体能够从经验中学习

    Google Research 推出了 ReasoningBank 智能体记忆框架,通过从成功和失败经验中提取结构化推理模式来实现测试期自我进化。该方法通过记忆感知测试期扩展(MaTTS)机制,在网页浏览和软件工程基准测试中显著提升了智能体的成功率和执行效率。

    Why Recommended: 文章介绍了从成功与失败经验中提取结构化推理模式的记忆框架,读者可以据此了解如何通过记忆增强智能体的测试期扩展能力。

Apr 16Thu
  1. Google Research62

    Google Research 推出 Simula:基于第一性原理的推理驱动合成数据集生成与评估框架

    Google Research 介绍了 Simula 框架,这是一种采用第一性原理构建整个合成数据集的种子无关且具身智能的方法。该框架通过全局多元化、局部多元化、复杂化和质量检查四个可控轴来分解生成过程,并在多个领域评估中展示了优化数据属性对下游性能的提升。

    Why Recommended: 文章介绍了通过第一性原理构建合成数据集的 Simula 框架,为解决稀缺领域的数据瓶颈提供了可编程的工作流方案。

  2. Google DeepMind73

    Gemini 3.1 Flash TTS 发布:下一代表达式 AI 语音模型

    Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表达力和音质,支持 70+ 语言和多说话人对话,并通过细粒度音频标签让开发者可用自然语言控制语音风格。该模型在人工分析 TTS 评测中获得 1,211 Elo 分,并已在 Gemini API、Vertex AI 及 Google AI Studio 预览。

    Why Recommended: Gemini 3.1 Flash TTS 通过细粒度音频标签提升可控性与表达力,支持 70+ 语言,支持多说话人对话,适合企业与开发者构建多语种语音应用,且在人工分析 TTS 评测中获得 1,211 Elo 分。

Apr 13Mon
  1. Google DeepMind75

    Gemini Robotics-ER 1.6:通过增强具身推理驱动真实世界机器人任务

    Google DeepMind 推出了 Gemini Robotics-ER 1.6,这是其专为机器人设计的最新模型,提升了空间推理、多视角理解和仪表读取能力。该版本在安全性和物理约束遵守方面也有显著改进,并已通过 Gemini API 和 Google AI Studio 对开发者开放。

    Why Recommended: Gemini Robotics-ER 1.6 通过增强空间推理和多视角理解,显著提升机器人在真实环境中的自主决策能力,并首次实现仪表读取功能,为工业设施监测提供更高精度。该模型在安全性和物理约束遵守方面也表现出显著改进,帮助机器人更安全地执行任务。

Apr 9Thu
Apr 3Fri
  1. Google DeepMind69

    Gemma 4 发布:最强开源模型

    Google DeepMind 推出了 Gemma 4,四种尺寸(E2B、E4B、26B MoE、31B Dense)支持多模态、长上下文(128K–256K)和 140+ 语言,具备高级推理、函数调用和代码生成能力,并以 Apache 2.0 许可免费开放,适用于从移动端到云端的多场景部署。

    Why Recommended: Gemma 4 以高效参数利用率和多模态能力,成为最强开源模型之一,支持从移动端到云端的多场景部署,并提供 128K–256K 上下文窗口和 140+ 语言支持,兼具函数调用和结构化 JSON 输出,满足多行业需求。

Mar 31Tue
  1. Google Research65

    Google Research 通过负责任地披露量子漏洞来保护加密货币

    Google Research 在新白皮书中指出,未来的量子计算机可能会用比此前预估更少的量子比特和门数破解保护加密货币的椭圆曲线密码学。研究团队给出了破解 ECDLP-256 的更新量子资源估算,并采用零知识证明方法在不泄露攻击细节的前提下验证漏洞,同时敦促加密货币社区向后量子密码学迁移。

    Why Recommended: 原文给出了量子计算机破解加密货币的具体资源估算和零知识证明验证方法,读者可以据此评估后量子密码学迁移的紧迫性。

Mar 29Sun
  1. Google DeepMind63

    Google DeepMind 推出 AI 时代重塑鼠标指针计划

    Google DeepMind 发布了由 Gemini 驱动的 AI 鼠标指针实验项目与交互原则,旨在让用户无需切换窗口即可通过指向和语音在 Chrome 等产品中直接调用 AI 能力。

    Why Recommended: 原文介绍了将 AI 融入鼠标指针的交互理念与实验功能,读者可以据此了解未来跨应用多模态交互的设计方向。