跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精選

第 1–20 條 · 共 50 條
今天10月1日週四
  1. Google DeepMind72

    Gemini 4 Argon 发布:开启前沿智能新时代

    Google DeepMind 推出了 Gemini 4 Argon,这是一款具备长推理、跨领域多模态能力的前沿模型。Argon 在软件工程、金融、法律和网络安全等行业基准上刷新记录,并已在内部工作流中提升效率;其 1M token 输出上限和 $2/百万输入、$10/百万输出的价格为开发者提供更高性价比。

    推薦理由:Gemini 4 Argon 通过大幅提升推理长度和多模态能力,显著提升软件工程、金融与网络安全等领域的工作效率,并在多项行业基准上刷新记录,帮助企业加速技术迭代。

  2. AWS Machine Learning Blog62

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作管线

    AWS 介绍了如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一个三智能体协作的音乐制作管线,实现 GPU 音乐生成、音频处理与合规筛查。文章详细讲解了容量提供者配置、共享会话的多智能体同机协作、多日持久化存储以及各智能体的独立部署流程。

    推薦理由:文章给出了基于 Amazon Bedrock AgentCore Runtime Instances 部署多智能体音乐制作管线的具体步骤与架构设计,读者可以据此了解长周期持久化与多智能体协同的实现方式。

9月29日週二
  1. AWS Machine Learning Blog62

    Grok 4.7 现已登陆 Amazon Bedrock

    xAI 的 Grok 4.7 现已在 Amazon Bedrock 上线,支持 500K 上下文窗口、四级推理努力程度配置及图文输入。该模型可通过 Responses、Chat Completions 和 Converse API 进行调用,并提供 US 区域和 Global 跨区域推理配置选项。

    推薦理由:原文介绍了 xAI Grok 4.7 在 Amazon Bedrock 上的可用性与集成细节,读者可以据此了解该模型在 Bedrock 上的调用方式与配置选项。

9月25日週五
  1. Google Research71

    Google Research 推出自动化长视频生成的多智能体框架

    Google Research 介绍了用于自动化长视频生成的多智能体框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个核心组件。该框架通过全局优化和世界状态追踪解决语义漂移与级联失败问题,能够将创意转化为分钟级、具备多镜头叙事一致性的视频。

    推薦理由:该研究通过多智能体框架解决长视频生成中的视觉一致性问题,为提升视频扩散模型的长时序叙事能力提供了可复用的系统架构参考。

  2. Google DeepMind64

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为对话式 AI 带来近实时的视觉形象与流媒体视频支持。该功能原生耦合了实时对话与低延迟视频生成,具备精确唇形同步、动态视觉形象、异步工具调用以及跨 97 种语言的原生语音同步能力,现已在 Gemini Enterprise 中可用。

  3. AWS Machine Learning Blog67

    WhisperX 在 SageMaker AI 上实现说话人标注转写

    本文介绍了 AWS WhisperX Deep Learning Container(DLC)的使用方法,演示如何在 Amazon SageMaker AI 上部署实时和异步端点,实现词级时间戳和说话人标签的转写。

    推薦理由:本文展示了如何在 SageMaker 上部署 WhisperX,实现精准的词级时间戳和说话人标签,帮助用户快速构建可搜索、可审核的音频转写系统。

9月24日週四
  1. NVIDIA Blog64

    NVIDIA 如何联合全球研究机构发布超 2800 种病毒蛋白质复合物的预测 3D 结构

    NVIDIA 联合 Google DeepMind 及欧洲生物信息研究所(EMBL-EBI)等全球研究机构,通过 AlphaFold Database 免费发布了覆盖超 2,800 种病毒的蛋白质复合物预测 3D 结构数据集。

    推薦理由:原文介绍了由 NVIDIA 与 Google DeepMind 等机构合作开源的病毒蛋白质复合物预测数据集,读者可以据此了解 AI 在生物学研究中的最新应用进展。

9月23日週三
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款全新语音生成模型,支持超过 100 种语言的自然语言提示词声音设计、30 秒声音复刻以及逐行台词精细导演。

    推薦理由:官方发布的最新语音生成模型提供了细粒度的台词导演和声音定制能力,读者可以据此评估其在多语言配音与智能体交互中的实际表现。

  2. Vercel Blog66

    Gemini 3.8 TTS模型现已在AI Gateway上线

    Gemini 3.8 Flash‑Lite TTS 与 Gemini 3.8 Flash TTS 现已在 AI Gateway 上线,支持 100 多种语言的文本转语音,支持长篇朗读、交付控制和双人对话。

    推薦理由:Gemini 3.8 TTS模型已在AI Gateway上线,支持100多种语言、长篇朗读和双人对话,开发者可通过AI SDK轻松生成语音。

9月8日週二
  1. Google DeepMind89

    Google DeepMind 发布 AlphaGenome Atlas:人类基因组变异预测图谱

    Google DeepMind 推出了 AlphaGenome Atlas 平台,包含人类基因组中 90 亿种单核苷酸变异的预测效应,并同步发布了 AlphaGenome Variant Impact 评分。该平台提供网站端口、API 以及 Google Antigravity 中的 skill,旨在帮助学术研究人员理解基因变异对分子生物学的影响。

    推薦理由:该平台预先计算了人类基因组中所有可能单核苷酸变异的分子效应预测并发布了配套评分指标,为研究人员快速评估基因变异影响提供了新资源。

9月3日週四
  1. Google DeepMind84

    Google DeepMind 发布全球天气大模型 WeatherNext 3

    Google DeepMind 和 Google Research 发布全新的全球天气大模型 WeatherNext 3,支持每小时实时卫星数据输入并提供高达 5 公里分辨率的预测。该模型在降水预测精度上取得显著提升,并增加了清洁能源变量预测,现已整合至 Search、Gemini、Maps 和 Cloud 等产品中。

    推薦理由:该模型通过融合实时卫星数据与高分辨率网格,提升了全球天气预报的精度和更新频率,为清洁能源规划和区域气象服务提供了更可靠的数据支持。

  2. Hugging Face Blog63

    NeoMME:高效的多模态原生多语言编码器

    Hugging Face 团队推出了 NeoMME,这是一个包含 260M 和 800M 参数的多语言多模态基础编码器系列。该模型不使用单独的视觉塔或因果语言模型,而是通过单个双向 Transformer 同时处理文本 token 和原始图像块。

    推薦理由:原文发布了不依赖独立视觉塔的多模态双向编码器,读者可以了解其单塔架构和检索性能。

9月2日週三
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 推出了适用于 Gemini 最新模型的智能体视频理解功能,通过动态检索视觉帧、音频和字幕,将视频分析的 token 消耗降低最高 88%、成本降低最高 66%,并将准确率提升最高 7%。

    推薦理由:原文公布了功能特性与具体优化数据,读者可以据此了解该技术如何降低视频处理成本。

8月28日週五
  1. Google DeepMind68

    Google DeepMind 发布 Gemini Omni 1.1 Flash 视频生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,带来场景延伸、首尾帧插值、4K 超分辨率升级、360p 高效草稿生成及视频参考等多项专业级视频生成与控制功能,现已通过 Gemini API 及 Google AI Studio 面向开发者开放。

    推薦理由:原文给出了新模型的生成能力与接入方式,读者可以据此了解其在视频制作中的具体控制选项。

8月27日週四
  1. Google Research62

    GlucoFM:用于连续血糖监测的基础模型

    Google Research 推出了 GlucoFM,这是一个用于连续血糖监测的自监督基础模型,采用双流设计将较慢的血糖趋势与短期偏差明确分离。在多项临床预测任务评估中,GlucoFM 的 PR-AUC 表现优于对比模型,并且在餐后血糖响应预测、跨数据集迁移以及少样本适应场景中展现出优势。

    推薦理由:Google Research 推出的 GlucoFM 能够有效分离动态并提升临床预测准确率,为研究人员在代谢健康数据建模时提供了可参考的新方法。

8月18日週二
  1. Hugging Face Blog68

    Sentence Transformers v6.0 发布,引入多向量检索与交互模型支持

    Sentence Transformers 发布 v6.0 版本,首次引入第四种模型类型 MultiVectorEncoder,用于支持 ColBERT 风格的后期交互检索。该版本允许开发者通过熟悉的 API 直接加载各类 PyLate、ColBERT 以及 ColPali 视觉文档检索模型的检查点,无需经过复杂的格式转换。

    推薦理由:该版本新增了对多向量检索模型的原生支持,读者可以通过标准接口直接加载多种主流模型的检查点并完成检索与重排。

8月17日週一
  1. Google Research65

    Google Research 推出 PhotoScan:通过智能手机影像估算心脏代谢风险

    Google Research 推出了 PhotoScan,这是一个通过标准 2D 智能手机照片估算 3D 身体成分指标(如体脂率、A/G 比和 V/S 比)的深度学习框架。该模型在英国生物银行数据上进行预训练,并利用 677 名成人的队列进行了微调;独立验证显示其在预测胰岛素抵抗方面达到了接近 DXA 扫描的准确度。

    推薦理由:该研究展示了利用普通手机影像估算身体成分和评估胰岛素抵抗的新方案,为降低代谢健康筛查门槛提供了技术参考。

8月13日週四
  1. Microsoft Research61

    Microsoft Research 推出 MindTopo 评测 VLM 的空间推理能力

    Microsoft Research 推出了新基准 MindTopo,用于评估多模态大语言模型对连通性、包围、顺序、分离和结等拓扑概念的理解。研究发现,模型在静态图像识别上的表现明显优于需要跨动作维持空间关系的交互式规划任务。

    推薦理由:研究展示了当前多模态模型在静态拓扑识别与动态规划之间存在明显差距,为提升机器人和交互环境中的空间理解能力提供了新的评估基准。

8月12日週三
  1. Google DeepMind62

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 发布了多语言手语转文本翻译模型 SL2T,并将其集成到 Gboard 和 Pixel 11 的 Live Transcribe 中。该模型支持将美国手语直接转换为英语文本,它基于超过 10 万小时的数据训练,通过处理姿势关节点来保护隐私并实现流式输出。

    推薦理由:该模型将手语翻译直接带入消费级产品,为听障用户提供了更自然的手语输入方式。