Skip to content

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精選

第 21–40 條 · 共 71 條
Sep 16Wed
  1. NVIDIA Blog72

    NVIDIA 发布 Vera Rubin 架构与 DSX 平台,展示 AI 工厂能效与吞吐量提升

    NVIDIA 在 AI Infra Summit 上发布了 Vera Rubin 架构与 DSX 平台,其中 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 预览测试中展现出显著的吞吐量优势。多项生态合作与基准测试显示,新平台通过电源优化和软件协同,大幅提升了每瓦 tokens 产出与 agentic ワークロード的执行效率。

    Why Recommended: 原文公布了 Vera Rubin 架构在多个基准测试中的性能表现,读者可以据此评估新一代 AI 基础设施在能效和吞吐量上的提升幅度。

Sep 15Tue
  1. Vercel Blog78

    Gemini 3.8 Live 模型現已可於 AI Gateway 使用

    Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking 現已可於 AI Gateway 使用,支援即時語音互動與多模態功能。

    Why Recommended: Gemini 3.8 Live 及其擴展思考功能可即時語音互動,開發者可透過 AI Gateway 直接使用 WebSocket 進行實時對話,提升語音助手與多模態應用的互動體驗。

Sep 12Sat
  1. OpenAI News61

    Cognition 让 Devin 用 GPT‑6 Astra 进行自测

    GPT‑6 Astra 提升 Devin 的软件测试能力,帮助工程师减少代码审查量并加速交付。Cognition 通过 GPT‑6 Astra 让 Devin 能够自动测试其自身工作并验证其正确性。

    Why Recommended: GPT‑6 Astra 提升 Devin 的软件测试能力,帮助工程师减少代码审查量并加速交付。

Sep 10Thu
Sep 9Wed
  1. OpenAI News86

    OpenAI 发布 GPT-6 Astra 模型

    OpenAI 推出 GPT-6 Astra,作为其迄今为止最具智能与对齐能力的模型,现已在 ChatGPT Work、Codex 及 API 中可用。该模型在计算机使用、浏览、软件工程及网络安全等专业任务上表现领先,API 定价为每百万输入 token 10 美元、每百万输出 token 50 美元。

    Why Recommended: 原文公布了新模型的各项能力基准、定价及企业级安全控制,读者可以据此评估其在复杂工作流中的成本效益。

Sep 3Thu
  1. Google DeepMind84

    Google DeepMind 发布全球天气大模型 WeatherNext 3

    Google DeepMind 和 Google Research 发布全新的全球天气大模型 WeatherNext 3,支持每小时实时卫星数据输入并提供高达 5 公里分辨率的预测。该模型在降水预测精度上取得显著提升,并增加了清洁能源变量预测,现已整合至 Search、Gemini、Maps 和 Cloud 等产品中。

    Why Recommended: 该模型通过融合实时卫星数据与高分辨率网格,提升了全球天气预报的精度和更新频率,为清洁能源规划和区域气象服务提供了更可靠的数据支持。

  2. Hugging Face Blog63

    NeoMME:高效的多模态原生多语言编码器

    Hugging Face 团队推出了 NeoMME,这是一个包含 260M 和 800M 参数的多语言多模态基础编码器系列。该模型不使用单独的视觉塔或因果语言模型,而是通过单个双向 Transformer 同时处理文本 token 和原始图像块。

    Why Recommended: 原文发布了不依赖独立视觉塔的多模态双向编码器,读者可以了解其单塔架构和检索性能。

Sep 2Wed
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智能体视频理解功能

    Google DeepMind 推出了适用于 Gemini 最新模型的智能体视频理解功能,通过动态检索视觉帧、音频和字幕,将视频分析的 token 消耗降低最高 88%、成本降低最高 66%,并将准确率提升最高 7%。

    Why Recommended: 原文公布了功能特性与具体优化数据,读者可以据此了解该技术如何降低视频处理成本。

Sep 1Tue
  1. Google Research63

    Google Research 发布 TimesFM-3:支持多变量预测的零样本时间序列基座模型

    Google Research 推出 TimesFM-3,这是一个拥有 3.3 亿参数、原生支持多变量预测的零样本时间序列基座模型。该模型采用解码器架构与交替注意力机制,支持单次前向传递生成整个预测区间,在 Gift-Eval、FEV-Bench 和 Time 等基准测试中表现优于其他预训练基座模型,目前已在 GitHub 和 Hugging Face 上线。

    Why Recommended: 谷歌发布了面向多变量时间序列预测的基座模型 TimesFM-3,它通过交替注意力架构和单次前向传递实现了零样本预测,在多项公开基准测试中表现领先。

Aug 28Fri
  1. Google DeepMind68

    Google DeepMind 发布 Gemini Omni 1.1 Flash 视频生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,带来场景延伸、首尾帧插值、4K 超分辨率升级、360p 高效草稿生成及视频参考等多项专业级视频生成与控制功能,现已通过 Gemini API 及 Google AI Studio 面向开发者开放。

    Why Recommended: 原文给出了新模型的生成能力与接入方式,读者可以据此了解其在视频制作中的具体控制选项。

Aug 27Thu
  1. Google DeepMind75

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,这是其迄今最精准的语音转文本模型,支持实时流式传输与预录音频处理,字错误率在流式传输和非流式场景下分别达到 4.0% 和 2.6%。该模型支持超过 85 种语言的自动检测与转录,具备智能纠错、自定义词汇识别及多说话人识别等功能,目前已在 Google AI Studio 等平台面向开发者开放公测。

    Why Recommended: 官方推出的最新语音转文本模型给出了具体的错误率和多语言支持数据,读者可以据此评估其实际语音交互性能。

Aug 25Tue
  1. Hugging Face Blog74

    Granite 4.2 LLM:构建过程

    Granite 4.2 是 IBM 推出的三种规模(3B、8B、30B)的稠密解码器推理 LLM,基于 Granite‑4.1 预训练模型,使用约 15T 令牌的五阶段训练策略,扩展上下文窗口至 512K,并通过监督微调和多阶段强化学习(包括 agentic RL)实现链式思考、工具调用与低成本思考模式。

    Why Recommended: Granite 4.2 通过多阶段 RL 训练实现强推理与工具调用能力,读者可了解其技术细节与性能提升。

Aug 12Wed
  1. Google DeepMind62

    Google DeepMind 发布手语转文本模型 SL2T

    Google DeepMind 发布了多语言手语转文本翻译模型 SL2T,并将其集成到 Gboard 和 Pixel 11 的 Live Transcribe 中。该模型支持将美国手语直接转换为英语文本,它基于超过 10 万小时的数据训练,通过处理姿势关节点来保护隐私并实现流式输出。

    Why Recommended: 该模型将手语翻译直接带入消费级产品,为听障用户提供了更自然的手语输入方式。

Aug 10Mon
  1. Hugging Face Blog86

    Meta 发布开源多模态模型 Muse Glimmer

    Meta 推出了全新的 30B 参数开源多模态模型 Muse Glimmer,采用 Apache 2.0 协议发布,专门面向本地智能体和隐私保护应用。该模型结合了 2B 的视觉感知编码器与 28B 的文本解码器,支持图像、视频理解以及多模态工具调用,并提供 transformers、llama.cpp 和 vLLM 的首日支持。

    Why Recommended: 文章详细介绍了 Meta 开源多模态模型 Muse Glimmer 的架构设计与本地部署方法,读者可以据此了解其在端侧智能体和多模态任务中的应用潜力。

Aug 6Thu
  1. Google DeepMind66

    Google DeepMind 发布 WeatherNext AI 模型并实现气旋预测突破

    Google DeepMind 推出了 WeatherNext AI 模型,在气旋的路径、强度和风力结构预测上达到了 SOTA 精度,平均可提供额外一天的预警时间。该研究成果已在 Nature 发表,团队宣布开源 WeatherNext 2 与 WeatherNext Cyclones 模型代码及权重。

    Why Recommended: 该模型实现了气旋路径和强度预测的大幅准确率提升,并开源了代码与权重,为气象研究和防灾减灾提供了新工具。

Aug 4Tue
  1. Mistral AI63

    Mistral AI 发布 3B 开源多模态安全分类模型 Shieldstral

    Mistral AI 发布了 Shieldstral,这是一款 3B 参数的开源多模态安全分类模型,采用 Apache 2.0 协议开源。该模型将内容审核转换为策略自适应的问答任务,允许在推理时通过自然语言指定策略,从而无需重新训练即可统一处理文本和图像安全评估。

    Why Recommended: 该模型通过将内容审核转化为推理时的自然语言问答任务,避免了传统方案因固定分类体系而需要重新训练的限制。

Jul 31Fri
  1. Microsoft Research84

    微软发布 Echoverse:用于计算机操作智能体的深度演化环境

    微软研究团队推出了 Echoverse,这是一个包含 10 个深度领域世界和 2 个能力世界的训练环境集合,旨在为计算机操作智能体提供高保真、状态相干且具备可信数据库验证的合成训练世界。

    Why Recommended: 微软开源了用于训练计算机操作智能体的深度演化环境 Echoverse,通过提供高保真和可复用的训练世界,为提升模型在复杂闭环工作流中的泛化能力提供了新途径。

Jul 27Mon
  1. Hugging Face Blog63

    NVIDIA 发布 Cosmos-H-Dreams 实时生成式手术机器人模拟器

    NVIDIA 推出 Cosmos-H-Dreams,这是一个针对手术机器人的实时、动作条件生成式模拟器。该模型将 Cosmos-H-Surgical-Simulator 的能力蒸馏为因果学生模型,并通过 FlashDreams 库在单张 NVIDIA RTX PRO 6000 GPU 上实现每秒约 160 帧的交互式运行,支持在闭环中进行策略评估和数据生成。

    Why Recommended: 官方推出的实时动作条件生成模拟器展示了手术机器人的交互式环境,读者可以据此了解世界模型在医疗机器人领域的实时推理与应用进展。

Jul 21Tue
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延迟支撑大规模 AI 智能体工作流。

    Why Recommended: 官方发布了三个新的 Gemini Flash 系列模型,给出了详细的性能指标与价格,读者可以据此评估其在智能体工作流和高吞吐任务中的成本与效率。