Skip to content

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

126條精選相關主題模型发布行业动态AI 编码

最新精選

第 61–80 條 · 共 126 條
Aug 27Thu
  1. Google DeepMind60

    Google DeepMind 推出全球首个双盲 AI 评测机制

    Google DeepMind 推出全球首个专有前沿级别 AI 模型的双盲评测,通过密码学安全环境防止模型在测试前接触到评测问题。该机制与新加坡人工智能安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隐私保护环境中对 Gemini Flash Lite 模型进行保密基准测试,以提升评测的完整性。

    Why Recommended: 原文给出了基于密码学环境开展模型评测的方案,读者可以据此评估它将如何解决行业中普遍存在的基准污染问题。

Aug 25Tue
  1. Hugging Face Blog63

    Gradio 发布 gr.Workflow 功能,将 AI 流水线转为可视化画布与 API

    Gradio 推出内置的 gr.Workflow 功能,允许开发者将 AI 应用步骤描述为类型化节点的图,提供可运行的拖拽画布、实时中间结果展示及一键部署到 Hugging Face Spaces 的能力。该工作流同时自动生成 REST API,支持通过 Python 客户端或 cURL 直接调用。

    Why Recommended: G gradio 推出了内置的 gr.Workflow 功能,把复杂的 AI 流水线变成可视化的拖拽画布,同时自动生成 REST API 并在 Hugging Face Spaces 上线。

Aug 21Fri
  1. Hugging Face Blog62

    Hugging Face 升级 Papers with Code 搜索引擎架构,结合混合检索与向量服务

    Hugging Face 宣布重构 Papers with Code 搜索引擎,采用混合检索系统结合 PostgreSQL、pgvector 与 reciprocal rank fusion(RRF)算法,提升论文检索效果。

    Why Recommended: 文章详细拆解了基于混合检索的论文搜索引擎架构,展示了如何通过离线任务与在线服务的拆分来兼顾吞吐量和低延迟,为类似工程实践提供了可复用的系统设计范本。

Aug 20Thu
  1. Mistral AI75

    Agentic Search:为 AI 系统提供更准确、更高效的检索结果

    Mistral AI 推出了 Agentic Search,利用多步检索循环在 FinanceBench 和 OfficeQA Pro 基准上显著提升检索准确率,并降低 token 使用和延迟。该功能通过搜索、打开、导航、读取和 grep 五个工具,让模型在复杂文档中进行迭代检索,支持敏感领域数据,并可通过 Mistral Search Toolkit 在云端或本地部署。

    Why Recommended: Agentic Search 通过多步检索循环显著提升金融文件检索准确率,帮助企业在敏感数据上实现更高效的 AI 交互,并在复杂文档中实现精准导航。

Aug 18Tue
  1. Hugging Face Blog68

    Sentence Transformers v6.0 发布,引入多向量检索与交互模型支持

    Sentence Transformers 发布 v6.0 版本,首次引入第四种模型类型 MultiVectorEncoder,用于支持 ColBERT 风格的后期交互检索。该版本允许开发者通过熟悉的 API 直接加载各类 PyLate、ColBERT 以及 ColPali 视觉文档检索模型的检查点,无需经过复杂的格式转换。

    Why Recommended: 该版本新增了对多向量检索模型的原生支持,读者可以通过标准接口直接加载多种主流模型的检查点并完成检索与重排。

  2. Hugging Face Blog66

    Dharma AI 推出 GPU 管理调度器:通过优化分配顺序显著提升集群利用率

    Dharma AI 推出一种约束感知 GPU 分配器,通过将实时推理需求建模为动态曲线并结合优先级调度,在不更换硬件的情况下使集群利用率提升高达 33 个百分点。该分配器在多个基准测试中展现出更高的吞吐量与优先级加权产出,同时保持极低的决策延迟。

    Why Recommended: 原文介绍了约束感知 GPU 分配器的设计与多场景基准测试结果,读者可以了解如何通过优化调度顺序提升集群利用率。

Aug 17Mon
  1. Google Research65

    Google Research 推出 PhotoScan:通过智能手机影像估算心脏代谢风险

    Google Research 推出了 PhotoScan,这是一个通过标准 2D 智能手机照片估算 3D 身体成分指标(如体脂率、A/G 比和 V/S 比)的深度学习框架。该模型在英国生物银行数据上进行预训练,并利用 677 名成人的队列进行了微调;独立验证显示其在预测胰岛素抵抗方面达到了接近 DXA 扫描的准确度。

    Why Recommended: 该研究展示了利用普通手机影像估算身体成分和评估胰岛素抵抗的新方案,为降低代谢健康筛查门槛提供了技术参考。

Aug 14Fri
  1. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,这是其 Flash 系列最新的工作模型,专为编码和智能体设计。该模型在 FrontierCode、DeepSWE、WebDev Arena 等基准上显著提升准确率,且每百万输入 token 价格仅 $0.75,输出 $3.75,成本更低。

    Why Recommended: Gemini 3.7 Flash 在编码、网页开发和知识工作等领域显著提升准确率,并以更低成本提供高效工作流。

Aug 13Thu
Aug 11Tue
  1. Hugging Face Blog68

    想用 ACE 吗?ALTK-Evolve 用更少 Token 实现

    Hugging Face 博客介绍了 ALTK-Evolve 库,该库通过高效的记忆检索实现与 ACE 相比更低的 Token 消耗,同时保持或提升准确率。ALTK-Evolve 与 ACE 都利用代理自身轨迹学习,但在记忆构建和交付方式上不同:ACE 采用完整的 playbook 注入,而 ALTK-Evolve 只检索模型可用的指导原则,从而显著降低推理 token。

    Why Recommended: ALTK-Evolve 在保持或提升准确率的同时,显著降低推理 token 消耗,展示了高效记忆检索的可行性。

  2. Mistral AI73

    Mistral 推出区域推理、开放模型与欧洲主权 AI 基础设施

    Mistral AI 宣布推出区域推理端点和优先服务层,支持在欧洲或美国运行推理,并提供 1 GW 计算容量目标。公司还将平台开放给第三方模型,首批支持 Z.ai 的 GLM‑5.2,所有模型均在同一基础设施下满足区域控制与 SLA。为保障欧洲长期 AI 计算需求,Mistral 正与企业组建联盟,形成欧洲计算单元(ECU)以锁定多年容量。

    Why Recommended: Mistral 推出区域推理端点和开放模型支持,帮助企业实现 AI 主权与合规。

  3. Hugging Face Blog77

    构建低延迟多语种语音代理:NVIDIA Magpie TTS 开放权重与完整部署控制

    NVIDIA 发布了 Magpie TTS 多语种文本转语音模型,支持12种语言,并提供开放权重与本地部署能力。该模型在单流 GPU 上可实现 32–79 ms 的首音延迟,64 并发流下可达 239 ms,吞吐率高达 320× 实时。

    Why Recommended: 开放权重与低延迟让企业可在本地部署多语种语音代理,支持12种语言并提供高质量音频,帮助企业实现低延迟、可定制的多语种语音代理。

Aug 4Tue
  1. Microsoft Research86

    Microsoft Research 发布开源智能体框架 Orchard

    Microsoft Research 推出了开源的可扩展智能体框架 Orchard,其核心是提供可重用环境服务的 Kubernetes 架构 Orchard Env,支持在真实部署 harnesses 中直接训练智能体。项目同步开源了三个领域的训练方案与数据,其中 Orchard-SWE 在 SWE-bench Verified 上取得了 69.7% 的表现。

    Why Recommended: 微软研究院开源了可扩展智能体框架 Orchard,并提供覆盖软件工程、网页浏览和个人助理的完整训练方案,降低了智能体研究的基建门槛。

Jul 30Thu
  1. Google DeepMind86

    Gemini Robotics ER 2:通过视频理解、任务编排与多机器人协作驱动机器人

    DeepMind 发布 Gemini Robotics ER 2,作为其最新的“具身推理”模型,支持持续视频理解、任务编排和多机器人协作。该模型可与任何低层 VLA 模型配合,实时调用工具(如 Google Search),并在执行过程中保持推理,显著提升任务完成率和安全性。

    Why Recommended: Gemini Robotics ER 2 通过视频理解和多机器人协作提升机器人任务完成率,展示了高效实时推理与安全控制的结合。

  2. Google DeepMind62

    Google Flow Music 推出 Lyria 3.5,提升音乐性、歌词、声乐与创作控制

    Google DeepMind 在 Google Flow Music 上发布了最新音乐生成模型 Lyria 3.5。该模型在旋律结构、歌词质量、声乐表现和发音方面都有显著提升,并新增了对节奏和时长的细粒度控制,帮助用户更轻松地创作符合预期的歌曲。

    Why Recommended: Lyria 3.5 在音乐生成方面提升了旋律、歌词、声乐质量,并提供更细粒度的节奏与时长控制,帮助创作者更精准地实现创意。

Jul 28Tue
  1. Google DeepMind86

    Gemini Robotics 2 为机器人带来全身智能

    DeepMind 在博客中发布 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身视觉‑语言‑动作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。

    Why Recommended: Gemini Robotics 2 通过全身控制、精细操作和多机器人协作,展示了在复杂任务中的智能执行能力,并能在数小时内适配新机器人身体。

Jul 23Thu
  1. Hugging Face Blog65

    Hugging Face Diffusers 现已原生支持 Nunchaku 4 比特扩散模型推理

    Hugging Face 发布了对 Nunchaku 4 比特扩散推理的原生支持,允许用户通过标准 from_pretrained 方法直接加载量化检查点,无需本地 CUDA 编译。

    Why Recommended: 原文介绍了如何在主流扩散模型库中原生加载 4 比特量化检查点,这为在消费级硬件上运行大模型提供了轻量化方案。

Jul 21Tue
  1. Hugging Face Blog65

    Hugging Face 发布开源机器人操作数据采集系统 Grabette

    Hugging Face 推出开源、低成本的机器人操作数据采集系统 Grabette,允许用户通过手持夹爪和相机快速录制任务并自动生成机器人就绪的数据集。该系统包含手持录制设备 Grabette 与配套的机器人夹爪端侧执行器 Gripette,采用模块化标准传感器构建,并已接入 Hugging Face Hub 与 LeRobot 训练生态。

    Why Recommended: 该开源系统降低了机器人操作数据的采集门槛,为社区协作收集具身智能训练数据提供了低成本方案。

Jul 15Wed
  1. Hugging Face Blog75

    推出 Real World VoiceEQ:衡量语音 AI 的人类质量

    Hugging Face 发布了 Real World VoiceEQ,一个评估语音 AI 人类质量的基准,涵盖 60 多项指标,覆盖 40 多个模型。该基准基于 100 万条人类评分,评估 15+ 维度的 ASR、TTS、S2S 和 Speech Understanding,帮助开发者识别情感、背景噪声等细粒度缺陷。

    Why Recommended: Real World VoiceEQ 提供了超过 60 项指标的真实人类评估,帮助开发者识别模型在情感、背景噪声等方面的细粒度缺陷。