Skip to content

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精選

第 81–100 條 · 共 102 條
May 12Tue
  1. Google DeepMind86

    Google DeepMind 发布多智能体科学研究系统 Co-Scientist

    Google DeepMind 发布了基于 Gemini 构建的协作式多智能体 AI 系统 Co-Scientist,旨在通过生成、辩论和演化科学假说来加速生命科学等领域的科研突破。该系统由生成、接近度、反射、排名、演化和元审查等多个专业智能体组成,并引入了类似 AlphaGo 的积分制辩论机制来验证和筛选最有潜力的研究方向。目前该系统正通过全新实验工具逐步向研究人员开放。

    Why Recommended: Google DeepMind 发布了基于 Gemini 构建的多智能体科学研究系统 Co-Scientist,读者可以了解其通过模拟科学辩论生成和演化假说的具体架构与应用效果。

May 6Wed
  1. Google DeepMind63

    Google DeepMind 公布 Gemini 驱动的智能体 AlphaEvolve 跨领域应用成果

    Google DeepMind 总结了 Gemini 驱动的编码智能体 AlphaEvolve 在科学研究、AI 基础设施优化及商业应用等领域的最新进展。该系统在基因组学测序错误校正、电网优化、量子物理模拟以及下一代 TPU 芯片设计等多个场景中显著提升了性能和效率,并正通过 Google Cloud 向各行业企业开放应用。

    Why Recommended: 原文梳理了该系统一年来的应用成果与商业拓展,读者可以据此了解其在科学研究和工程基础设施中的落地成效。

Apr 27Mon
  1. Mistral AI77

    Mistral AI 发布企业级 AI 编排层 Workflows

    Mistral AI 宣布 Workflows 进入公开预览阶段,作为 Studio 的一部分为企业 AI 提供持久化执行、可观测性和容错能力。开发者使用 Python 编写工作流,支持通过 Le Chat 触发,底层基于 Temporal 构建并采用控制面与数据面分离的部署模型。

    Why Recommended: 原文给出了架构设计和落地案例,读者可以据此评估其在生产环境中的编排能力。

Apr 22Wed
  1. Google Research64

    ReasoningBank:使智能体能够从经验中学习

    Google Research 推出了 ReasoningBank 智能体记忆框架,通过从成功和失败经验中提取结构化推理模式来实现测试期自我进化。该方法通过记忆感知测试期扩展(MaTTS)机制,在网页浏览和软件工程基准测试中显著提升了智能体的成功率和执行效率。

    Why Recommended: 文章介绍了从成功与失败经验中提取结构化推理模式的记忆框架,读者可以据此了解如何通过记忆增强智能体的测试期扩展能力。

Apr 9Thu
Apr 3Fri
  1. Google DeepMind69

    Gemma 4 发布:最强开源模型

    Google DeepMind 推出了 Gemma 4,四种尺寸(E2B、E4B、26B MoE、31B Dense)支持多模态、长上下文(128K–256K)和 140+ 语言,具备高级推理、函数调用和代码生成能力,并以 Apache 2.0 许可免费开放,适用于从移动端到云端的多场景部署。

    Why Recommended: Gemma 4 以高效参数利用率和多模态能力,成为最强开源模型之一,支持从移动端到云端的多场景部署,并提供 128K–256K 上下文窗口和 140+ 语言支持,兼具函数调用和结构化 JSON 输出,满足多行业需求。

Mar 31Tue
  1. Mistral AI65

    Mistral AI 发布 Spaces:为人类与智能体构建的命令行工具

    Mistral AI 推出了专为人类开发者与智能体共同设计的命令行工具 Spaces,通过将交互式输入转化为标志、建立基于插件的结构化数据接口以及自动生成项目上下文文件,实现了工具的高效协同与自主运行。

    Why Recommended: 文章介绍了 Mistral AI 开发 Spaces 命令行工具的经验,阐述了通过将交互式输入映射为标志、设计基于插件的数据结构以及生成项目上下文文件,使开发者工具同时适配人类与智能体,从而提升整体可复用性的设计原则。

Mar 18Wed
  1. Google Research61

    Google Research 在 The Check Up 活动上公布医疗健康 AI 最新突破

    Google Research 在 The Check Up 活动上公布了医疗健康领域的最新研究进展,涵盖个性化医疗、临床协作、开发者生态、公共卫生及生物医学发现。

    Why Recommended: Google Research 公布了医疗健康领域的最新研究成果与进展,读者可以据此了解其技术在临床、公共卫生和生物医药方面的实际应用方向。

  2. Mistral AI69

    Mistral AI 推出 Forge 企业级 AI 模型构建系统

    Mistral AI 推出 Forge,一套面向企业的 AI 模型构建系统,帮助组织在自有数据上训练、微调并持续改进专属模型。Forge 覆盖预训练、后训练、强化学习等全生命周期,支持 dense 与 MoE 架构、多模态输入,并以 Agent 为先设计,适用于政府、金融、软件、制造等多行业场景。

    Why Recommended: Forge 让企业能在自有数据上训练专属模型,提升内部流程自动化与合规性,并通过持续强化学习实现模型与业务目标的动态对齐。

Mar 17Tue
  1. Mistral AI84

    发布 Mistral Small 4

    Mistral AI 发布了 Mistral Small 4,这是一款统一推理、多模态与编码功能的模型,采用 119B 参数、256k 上下文窗口,支持可配置推理强度,提供 40% 的延迟降低和 3 倍的吞吐量提升。该模型采用 Apache 2.0 许可,支持 vLLM、llama.cpp、SGLang 等开源框架,并已加入 NVIDIA Nemotron 联盟。

    Why Recommended: Mistral Small 4 将推理、多模态与编码功能统一,提供可配置推理强度和高效推理,帮助用户在单一模型中完成多种任务。

  2. Mistral AI68

    Leanstral 发布开源可信 Vibe 编码基础

    Leanstral 是 Mistral AI 推出的首款专为 Lean 4 设计的开源代码代理,采用 6B 活跃参数,支持在 Mistral Vibe 中零设置使用,并提供免费 API 端点。

    Why Recommended: Leanstral 以 6B 参数实现高效 Lean 4 代码生成,成本低于主流模型,展示了开源代码代理在正式验证场景中的可行性。

Mar 12Thu
  1. Google Research66

    AMIE 对话式诊断 AI 在真实临床环境中的可行性研究

    Google Research 在 Beth Israel Deaconess Medical Center 进行了一项单中心前瞻性可行性研究,评估其对话式诊断 AI AMIE 在门诊前访谈中的安全性与实用性。研究共招募 100 名成人患者,零安全停机事件,AMIE 的诊断准确率在前 7 名中达 90%,并获得患者与医生的高度接受度。

    Why Recommended: 该研究首次在真实临床环境中验证了对话式诊断 AI 的可行性与安全性,为未来大规模临床试验奠定基础,并显示患者与医生接受度高,提示其在临床决策支持中的价值。

Mar 11Wed
  1. Mistral AI66

    Mistral AI 推出自主 Rails 测试智能体:为不愿写测试的开发者自动编写 RSpec

    Mistral AI 推出了基于开源编码助手 Vibe 构建的自主测试智能体,能够自动为 Ruby on Rails 代码库生成、验证和改进 RSpec 测试。该智能体通过仓库级上下文、分类技能文件以及 RuboCop 和 SimpleCov 自定义工具,在包含 275 个文件的真实代码库测试中实现了 100% 的代码覆盖率和通过率。

    Why Recommended: 原文介绍了团队如何基于开源编码助手构建自主测试生成智能体,读者可以了解如何通过上下文工程、专用技能和自定义工具来扩展智能体能力。

Jan 28Wed
  1. Mistral AI64

    Mistral AI 发布 Mistral Vibe 2.0 与 Devstral 2 模型

    Mistral AI 发布终端原生编码智能体 Mistral Vibe 2.0,搭载 Devstral 2 模型系列并带来自定义子智能体、多项选择澄清、斜杠命令技能与统一智能体模式。该版本现已上线 Le Chat Pro 与 Team 计划,支持按量付费和自带 API 密钥,Devstral 2 也同步转入 Mistral Studio 的付费 API 访问。

    Why Recommended: 官方发布了基于新模型的代码智能体重大升级,用户可以根据具体需求自定义子智能体和工作流。

Oct 24Fri
  1. Mistral AI63

    Mistral AI 发布面向企业的生产级 AI 平台 Mistral AI Studio

    Mistral AI 推出面向企业的生产级 AI 平台 Mistral AI Studio,旨在解决企业 AI 从原型落地到生产环境的可靠性、可观测性和治理难题。该平台构建了三大核心支柱:提供流量监控与评估的 Observability、基于 Temporal 构建且具备状态容错的 Agent Runtime,以及用于全生命周期资产版本控制与审计的 AI Registry。

    Why Recommended: 原文介绍了 Mistral AI Studio 的三大支柱与功能,读者可以据此了解其如何解决企业 AI 从原型走向生产的落地瓶颈。

Sep 2Tue
  1. Mistral AI63

    Le Chat 发布自定义 MCP 连接器与记忆功能

    Le Chat 发布了 20+ 以上安全 MCP 连接器和记忆功能,支持在聊天中直接搜索、总结并操作 Databricks、Snowflake、GitHub 等企业工具,并可跨会话保持个性化上下文。连接器目录覆盖数据、生产力、开发、自动化、商务等领域,用户可自定义扩展并在本地或云端部署。记忆功能在免费计划中可用,支持快速导入 ChatGPT 记忆并提供完整的增删改控制。

    Why Recommended: Le Chat 新增 20+ MCP 连接器和记忆功能,帮助企业在聊天中直接操作关键工具并保持上下文记忆。

Jul 15Tue
  1. Mistral AI86

    Mistral AI 发布开源语音理解模型 Voxtral

    Mistral AI 发布了开源语音理解模型 Voxtral,包含面向生产的 24B 规格与面向端侧的 3B 规格,均采用 Apache 2.0 协议开源。该系列模型支持 32k 上下文、长达 30 至 40 分钟的音频处理、内置问答与摘要、多语言处理及函数调用功能,并在多项语音转写和理解基准测试中表现优异。

    Why Recommended: 该模型提供了两种尺寸并开源,读者可以根据自身算力条件选择合适的版本进行本地部署或调用 API。

Jul 11Fri
  1. Mistral AI62

    Mistral AI 发布 Devstral Medium 并升级 Devstral Small

    Mistral AI 与 All Hands AI 合作推出了 Devstral Medium 并升级了 Devstral Small 1.1。Devstral Small 1.1 采用 Apache 2.0 协议开源,在 SWE-Bench Verified 上获得 53.6% 的分数;Devstral Medium 在 API 上线,得分达 61.6%,支持私有化部署与自定义微调。

    Why Recommended: 该发布提供了两款代码智能体新模型的详细性能和价格信息,读者可以借此评估它们在特定开发任务中的性价比。

Jun 4Wed
  1. Mistral AI63

    Mistral AI 发布 Mistral Code 编码助手

    Mistral AI 发布了企业级 AI 编码助手 Mistral Code,整合了 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四款模型,提供 IDE 插件、本地化部署及企业级管理工具。

    Why Recommended: 官方推出的企业级编码助手整合了多款主力模型与本地部署选项,读者可以据此了解其在安全合规与多步骤推理方面的架构设计。

May 27Tue
  1. Mistral AI77

    Mistral AI 发布 Agents API

    Mistral AI 发布全新的 Agents API,提供代码执行、网页搜索、图像生成、文档库与 MCP 工具等内置连接器,支持持久化记忆、多智能体协作编排及状态化对话管理。

    Why Recommended: 官方推出的 Agents API 整合了内置连接器与 MCP 工具,为开发者构建企业级智能体提供了完整的端到端框架。