Skip to content

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精選

第 61–80 條 · 共 102 條
Jul 28Tue
  1. Google DeepMind86

    Gemini Robotics 2 为机器人带来全身智能

    DeepMind 在博客中发布 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身视觉‑语言‑动作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。

    Why Recommended: Gemini Robotics 2 通过全身控制、精细操作和多机器人协作,展示了在复杂任务中的智能执行能力,并能在数小时内适配新机器人身体。

Jul 22Wed
Jul 21Tue
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延迟支撑大规模 AI 智能体工作流。

    Why Recommended: 官方发布了三个新的 Gemini Flash 系列模型,给出了详细的性能指标与价格,读者可以据此评估其在智能体工作流和高吞吐任务中的成本与效率。

Jul 17Fri
  1. Google DeepMind63

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 推出了基于 3.5 Flash 构建并针对网络安全任务微调的轻量化模型 Gemini 3.5 Flash Cyber,旨在帮助防御者快速发现、验证和修补软件漏洞。

    Why Recommended: Google DeepMind 推出了专为网络安全微调的轻量化模型,通过支持高频率和多轮调用,在多个安全基准上展现了优于 mainline 模型和部分竞品的漏洞挖掘能力。

Jul 16Thu
  1. Hugging Face Blog84

    Hugging Face 披露 2026 年 7 月安全事件

    Hugging Face 官方披露了一起在 2026 年 7 月发生的由自治智能体驱动的生产基础设施入侵事件。攻击者利用数据集处理流程中的代码执行路径获取初始访问权限,随后在多个内部集群中进行横向移动。Hugging Face 通过自主 AI 系统检测并剖析了该事件,修复了根本漏洞,撤销并轮换了受影响的凭据。

Jul 15Wed
  1. Hugging Face Blog81

    Thinking Machines 发布 Inkling 与 Inkling‑Small 模型

    Thinking Machines 在 Hugging Face 发布了 Inkling 与 Inkling‑Small 两个多模态 LLM。Inkling 是 1T 参数、1M 上下文窗口的开源模型,支持图像、文本、音频输入,并具备 agentic 能力。

    Why Recommended: Inkling 通过支持 1M 上下文窗口和多模态输入,提供了大规模开源模型的高效推理与部署方案,帮助开发者快速构建跨模态推理应用。在 Hugging Face 平台上可一键部署,支持多种推理引擎,满足大规模推理需求,并提供 1M 上下文窗口的高效推理体验,适合多模态推理与微调场景。

Jul 7Tue
  1. Berkeley AI Research62

    Intelligence is Free, Now What? Data Systems for, of, and by Agents

    伯克利人工智能研究院(BAIR)团队探讨了推理成本大幅下降后数据系统面临的新机遇与新挑战,指出未来数据系统需要围绕 Agent 的交互、底层协同及自主合成三个维度进行彻底重构。文章重点分析了 Agent 推理带来的高并发复杂查询需求、多 Agent 协作所需的状态管理机制以及利用 Agent 从零自主合成专用数据系统的方法。

    Why Recommended: 文章探讨了零成本推理时代对数据系统的影响,提出了面向、由和基于 Agent 的三大数据系统设计方向,为理解未来智能基础设施演进提供了前瞻视角。

  2. Hugging Face Blog85

    Hugging Face 发布 LeRobot v0.6.0:引入世界模型与统一评测

    LeRobot v0.6.0 引入了世界模型策略、全新的视觉语言动作模型和统一的奖励模型 API,同时带来了六大仿真评测基准、全新的部署命令行工具以及深度感知和数据自动标注能力。此次更新还优化了数据集加载速度,实现了完全分片数据并行训练和云端训练支持,并大幅精简了基础安装包的依赖。

    Why Recommended: 该版本闭环了机器人学习流程,用户可以据此了解开源机器人框架在世界模型和评测方面的新能力。

Jun 25Thu
  1. Google DeepMind64

    Google DeepMind 推出 Gemini 3.5 Flash 内置 computer use 功能

    Google DeepMind 宣布在 Gemini 3.5 Flash 中内置 computer use 功能,使其能够跨浏览器、移动端和桌面环境执行智能体任务。该功能支持长周期和企业自动化场景,并通过对抗性训练与可选的企业安全保护系统来降低提示词注入等风险。开发者现可通过 Gemini API 和 Gemini Enterprise Agent Platform 开始构建相关应用。

    Why Recommended: 官方将 computer use 能力直接集成至主模型,开发者可据此构建能跨平台操作的自定义智能体。

Jun 24Wed
Jun 23Tue
  1. Mistral AI81

    Mistral AI 发布 Mistral OCR 4 文档解析模型

    Mistral AI 发布 Mistral OCR 4 模型,提供文档解析功能,除提取文本外还返回边界框、块分类和行内置信度分数。该模型支持 170 种语言,可在单容器中运行以用于自托管部署,并通过 API 或 Document AI 提供支持。

    Why Recommended: 该模型支持多语言及单容器私有化部署,为企业级检索和智能体工作流提供了带边界框和置信度的结构化文档解析能力。

Jun 5Fri
  1. Google Research64

    Gemini Enterprise Agent Platform 发布 Agentic RAG 提升可靠响应

    Google Research 推出了 Gemini Enterprise Agent Platform 的 Agentic RAG,利用多代理协同、规划与足够上下文机制,提升多源多跳查询的准确率至 34%,在跨语料库实验中保持 90.1% 的高准确率,且延迟与单语料库版本相近。该功能已作为公开预览提供。

    Why Recommended: 该系统在多源多跳查询中将准确率提升至 34%,为企业工作流提供更可靠的答案,并在跨语料库场景下保持 90.1% 的高准确率。

May 29Fri
  1. Google Research69

    Google Research 在 I/O 2026 上开启新发现时代

    Google Research 在 I/O 2026 上公布了多款 AI 工具与模型,涵盖科研加速、健康应用、边缘计算与气候预测等领域。

    Why Recommended: Google Research 在 I/O 2026 上公布多款 AI 工具与模型,展示了从科研到产品的快速落地与实际影响,凸显代理式编码与多模态推理在科学与日常应用中的变革潜力,并为全球科研社区提供了可扩展的实验平台。

May 28Thu
  1. Mistral AI68

    Mistral AI 在 AI Now Summit 2026 发布工业工程 AI 堆栈与 Vibe 代理

    Mistral AI 在 AI Now Summit 2026 发布面向工业工程的全栈 AI 解决方案,并与空中客车、宝马集团和 ASML 合作,支持从设计到生产的安全高效工作流。新推出的 Vibe 代理可处理长周期任务,如编码与研究;法国 Les Ulis 10 MW 数据中心将于 2026 年第三季度投入使用,提升推理与安全控制。

    Why Recommended: Mistral 推出面向工业工程的 AI 堆栈和 Vibe 代理,展示如何在航空、汽车和半导体领域实现安全、高效的设计与生产。

  2. Mistral AI74

    Vibe 开始工作

    Vibe 是 Mistral 推出的统一 AI 代理,兼顾工作与编码。它提供 Work Mode 处理多步企业任务(如收件箱、日历、研究、文档起草)以及 Code Mode 进行远程编码(从功能开发到拉取请求),并可通过 VS Code、CLI 和 Web 进行无缝协作。

    Why Recommended: Vibe 将工作与编码整合为单一智能体,支持多步任务、可视化推理与可扩展部署,适合企业与个人使用

May 22Fri
  1. Mistral AI87

    Mistral AI 发布 Mistral Medium 3.5 与 Vibe 云端异步智能体

    Mistral AI 推出 128B 开源旗舰模型 Mistral Medium 3.5,具备 256k 上下文窗口、可配置推理强度以及从头训练的视觉编码器,并在 SWE-Bench Verified 上取得 77.6% 的成绩。

    Why Recommended: Mistral Medium 3.5 的发布和云端异步智能体能力的上线,展示了如何通过长上下文与多工具调用降低开发者的任务阻塞成本。

  2. Mistral AI83

    Mistral AI 发布 Studio 平台 Connectors 功能

    Mistral AI 在 Studio 中推出 Connectors 功能,支持开发者使用内置与自定义 MCP 构建企业级 AI 应用。该功能提供 API/SDK 接入、直接工具调用、人机协同审批流及统一的集中注册管理,适用于各类对话、智能体及复杂工作流。

    Why Recommended: 该功能将企业级数据集成统一封装为可重用的 MCP 实体,减少了重复开发和鉴权成本,为构建复杂智能体工作流提供了标准化方案。

May 18Mon
  1. Google DeepMind86

    Google DeepMind 发布 Antigravity 2.0 独立桌面应用

    Google DeepMind 推出了全新独立桌面应用 Google Antigravity 2.0,专为智能体优化的体验而设计,摆脱了传统集成开发环境的束缚。该应用由 Gemini 模型驱动,引入了动态子代理、异步任务管理、JSON 钩子、定时任务以及基于项目的权限管理等核心功能。

    Why Recommended: 该版本脱离了传统开发环境并引入了独立桌面应用形态,读者可以据此了解智能体工具如何向通用知识工作扩展。

May 17Sun
  1. Google DeepMind63

    Google DeepMind 发布 Gemini for Science 科研工具集与实验功能

    Google DeepMind 发布 Gemini for Science,推出面向科学研究的全新工具与实验功能,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上的三个实验性原型工具。

    Why Recommended: 原文介绍了面向科研场景的全新工具集与实验功能,读者可以从中了解通用智能体如何加速科学发现流程。

May 16Sat