Skip to content

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精選

第 41–60 條 · 共 102 條
Sep 12Sat
  1. GitHub Blog · AI & ML62

    Marketing ops as code:在 GitHub 上将活动从规划到跟进全流程自动化

    GitHub 营销负责人分享了如何利用 GitHub Copilot、GitHub Actions 及 API/CLI 工具将亚太区的活动运营流程实现代码化与自动化。通过将运行手册转化为 Markdown 技能并结合 Issue 触发器,系统能够自动生成落地页、分发 UTM 链接、每日筛查注册名单以及在活动后执行跟进。

    Why Recommended: 作者通过自身实践展示了如何用自然语言和平台原生功能自动化营销运营,为非技术背景人员提供了可复用的工作流改造方法。

Sep 11Fri
  1. Google Research64

    ToolGrad:通过文本梯度实现高效工具使用数据集生成

    Google Research 介绍了 ToolGrad 框架,这是一种采用“先生成工具使用链、再反向标注用户提示词”的答案优先范式,能够以更低成本高效生成复杂的智能体工具使用数据集。

    Why Recommended: 该研究提出了一种反向生成智能体工具使用数据集的方法,通过文本梯度迭代构建工作流,为解决合成数据成本与可扩展性瓶颈提供了新路径。

Sep 10Thu
  1. OpenAI News64

    Data agent 在 ChatGPT Work 中上线,企业可用自然语言查询数据并生成仪表盘

    OpenAI 在 ChatGPT Work 中推出 Data agent,支持连接公司数据、用自然语言查询并生成交互式仪表盘。该功能让用户无需编写代码即可获取洞察,提升数据可视化效率。

    Why Recommended: 官方发布的 Data agent 让企业能用自然语言直接查询数据并生成交互式仪表盘,降低数据分析门槛,提升决策效率,并支持多维度数据可视化。

  2. OpenAI News65

    OpenAI 推出 Agents API

    OpenAI 推出了 Agents API 托管服务,支持基于 Codex 框架进行任务编排、长会话和工具调用,帮助开发者构建和部署云端智能体。

    Why Recommended: 官方推出的托管服务直接面向云端智能体开发需求,开发者可借此获得编排与长会话支持。

Sep 9Wed
  1. Mistral AI65

    Mistral AI 用 AI 代理完成 Fortran 77 迁移至 C++

    Mistral AI 帮助一家欧洲能源运营商将 40,000 行 Fortran 77 代码迁移至 C++,通过 AI 代理完成语法转换、架构重构和测试。文章详细阐述了构建数值一致性验证 harness、文档化流程、以及人机协同的结构化工作流,并给出迁移经验。

    Why Recommended: 案例展示了如何用 AI 代理完成 Fortran 77 到 C++ 的迁移,并给出可复制的工作流程与经验。

  2. OpenAI News86

    OpenAI 发布 GPT-6 Astra 模型

    OpenAI 推出 GPT-6 Astra,作为其迄今为止最具智能与对齐能力的模型,现已在 ChatGPT Work、Codex 及 API 中可用。该模型在计算机使用、浏览、软件工程及网络安全等专业任务上表现领先,API 定价为每百万输入 token 10 美元、每百万输出 token 50 美元。

    Why Recommended: 原文公布了新模型的各项能力基准、定价及企业级安全控制,读者可以据此评估其在复杂工作流中的成本效益。

Sep 5Sat
  1. GitHub Blog · AI & ML73

    Project HydraFusion:多模型编排实现前沿质量

    GitHub Copilot 推出了 Project HydraFusion,一个研究预览,利用多模型编排在运行时实现前沿智能。开发者只需像选择单一模型一样调用 HydraFusion,系统会在本地、云端和复合模型之间自动路由,平衡性能、成本与延迟。

    Why Recommended: HydraFusion 通过多模型编排实现前沿质量,显著降低成本,适合需要高质量代码的开发者,并提供可视化工作流与成本追踪

Sep 4Fri
  1. GitHub Blog · AI & ML74

    GitHub Copilot app 并行运行多 AI 代理功能

    GitHub Copilot app 现在支持在同一项目中并行运行多个 AI 代理。每个代理会话在独立的 Git worktree 上执行,彼此不干扰,保持各自上下文,开发者可同时启动多项任务并随时查看进度。

    Why Recommended: GitHub Copilot app 允许在同一项目中并行运行多个 AI 代理,提升开发效率并减少上下文切换。

Sep 3Thu
  1. Google DeepMind63

    Google DeepMind 推出 Fairwind Program 计划

    Google DeepMind 宣布推出 Fairwind Program,这是一个面向政府机构和可信合作伙伴的有限访问计划,旨在通过 Gemini 3.8 Flash Cyber 与 CodeMender 框架提供自主发现和修复漏洞的先进网络安全能力。该计划首批覆盖全球 650 多个合作伙伴,支持在组织的安全云环境中几分钟内生成经过验证的修复补丁。

    Why Recommended: Google DeepMind 推出的 Fairwind Program 为政府和企业提供了基于特定 Gemini 模型的自动化漏洞修复能力,读者可以借此了解大模型在网络安全防护中的具体落地形态。

Aug 20Thu
  1. Mistral AI75

    Agentic Search:为 AI 系统提供更准确、更高效的检索结果

    Mistral AI 推出了 Agentic Search,利用多步检索循环在 FinanceBench 和 OfficeQA Pro 基准上显著提升检索准确率,并降低 token 使用和延迟。该功能通过搜索、打开、导航、读取和 grep 五个工具,让模型在复杂文档中进行迭代检索,支持敏感领域数据,并可通过 Mistral Search Toolkit 在云端或本地部署。

    Why Recommended: Agentic Search 通过多步检索循环显著提升金融文件检索准确率,帮助企业在敏感数据上实现更高效的 AI 交互,并在复杂文档中实现精准导航。

Aug 19Wed
  1. Hugging Face Blog65

    智能体究竟需要多少记忆容量:ALTK-Evolve 评测与剂量校准方法

    Hugging Face 团队发布研究探讨如何为 AI 智能体配置自蒸馏记忆,评估了从 30B 到前沿模型的 8 款模型在 AppWorld 基准上的表现。研究发现智能体记忆效果取决于模型能力层级:强模型适合注入完整记忆,较弱模型适合精选检索,而已饱和模型则无明显增益。精选检索能在仅增加 5% token 的情况下使 gpt-oss-120b 任务完成度提升 16.1 个百分点。

    Why Recommended: 研究表明智能体记忆容量需要根据模型能力进行校准而非盲目堆砌,为提升准确率和控制成本提供了实践参考。

Aug 14Fri
  1. Hugging Face Blog65

    使用 Strands Agents、LeRobot 与 Hugging Face Storage Buckets 实现录制、训练与部署一体化

    本文介绍了 Strands Robots 中的流式数据闭环方案,展示了如何通过自然语言指令录制机器人示范数据、将其同步至 Hugging Face Storage Buckets 并进行基于 Xet 的字节级去重。随后,开发者可以直接从 Hub 流式读取数据集来训练策略,并将训练好的检查点重新部署到硬件上。

    Why Recommended: 文章介绍了基于 Strands Agents 和 LeRobot 的机器人流式数据闭环方案,读者可以据此了解如何通过云端存储桶实现无本地下载的高效训练。

  2. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,这是其 Flash 系列最新的工作模型,专为编码和智能体设计。该模型在 FrontierCode、DeepSWE、WebDev Arena 等基准上显著提升准确率,且每百万输入 token 价格仅 $0.75,输出 $3.75,成本更低。

    Why Recommended: Gemini 3.7 Flash 在编码、网页开发和知识工作等领域显著提升准确率,并以更低成本提供高效工作流。

Aug 11Tue
  1. Hugging Face Blog68

    想用 ACE 吗?ALTK-Evolve 用更少 Token 实现

    Hugging Face 博客介绍了 ALTK-Evolve 库,该库通过高效的记忆检索实现与 ACE 相比更低的 Token 消耗,同时保持或提升准确率。ALTK-Evolve 与 ACE 都利用代理自身轨迹学习,但在记忆构建和交付方式上不同:ACE 采用完整的 playbook 注入,而 ALTK-Evolve 只检索模型可用的指导原则,从而显著降低推理 token。

    Why Recommended: ALTK-Evolve 在保持或提升准确率的同时,显著降低推理 token 消耗,展示了高效记忆检索的可行性。

  2. Mistral AI73

    Mistral 推出区域推理、开放模型与欧洲主权 AI 基础设施

    Mistral AI 宣布推出区域推理端点和优先服务层,支持在欧洲或美国运行推理,并提供 1 GW 计算容量目标。公司还将平台开放给第三方模型,首批支持 Z.ai 的 GLM‑5.2,所有模型均在同一基础设施下满足区域控制与 SLA。为保障欧洲长期 AI 计算需求,Mistral 正与企业组建联盟,形成欧洲计算单元(ECU)以锁定多年容量。

    Why Recommended: Mistral 推出区域推理端点和开放模型支持,帮助企业实现 AI 主权与合规。

Aug 4Tue
  1. Microsoft Research86

    Microsoft Research 发布开源智能体框架 Orchard

    Microsoft Research 推出了开源的可扩展智能体框架 Orchard,其核心是提供可重用环境服务的 Kubernetes 架构 Orchard Env,支持在真实部署 harnesses 中直接训练智能体。项目同步开源了三个领域的训练方案与数据,其中 Orchard-SWE 在 SWE-bench Verified 上取得了 69.7% 的表现。

    Why Recommended: 微软研究院开源了可扩展智能体框架 Orchard,并提供覆盖软件工程、网页浏览和个人助理的完整训练方案,降低了智能体研究的基建门槛。

Jul 31Fri
  1. Google Research66

    Google Research 推出可验证自主研究框架 Science One 与证据链机制

    Google Research 推出了基于 Chain-of-Evidence 架构的自主科研框架 Science One,通过构建实时证据链与 CoE Audit 评估协议解决 AI 生成论文中的幻觉与不可复现问题。结果显示该框架在 MLE-Bench 等基准测试中实现了零幻觉引用与完全可验证的分数,同时达到了 SOTA 性能。

    Why Recommended: 原文介绍了通过证据链确保 AI 科研成果可验证的新框架,读者可以据此评估自主研究系统的可靠性边界。

Jul 30Thu
  1. Google DeepMind86

    Gemini Robotics ER 2:通过视频理解、任务编排与多机器人协作驱动机器人

    DeepMind 发布 Gemini Robotics ER 2,作为其最新的“具身推理”模型,支持持续视频理解、任务编排和多机器人协作。该模型可与任何低层 VLA 模型配合,实时调用工具(如 Google Search),并在执行过程中保持推理,显著提升任务完成率和安全性。

    Why Recommended: Gemini Robotics ER 2 通过视频理解和多机器人协作提升机器人任务完成率,展示了高效实时推理与安全控制的结合。