OpenAI DevDay 2026 现场图文实录
Simon Willison 现场图文直播了 OpenAI DevDay 2026 发布会,报道了名为 Dots 的个人智能体、GPT-6.1 Sol 模型、Ultrafast 模式、Decisions API 以及 Codex Security Cloud 等多项新产品与工具更新。
Why Recommended: 文章记录了 OpenAI DevDay 2026 的现场发布内容,读者可以据此了解其最新模型、智能体产品及开发者工具。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
Simon Willison 现场图文直播了 OpenAI DevDay 2026 发布会,报道了名为 Dots 的个人智能体、GPT-6.1 Sol 模型、Ultrafast 模式、Decisions API 以及 Codex Security Cloud 等多项新产品与工具更新。
Why Recommended: 文章记录了 OpenAI DevDay 2026 的现场发布内容,读者可以据此了解其最新模型、智能体产品及开发者工具。
Cloudflare 在博客中公布了面向 AI 时代的自适应应用安全框架,强调将代码、流量与情报连接以阻止攻击。
Why Recommended: 文章阐述了 Cloudflare 如何通过 AI 驱动的安全框架,将发现、治理、运行时防护与响应整合,帮助企业在 AI 时代提升应用安全。
Cloudflare 推出 Threat Signals,利用 AI 技能自动化提取并标注开源威胁报告中的指标,保留上下文,直接生成可在 WAF 中使用的规则,并通过 API 与内部 TIP 集成。
Why Recommended: Threat Signals 通过 AI 技能自动化提取并标注开源威胁报告中的指标,保留上下文,直接生成可在 WAF 中使用的规则,帮助企业快速提升防御效率,并可通过 API 与内部 TIP 集成,实现全流程威胁情报闭环,降低人工分析成本。
Anthropic 在 AI Engineer New York 会议上公布了 Claude Code 的最新功能,包括 Claude Tag、Sonnet 5.5、Mods 系统和插件门户。Thariq Shihipar 在访谈中阐述了提示技巧、Artifacts、Mods 等如何提升智能体的定制化与安全性,并讨论了 Agent 安全与“Pacing the Frontier”议题。
Why Recommended: Claude Code 新功能揭示可定制化智能体的未来,读者可了解如何通过 Mods 与插件提升工作效率与安全性。
OpenAI 推出名为 dots 的主动式助手,旨在跨复杂项目和日常任务持续工作,帮助用户在推进工作的同时保持控制。
OpenAI 的 GPT-6.1 Sol 现已在 Vercel AI Gateway 上上线。该模型在编码、电脑使用和专业工作方面相较 GPT-6 Sol 有显著提升,能够更好地阅读复杂文档、执行多步工作流、调试代码、处理业务任务,并从包含表格和图表的 PDF 中提取答案。
Why Recommended: GPT-6.1 Sol 在 AI Gateway 上提供更精准的编码与文档处理能力,并以更低成本满足多步工作流需求。
Hcompany 发布全新智能体模型系列 Holo4,包含 27B dense 与 35B-A3B Mixture of Experts 两个尺寸,并同步推出更新版 Holotron4 Nano。该系列模型支持 GUI、代码、MCP 与 API 等多种交互界面,在 OSWorld 2.0 等基准测试中表现优异,相关权重与轨迹数据已在 Hugging Face 开源。
Why Recommended: 文章公布了新模型的大小、接口和基准测试表现,读者可以据此了解其在复杂工作流中的表现。
GitHub Copilot app 推出了 canvases 功能,允许用户通过 /create-canvas 技能与自然语言描述,免编码生成支持双向交互的自定义工作流界面。画布可作为共享白板实时更新,支持团队共享或保存为个人扩展,用户也可直接安装 Awesome Copilot 中的现成扩展进行定制。
Why Recommended: 文章介绍了 GitHub Copilot app 中使用 canvases 自定义工作流的方法,读者可以学习如何通过描述直接生成双向交互界面。
AWS 团队详细介绍了面向生产环境的大语言模型质量保障架构,通过自适应管道编排、跨账户多模型故障转移、实时流式评估、复合评估框架以及数据准确性验证五项技术,在 Amazon Bedrock 上实现了约 99% 的数值准确率并支持实时流式响应。文章重点阐述了如何通过三阶段自适应处理、独立配额空间网格、生产者消费者并发模式及两阶段级联验证来解决模型幻觉、API 限流和验证延迟等工程挑战。
Why Recommended: 文章详细拆解了五项用于保障大语言模型生产环境质量的技术实现,帮助开发者在实际业务中平衡准确率与响应延迟。
Vercel 在博客中公布了 skills.sh 注册表在七个月内达到一百万技能、近 2.8 亿次安装的报告。报告显示,跨行业技能占 66% 的注册量,安装量占 87.5%,并指出安装高度集中,最受欢迎的 0.04% 技能贡献了 62% 的安装。
Why Recommended: 报告展示了 skills.sh 生态的爆发式增长与安装分布,为评估 Agent 技能市场潜力提供数据依据。
OpenAI 的 GPT‑6 Sol 与 GPT‑6 Luna 现已在 AI Gateway 上线,价格低于 GPT‑6 Astra。Sol 适用于复杂编码与持续性探究的 agent 工作流,Luna 则是低成本的高频重复工作选项。两者相较 GPT‑5.6 在事实可靠性、直白沟通和减少误导性编码声明方面都有提升。使用时只需传入模型 ID,即可在模型演练区体验。
Why Recommended: GPT‑6 Sol 与 Luna 在 AI Gateway 上线,价格更低且在代码与专业工作中提升事实可靠性,读者可评估其高频工作流价值。
Anthropic 的 Claude Opus 5.5 已在 AI Gateway 上上线,支持 1M-token 上下文窗口和 128K 输出 token。与 Opus 5 相比,速度提升约 30%,成本降低约 40%。
Why Recommended: Opus 5.5 在速度和成本上相较前代提升显著,适合需要大上下文和长任务的智能体工作,其 1M-token 上下文窗口和 128K 输出令长任务更易监督,且支持自动工具选择,提升开发效率。对开发者而言,Opus 5.5 的速度与成本优势可显著降低项目迭代周期。
NVIDIA 发布文章指出 AI 安全本质上是一个工程问题,并从智能体栈的全栈防护、可执行边界、测试验证及开源协作等方面阐述了应对策略。文章介绍了 NVIDIA OpenShell 等开源运行时及合作伙伴的安全工具,强调企业需要通过明确的策略、独立沙箱和可追溯的身份凭证来保障智能体在复杂环境下的运行安全。
Why Recommended: 文章探讨了智能体栈各层的安全治理原则与开源实践,读者可以据此了解企业在多层架构中部署智能体时的安全边界与防护方案。
Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。
Why Recommended: Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。
Latent Space 发布了最新一期 AINews,重点报道了多项前沿 AI 进展:OpenAI 推出了模型失配披露机制,Databricks 针对约 3500 名工程师部署了 GPT-6 Astra,部分团队开始在生产环境评估智能体编码的成本与收益。同时,开源与推理基础设施持续演进,多款开源模型及量化工具在社区获得广泛讨论。
Why Recommended: 原文梳理了近期前沿模型的工程落地表现与行业动态,有助于读者直接评估智能体在实际生产环境中的成本与性能表现。
GPT-Live 1 現已於 Vercel 的 AI Gateway 上可用,支援全雙工語音對話。 - 全雙工功能:同時聽取與說話,消除傳統語音模型的切換延遲。
Why Recommended: GPT-Live 1 的全雙工語音功能與客戶端委派可提升對話流暢度與多模型協作。
Mem0 現已成為 Vercel Marketplace 的原生整合,為 AI 代理與應用提供長期記憶。 - 功能:讓 AI 代理記住用戶偏好、事實與上下文,避免每次從頭開始。
Why Recommended: Mem0 在 Vercel Marketplace 的集成让 AI 代理具备持久记忆,简化账单与部署流程,帮助开发者快速提升用户体验。
OpenAI 推出基于 AI 的全新广告体验,包括 Sponsored Agents、营销人员工具以及与 HubSpot 和 Shopify 的集成。
Why Recommended: 官方推出的广告体验更新直接关联营销工具与电商集成,读者可以据此了解 AI 如何进入广告与商业工作流。
Mistral 与 Mozilla 合作,将 Mistral 模型嵌入 Firefox Smart Window,支持法国和北美用户,英国和德国将于今年晚些时候上线。
Why Recommended: 此合作将Mistral模型嵌入Firefox Smart Window,提供本地化、多语言AI浏览体验,强调隐私与开放。
IBM Research 团队指出当前基准测试中的平均准确率掩盖了智能体的可靠性问题,并推出了用于测量和改善该问题的 Consistency Analyzer 与一致性指南。实验表明,该方法在 AppWorld 测试中将一致性差距从 24.4 个百分点缩小至 12.0 个百分点,且未降低平均准确率。相关开源代码与技术报告已发布。
Why Recommended: 文章提出了一种测量和缓解智能体运行不一致性的方法,对评估和提升智能体在生产环境中的可靠性有参考价值。