一年後:主權 AI 與選擇權之戰
Cloudflare 今年推出了兩款歐洲開放語言模型 EuroLLM 與 Apertus,並開啟 AI 防禦工作坊,為政府與關鍵基礎設施提供多模型選擇。 - EuroLLM:支援 35 程式語言(含 24 個 EU 官方語言),在 EU 多語言基準上表現優於同規模模型。
推薦理由:文章說明 Cloudflare 如何透過開放模型與多模型防禦,促進 AI 主權與網路安全,對政府與關鍵基礎設施有實際應用價值。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Cloudflare 今年推出了兩款歐洲開放語言模型 EuroLLM 與 Apertus,並開啟 AI 防禦工作坊,為政府與關鍵基礎設施提供多模型選擇。 - EuroLLM:支援 35 程式語言(含 24 個 EU 官方語言),在 EU 多語言基準上表現優於同規模模型。
推薦理由:文章說明 Cloudflare 如何透過開放模型與多模型防禦,促進 AI 主權與網路安全,對政府與關鍵基礎設施有實際應用價值。
NVIDIA 发布开源表格基础模型 Kumo Tabular,采用 Transformer 架构,无需训练、调参或特征工程即可在单次前向传播中完成分类与回归预测。该模型提供 28M 到 215M 三种参数规模,完全基于人工合成数据进行预训练,并在 TabArena、BeyondArena、TALENT 和 ScoringBench 四个基准测试中排名第一。
推薦理由:该模型不经微调即可直接预测表格数据,读者可以据此评估它在企业级结构化数据预测任务中的应用潜力。
Cloudflare 推出 Vinext 1.0,帮助开发者将 Next.js 应用迁移到 Vite,并在 Cloudflare Workers、Netlify、AWS Lambda 等平台部署。新版兼容率超过 99%,支持 App Router 与 Pages Router、ISR、缓存、观察等功能,并提供自动化测试与社区驱动的持续改进。
推薦理由:Vinext 1.0 让 Next.js 应用可在 Cloudflare Workers、Netlify、AWS Lambda 等多平台部署,兼容率已超过 99%,并提供统一缓存、观察与自动化测试,帮助高流量动态网站实现稳定可靠的运行。
Hcompany 发布全新智能体模型系列 Holo4,包含 27B dense 与 35B-A3B Mixture of Experts 两个尺寸,并同步推出更新版 Holotron4 Nano。该系列模型支持 GUI、代码、MCP 与 API 等多种交互界面,在 OSWorld 2.0 等基准测试中表现优异,相关权重与轨迹数据已在 Hugging Face 开源。
推薦理由:文章公布了新模型的大小、接口和基准测试表现,读者可以据此了解其在复杂工作流中的表现。
本文介绍了如何利用 Amazon EKS、EFA 与 DeepEP 在大规模 MoE RL 训练中实现 40% 以上吞吐提升。
推薦理由:本文详细阐述了如何利用 Amazon EKS、EFA 与 DeepEP 在大规模 MoE RL 训练中实现 40% 以上吞吐提升,帮助读者快速搭建高效、成本友好的分布式 RL 基础设施。
GitHub Security Lab 推出了基于 Taskflow Agent 的自动化 fuzzing 管道,能够自主分析 C/C++ 项目、编写 harness、运行 AFL++ 并生成漏洞报告。该工具采用 agent 负责决策、MCP 工具负责执行的设计,通过覆盖率反馈循环和动态字典生成来提升测试效率。
推薦理由:文章介绍了开源自主 fuzzing 管道的具体架构和运行逻辑,读者可以借此了解如何利用智能体自动化完成代码覆盖率分析和漏洞排查。
OpenAI推出MentalHealthBench,一个多语言、多情境的心理健康对话评测基准。该基准由80多名全球心理健康专家共同制定,覆盖从日常对话到危机情境的多种场景,并提供专家评估标准和自动化评分工具。
推薦理由:OpenAI发布MentalHealthBench,提供多语言、多情境的心理健康评测基准,帮助研究者评估模型安全性与实用性。
NVIDIA 发布 Isaac ROS 5.0,这是一个基于 ROS 的 GPU 加速软件包集合,旨在帮助人类与 AI 智能体共同构建机器人。新版本引入了全新的智能体工作流、对 ROS Lyrical 和 Ubuntu 24.04 的支持,以及用于设置和操纵的 NVIDIA Isaac 技能。
推薦理由:该版本引入了面向智能体的工作流和新平台支持,为开发者构建物理AI机器人应用提供了GPU加速能力。
Hugging Face 的 transformers 库新增对 GGUF 模型的支持,允许用户通过熟悉的 API 在本地高效加载和运行量化模型。该集成通过复用 ggml 的 Metal 内核并在 Apple Silicon 上优化生成循环,使 transformers 能够直接运行诸如 Qwen3.5 等架构的量化权重。
推薦理由:原文介绍了 transformers 对 GGUF 模型的支持及底层优化,读者可以了解如何在熟悉的接口中直接加载和运行本地量化模型。
微软研究团队发布 RetroChimera,一种用于大规模小分子合成预测的框架,并在 Nature 论文中展示其性能。RetroChimera 结合 R‑SMILES 2 与 NeuralLoc 两种模型,通过学习式重排序实现更准确的合成路线预测。其开源实现已在 GitHub 上发布,旨在加速药物与材料研发。
推薦理由:RetroChimera 通过融合两种模型提升化学合成预测,公开源码可加速药物与材料研发。
NVIDIA 发布文章指出 AI 安全本质上是一个工程问题,并从智能体栈的全栈防护、可执行边界、测试验证及开源协作等方面阐述了应对策略。文章介绍了 NVIDIA OpenShell 等开源运行时及合作伙伴的安全工具,强调企业需要通过明确的策略、独立沙箱和可追溯的身份凭证来保障智能体在复杂环境下的运行安全。
推薦理由:文章探讨了智能体栈各层的安全治理原则与开源实践,读者可以据此了解企业在多层架构中部署智能体时的安全边界与防护方案。
Hugging Face 发布了 tokenizers v1 候选版本,在完全保持原有输出、API、词表与合并规则的前提下,通过工作空间拆分、bitcannon SIMD 分割、word cache 缓存、零分配合并循环及原生并行等优化,使编码速度较 v0.23 提升 3 到 30 倍。
推薦理由:官方发布了 tokenizers v1 候选版本,通过架构重构与底层优化大幅提升了编码与解码速度,为高并发与大规模训练场景减少了性能瓶颈。
GitHub 团队宣布将 GitHub Copilot 运行时(包括 CLI、应用和 SDK 的核心底层)从 TypeScript 完全重写为 Rust。此次重写历时约 14 周半,包含超过 80 万行生产级 Rust 代码,主要由 AI 智能体协助单名开发者通过 128 个 PR 以增量方式逐步推进,使运行时性能提升了数个数量级。
推薦理由:文章详细记录了使用 AI 智能体将大规模运行时重写为 Rust 的全过程,为开发者提供了极具价值的大型工程迁移实操参考。
Graidio 团队发布了 Workflow1111,这是一个基于 Gradio Workflow 重构 AUTOMATIC1111 功能集的单工作流画布,包含由 73 个节点和 11 条媒体管线组成的图表。
推薦理由:文章展示了如何用可视化节点把多个媒体管线组合在一起,并自动生成接口和协议,为开发者搭建复杂多模态应用提供了新方案。
Mistral AI 近日完成 30 亿欧元 Series D 融资,后市估值逾 210 亿欧元,创欧洲科技公司最大融资纪录。融资由三星电子领投,Scaleup Europe Fund、PSG Equity 等跟投,资金将用于扩展前沿研究、提升训练算力、加速商业化与国际布局。Mistral 目前已在 20 个国家运营,支持 125 家全球企业的关键 AI 转型。
推薦理由:Mistral 通过 30 亿欧元融资,进一步加速其全栈开放权重 AI 的研发与商业化,凸显企业对自主 AI 解决方案的需求增长。
Hugging Face 团队推出了 NeoMME,这是一个包含 260M 和 800M 参数的多语言多模态基础编码器系列。该模型不使用单独的视觉塔或因果语言模型,而是通过单个双向 Transformer 同时处理文本 token 和原始图像块。
推薦理由:原文发布了不依赖独立视觉塔的多模态双向编码器,读者可以了解其单塔架构和检索性能。
作者基于开源方案复现了让大语言模型通过编写 JavaScript 代码绘制水彩画的强化学习流程,并公开了参考图像池、强化学习环境、训练脚本及训练好的模型。文章对比了不同美学奖励权重配置下的多项实验结果,详细记录了基础设施搭建及训练调优过程中的发现。
推薦理由:文章复现并开源了使用强化学习训练代码模型绘制水彩画的完整流程,为读者提供了基于美学偏好进行对齐的具体实现与多重实验对比。
Google Research 推出 TimesFM-3,这是一个拥有 3.3 亿参数、原生支持多变量预测的零样本时间序列基座模型。该模型采用解码器架构与交替注意力机制,支持单次前向传递生成整个预测区间,在 Gift-Eval、FEV-Bench 和 Time 等基准测试中表现优于其他预训练基座模型,目前已在 GitHub 和 Hugging Face 上线。
推薦理由:谷歌发布了面向多变量时间序列预测的基座模型 TimesFM-3,它通过交替注意力架构和单次前向传递实现了零样本预测,在多项公开基准测试中表现领先。
Sentence Transformers v6.0 版本引入了多向量检索模型和完整的训练方法。作者以医疗检索领域为例,展示了如何在一块消费级 GPU 上微调出一个超越各大通用检索模型的领域专用模型。微调方法涵盖了模型选择、数据集格式、损失函数、训练参数以及评估器等核心组件。
推薦理由:文章给出了多向量嵌入模型的完整训练与微调步骤,读者可以据此在特定领域获得超越通用检索模型的效果。
Hugging Face 宣布重构 Papers with Code 搜索引擎,采用混合检索系统结合 PostgreSQL、pgvector 与 reciprocal rank fusion(RRF)算法,提升论文检索效果。
推薦理由:文章详细拆解了基于混合检索的论文搜索引擎架构,展示了如何通过离线任务与在线服务的拆分来兼顾吞吐量和低延迟,为类似工程实践提供了可复用的系统设计范本。