Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型
Google DeepMind 推出了基于 3.5 Flash 构建并针对网络安全任务微调的轻量化模型 Gemini 3.5 Flash Cyber,旨在帮助防御者快速发现、验证和修补软件漏洞。
Why Recommended: Google DeepMind 推出了专为网络安全微调的轻量化模型,通过支持高频率和多轮调用,在多个安全基准上展现了优于 mainline 模型和部分竞品的漏洞挖掘能力。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 推出了基于 3.5 Flash 构建并针对网络安全任务微调的轻量化模型 Gemini 3.5 Flash Cyber,旨在帮助防御者快速发现、验证和修补软件漏洞。
Why Recommended: Google DeepMind 推出了专为网络安全微调的轻量化模型,通过支持高频率和多轮调用,在多个安全基准上展现了优于 mainline 模型和部分竞品的漏洞挖掘能力。
Thinking Machines 在 Hugging Face 发布了 Inkling 与 Inkling‑Small 两个多模态 LLM。Inkling 是 1T 参数、1M 上下文窗口的开源模型,支持图像、文本、音频输入,并具备 agentic 能力。
Why Recommended: Inkling 通过支持 1M 上下文窗口和多模态输入,提供了大规模开源模型的高效推理与部署方案,帮助开发者快速构建跨模态推理应用。在 Hugging Face 平台上可一键部署,支持多种推理引擎,满足大规模推理需求,并提供 1M 上下文窗口的高效推理体验,适合多模态推理与微调场景。
Mistral AI 发布首款具身导航模型 Robostral Navigate,这是一个 8B 参数量的模型,仅需单个普通 RGB 摄像头和自然语言指令即可让机器人在复杂环境中自主导航。该模型在 R2R-CE 未见验证集上取得 76.6% 的成功率,在完全使用模拟数据和高效前缀缓存技术训练的基础上,结合了基于指向的导航与在线强化学习。
Why Recommended: 该模型仅凭单个 RGB 摄像头和 8B 参数量即在 R2R-CE 基准上取得领先成绩,为具身智能轻量化部署提供了新路径。
Mistral AI 发布 Leanstral 1.5,这是一款采用 Apache-2.0 许可证、拥有 119B 总参数和 6B 激活参数的开源形式化验证模型。该模型经过中训练、监督微调与 CISPO 强化学习,在 miniF2F、PutnamBench 以及 FATE-H 和 FATE-X 等基准测试中取得显著性能提升,并支持通过 Hugging Face 和免费 API 获取。
Why Recommended: 文章详细说明了 Leanstral 1.5 的参数规模、训练阶段与测试集表现,读者可以据此评估该开源形式化验证模型在数学推理和代码验证上的实际效能。
Google DeepMind 推出两款新模型:速度最快且最具成本效益的图像模型 Nano Banana 2 Lite,以及用于高质量视频生成和对话式编辑的 Gemini Omni Flash。
Why Recommended: Google DeepMind 推出 Nano Banana 2 Lite 与 Gemini Omni Flash 两款新模型,为开发者串联图像生成与视频编辑提供了低成本且高效的新方案。
Google Research 推出了 TabFM,这是一个专为表格数据分类和回归设计的零样本基础模型。该模型通过将表格预测转换为上下文学习问题,消除了传统机器学习中的手动模型训练、超参数调优和复杂特征工程,能够在单次前向传递中对未见过的表格生成高质量预测。
Why Recommended: Google Research 发布了面向表格数据的零样本基础模型 TabFM,读者可以据此了解大模型架构如何简化分类和回归的工作流。
Google Research 宣布推出一项新架构,将多Token预测(MTP)技术应用到已部署且权重被冻结的 Gemini Nano v3 模型上。该方法采用零拷贝架构直接利用主模型的键值缓存,在 Pixel 9 和 10 系列设备上实现了 50% 或更高的推理速度提升,并减少了能耗。
Why Recommended: 谷歌研究团队通过在已冻结的 Gemini Nano 模型上应用多Token预测架构,在不增加内存冗余的前提下显著提升了端侧设备的推理速度与能效。
Mistral AI 发布 Mistral OCR 4 模型,提供文档解析功能,除提取文本外还返回边界框、块分类和行内置信度分数。该模型支持 170 种语言,可在单容器中运行以用于自托管部署,并通过 API 或 Document AI 提供支持。
Why Recommended: 该模型支持多语言及单容器私有化部署,为企业级检索和智能体工作流提供了带边界框和置信度的结构化文档解析能力。
Google DeepMind 发布了采用 Apache 2.0 协议开源的实验性模型 DiffusionGemma,这是一款基于 Gemma 4 家族和 Gemini 扩散研究的 26B MoE 文本扩散模型,可在专用 GPU 上实现高达 4 倍的文本生成速度。
Why Recommended: 该模型采用文本扩散架构实现数倍于传统自回归模型的推理速度,为开发者探索本地实时交互工作流提供了新的硬件利用方式与微调路径。
DeepMind 推出 Gemma 4 12B,这是一款无编码器的统一多模态模型,能够直接在配备 16GB VRAM 的笔记本上运行。它在保持与 26B MoE 近似的推理性能的同时,显著降低了内存占用,并首次支持原生音频输入。
Why Recommended: Gemma 4 12B 以无编码器的多模态架构实现低内存、强推理,适配本地 16GB VRAM 机器,读者可据此评估在边缘设备上的部署可能。
Mistral AI 推出 128B 开源旗舰模型 Mistral Medium 3.5,具备 256k 上下文窗口、可配置推理强度以及从头训练的视觉编码器,并在 SWE-Bench Verified 上取得 77.6% 的成绩。
Why Recommended: Mistral Medium 3.5 的发布和云端异步智能体能力的上线,展示了如何通过长上下文与多工具调用降低开发者的任务阻塞成本。
Google DeepMind 推出了全新多模态模型 Gemini Omni,并发布了该系列首款模型 Gemini Omni Flash,支持通过图像、音频、视频和文本组合输入生成及编辑视频。该模型已向 Gemini app、Google Flow 以及 YouTube Shorts 用户推出,未来还将通过 API 提供给开发者和企业客户。
Why Recommended: 原文介绍了新模型的具体输入组合和发布范围,读者可以据此评估多模态视频生成与编辑的最新能力边界。
Google DeepMind 正式推出 Gemini 3.5 模型系列的首款型号 3.5 Flash,主打前沿智能与高速推理,重点提升智能体和编码任务表现。3.5 Flash 在 Terminal-Bench 2.1 等基准上表现优于 Gemini 3.1 Pro,速度达到其他前沿模型的 4 倍,目前已全面向全球用户、开发者及企业推出。
Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表达力和音质,支持 70+ 语言和多说话人对话,并通过细粒度音频标签让开发者可用自然语言控制语音风格。该模型在人工分析 TTS 评测中获得 1,211 Elo 分,并已在 Gemini API、Vertex AI 及 Google AI Studio 预览。
Why Recommended: Gemini 3.1 Flash TTS 通过细粒度音频标签提升可控性与表达力,支持 70+ 语言,支持多说话人对话,适合企业与开发者构建多语种语音应用,且在人工分析 TTS 评测中获得 1,211 Elo 分。
Google DeepMind 推出了 Gemini Robotics-ER 1.6,这是其专为机器人设计的最新模型,提升了空间推理、多视角理解和仪表读取能力。该版本在安全性和物理约束遵守方面也有显著改进,并已通过 Gemini API 和 Google AI Studio 对开发者开放。
Why Recommended: Gemini Robotics-ER 1.6 通过增强空间推理和多视角理解,显著提升机器人在真实环境中的自主决策能力,并首次实现仪表读取功能,为工业设施监测提供更高精度。该模型在安全性和物理约束遵守方面也表现出显著改进,帮助机器人更安全地执行任务。
Google DeepMind 推出了 Gemma 4,四种尺寸(E2B、E4B、26B MoE、31B Dense)支持多模态、长上下文(128K–256K)和 140+ 语言,具备高级推理、函数调用和代码生成能力,并以 Apache 2.0 许可免费开放,适用于从移动端到云端的多场景部署。
Why Recommended: Gemma 4 以高效参数利用率和多模态能力,成为最强开源模型之一,支持从移动端到云端的多场景部署,并提供 128K–256K 上下文窗口和 140+ 语言支持,兼具函数调用和结构化 JSON 输出,满足多行业需求。
Mistral AI 发布 4B 参数量的语音生成模型 Voxtral TTS,支持 9 种语言的高质量语音合成与低延迟流式传输。该模型具备上下文理解、说话人建模及零样本跨语言语音适应能力,已通过 API、Mistral Studio 和 Hugging Face 开放。
Why Recommended: 原文公布了架构细节和零样本跨语言能力,读者可以据此评估它在实时语音工作流中的表现。
Mistral AI 发布了 Mistral Small 4,这是一款统一推理、多模态与编码功能的模型,采用 119B 参数、256k 上下文窗口,支持可配置推理强度,提供 40% 的延迟降低和 3 倍的吞吐量提升。该模型采用 Apache 2.0 许可,支持 vLLM、llama.cpp、SGLang 等开源框架,并已加入 NVIDIA Nemotron 联盟。
Why Recommended: Mistral Small 4 将推理、多模态与编码功能统一,提供可配置推理强度和高效推理,帮助用户在单一模型中完成多种任务。
Leanstral 是 Mistral AI 推出的首款专为 Lean 4 设计的开源代码代理,采用 6B 活跃参数,支持在 Mistral Vibe 中零设置使用,并提供免费 API 端点。
Why Recommended: Leanstral 以 6B 参数实现高效 Lean 4 代码生成,成本低于主流模型,展示了开源代码代理在正式验证场景中的可行性。
Mistral AI 发布了 Voxtral Transcribe 2 语音模型系列,包含用于批量转写的 Voxtral Mini Transcribe V2 和用于实时应用的 Voxtral Realtime。
Why Recommended: Mistral 发布了 Voxtral Transcribe 2 语音模型系列,并开源了 Voxtral Realtime 权重,读者可以据此了解其在实时性与多语言转写上的新进展。