跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精選

第 1–20 條 · 共 30 條
今天10月1日週四
  1. The Decoder77

    OpenAI 移除模型推理盜取行動,手段仍在 Azure 上有效

    OpenAI 已停止一項針對其模型推理的盜取行動,然而同樣手段在 Microsoft Azure 上仍能取得推理內容。 - 攻擊方式:利用加密推理輸出,將其複製到另一對話並解密,讓低成本模型充當「解密 oracle」。

    推薦理由:OpenAI 透漏其對模型推理被盜取的防禦措施,揭示雲端平台安全差異,對 AI 產業防護策略具有參考價值。

  2. Google DeepMind72

    Gemini 4 Argon 发布:开启前沿智能新时代

    Google DeepMind 推出了 Gemini 4 Argon,这是一款具备长推理、跨领域多模态能力的前沿模型。Argon 在软件工程、金融、法律和网络安全等行业基准上刷新记录,并已在内部工作流中提升效率;其 1M token 输出上限和 $2/百万输入、$10/百万输出的价格为开发者提供更高性价比。

    推薦理由:Gemini 4 Argon 通过大幅提升推理长度和多模态能力,显著提升软件工程、金融与网络安全等领域的工作效率,并在多项行业基准上刷新记录,帮助企业加速技术迭代。

9月30日週三
  1. Vercel Blog65

    Ling 3.1 Flash 现已在 AI Gateway 上可用

    Ling 3.1 Flash 是 InclusionAI 推出的混合推理语言模型,现已在 AI Gateway 上免费使用至 2026 年 10 月 13 日。

    推薦理由:Ling 3.1 Flash 提供 262K token 上下文窗口和 560B 参数的混合推理能力,专为编码与多步分析设计,读者可评估其在 AI Gateway 上的应用潜力与成本优势。

  2. AWS Machine Learning Blog66

    GPT-6.1 Sol 现已登陆 Amazon Bedrock

    GPT-6.1 Sol 现已在 Amazon Bedrock 上全面可用,为编码、计算机使用和专业工作负载带来更强的推理能力。该模型在 DeepSWE v1.1 上以约五分之一的单任务成本实现了接近 GPT-6 Astra 的表现,并在复杂文档分析和多步骤工作流上超越了 GPT-6 Sol。

    推薦理由:原文公布了模型在亚马逊云科技平台上的可用性和基准表现,读者可以据此评估其在自动化工作流中的性价比与落地可行性。

9月29日週二
  1. AWS Machine Learning Blog62

    Grok 4.7 现已登陆 Amazon Bedrock

    xAI 的 Grok 4.7 现已在 Amazon Bedrock 上线,支持 500K 上下文窗口、四级推理努力程度配置及图文输入。该模型可通过 Responses、Chat Completions 和 Converse API 进行调用,并提供 US 区域和 Global 跨区域推理配置选项。

    推薦理由:原文介绍了 xAI Grok 4.7 在 Amazon Bedrock 上的可用性与集成细节,读者可以据此了解该模型在 Bedrock 上的调用方式与配置选项。

9月26日週六
  1. AWS Machine Learning Blog65

    AWS 详解基于 Amazon Bedrock 构建生产级大语言模型质量保障体系

    AWS 团队详细介绍了面向生产环境的大语言模型质量保障架构,通过自适应管道编排、跨账户多模型故障转移、实时流式评估、复合评估框架以及数据准确性验证五项技术,在 Amazon Bedrock 上实现了约 99% 的数值准确率并支持实时流式响应。文章重点阐述了如何通过三阶段自适应处理、独立配额空间网格、生产者消费者并发模式及两阶段级联验证来解决模型幻觉、API 限流和验证延迟等工程挑战。

    推薦理由:文章详细拆解了五项用于保障大语言模型生产环境质量的技术实现,帮助开发者在实际业务中平衡准确率与响应延迟。

9月18日週五
  1. Vercel Blog72

    Jev 是 AI Gateway 歷史上最快被採用的模型

    Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。

    推薦理由:Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。

9月16日週三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款先进的实时对话模型,带来并行推理与近实时语音交互升级。

    推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 与 3.8 Live Extended Thinking,通过并行推理与近实时语音交互能力在多项语音基准测试中表现突出,读者可借此评估其在复杂语音智能体开发和企业级工作流中的应用潜力。

9月8日週二
9月3日週四
8月25日週二
  1. Hugging Face Blog74

    Granite 4.2 LLM:构建过程

    Granite 4.2 是 IBM 推出的三种规模(3B、8B、30B)的稠密解码器推理 LLM,基于 Granite‑4.1 预训练模型,使用约 15T 令牌的五阶段训练策略,扩展上下文窗口至 512K,并通过监督微调和多阶段强化学习(包括 agentic RL)实现链式思考、工具调用与低成本思考模式。

    推薦理由:Granite 4.2 通过多阶段 RL 训练实现强推理与工具调用能力,读者可了解其技术细节与性能提升。

8月13日週四
  1. Microsoft Research61

    Microsoft Research 推出 MindTopo 评测 VLM 的空间推理能力

    Microsoft Research 推出了新基准 MindTopo,用于评估多模态大语言模型对连通性、包围、顺序、分离和结等拓扑概念的理解。研究发现,模型在静态图像识别上的表现明显优于需要跨动作维持空间关系的交互式规划任务。

    推薦理由:研究展示了当前多模态模型在静态拓扑识别与动态规划之间存在明显差距,为提升机器人和交互环境中的空间理解能力提供了新的评估基准。

8月12日週三
  1. Google Research63

    空书架还是丢了钥匙?研究称检索是大语言模型参数化真实性的瓶颈

    Google Research 介绍了知识 profiling 行为框架和 WikiProfile 基准,用以衡量大语言模型的编码与检索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事实已被编码,但模型仍无法直接检索其中 26% 至 34% 的事实。这说明事实性错误主要源于知识无法可靠调用的检索失败,而非知识未被编码的存储缺失。

    推薦理由:研究指出前沿大语言模型的知识编码已接近饱和,准确率瓶颈在于检索而非存储,为后续训练与推理优化提供了新方向。

8月10日週一
  1. Hugging Face Blog64

    让知识蒸馏足够低成本以实现规模化运行

    Multiverse Computing 在其最新论文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出离线 Top‑100 logits 缓存与分块 KL 损失两项改进。

    推薦理由:本文提出的离线Top‑K logits缓存和分块KL损失显著降低显存需求,使大规模LLM蒸馏可在单GPU上完成,降低成本并提升实验效率。

7月23日週四
  1. Google Research70

    让量子计算机从错误中学习

    Google Research 在其 Willow 超导处理器上演示了利用强化学习实现量子计算机持续校准的方法,显著降低了逻辑错误率。实验中,RL 训练将错误率降低 3.5 倍,最终逻辑错误率低至每千个纠错周期不到一次,并在数百量子比特的模拟中验证了可扩展性。该方法将量子错误检测事件作为主动学习信号,展示了可持续计算的新范式。

    推薦理由:通过强化学习实现量子计算机持续校准,显著降低逻辑错误率,展示了可扩展的自适应控制方法,为未来大规模量子计算提供可行路径。

7月2日週四
  1. Mistral AI64

    Mistral AI 发布 Leanstral 1.5 形式化推理模型

    Mistral AI 发布 Leanstral 1.5,这是一款采用 Apache-2.0 许可证、拥有 119B 总参数和 6B 激活参数的开源形式化验证模型。该模型经过中训练、监督微调与 CISPO 强化学习,在 miniF2F、PutnamBench 以及 FATE-H 和 FATE-X 等基准测试中取得显著性能提升,并支持通过 Hugging Face 和免费 API 获取。

    推薦理由:文章详细说明了 Leanstral 1.5 的参数规模、训练阶段与测试集表现,读者可以据此评估该开源形式化验证模型在数学推理和代码验证上的实际效能。

6月25日週四
  1. Google Research63

    Google Research:思考以检索:推理如何解锁大语言模型中的参数化知识

    Google Research 探讨了大语言模型中推理如何解锁参数化知识,通过控制实验揭示了计算缓冲区效应和事实启动两大机制。研究表明,即使面对简单的单跳问题,启用推理也能帮助模型召回原本难以触及的正确答案。不过,推理阶段产生的中途幻觉会显著降低最终答案的正确率。

    推薦理由:研究揭示了推理如何解锁大语言模型的参数化知识,并指出了中间事实对准确率的关键影响。

6月9日週二
  1. Google DeepMind86

    推出 Gemma 4 12B:无编码器统一多模态模型

    DeepMind 推出 Gemma 4 12B,这是一款无编码器的统一多模态模型,能够直接在配备 16GB VRAM 的笔记本上运行。它在保持与 26B MoE 近似的推理性能的同时,显著降低了内存占用,并首次支持原生音频输入。

    推薦理由:Gemma 4 12B 以无编码器的多模态架构实现低内存、强推理,适配本地 16GB VRAM 机器,读者可据此评估在边缘设备上的部署可能。

5月22日週五
  1. Mistral AI87

    Mistral AI 发布 Mistral Medium 3.5 与 Vibe 云端异步智能体

    Mistral AI 推出 128B 开源旗舰模型 Mistral Medium 3.5,具备 256k 上下文窗口、可配置推理强度以及从头训练的视觉编码器,并在 SWE-Bench Verified 上取得 77.6% 的成绩。

    推薦理由:Mistral Medium 3.5 的发布和云端异步智能体能力的上线,展示了如何通过长上下文与多工具调用降低开发者的任务阻塞成本。