跳到正文

#推理

RSS
今日 4 則
今天10月1日週四
  1. TechCrunch · AI63

    Google 釋出 Gemini 4 Argon,稱其為最強模型

    Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。

  2. The Verge · AI67

    Google 釋出 Gemini 4,稱其能力強大僅限可信網路防禦者使用

    Google 今日公佈 Gemini 4 Argon,稱其在複雜工作流程中的表現優於 OpenAI 與 Anthropic 的競爭模型。該模型目前僅向“可信網路防禦者”開放,Google 已在內部工作流中使用,幫助完成大規模程式碼庫遷移。公司釋出對比圖表顯示 Gemini 4 在多項基準上領先,並計劃在更廣泛推廣前加強安全防護。

  3. The Decoder53

    OpenAI 與 Synopsys 合作推出 GPT‑Synopsys 晶片設計 AI 模型

    OpenAI 與 Synopsys 簽署多年戰略合作,聯合研發名為 GPT‑Synopsys 的專用 AI 模型,用於晶片設計與驗證。該模型將 OpenAI 的技術與 Synopsys 的 EDA 工具結合,直接操作工具並在 OpenAI 基礎設施上執行。雙方表示將共同營銷並分攤收入,且客戶資料不用於訓練並將加密儲存。早期與半導體客戶的測試已在進行中。

  4. Google DeepMind72

    Gemini 4 Argon 釋出:開啟前沿智慧新時代

    Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。

    推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。

9月30日週三
  1. Vercel Blog65

    Ling 3.1 Flash 現已在 AI Gateway 上可用

    Ling 3.1 Flash 是 InclusionAI 推出的混合推理語言模型,現已在 AI Gateway 上免費使用至 2026 年 10 月 13 日。

    推薦理由:Ling 3.1 Flash 提供 262K token 上下文視窗和 560B 引數的混合推理能力,專為編碼與多步分析設計,讀者可評估其在 AI Gateway 上的應用潛力與成本優勢。

  2. AWS Machine Learning Blog66

    GPT-6.1 Sol 現已登陸 Amazon Bedrock

    GPT-6.1 Sol 現已在 Amazon Bedrock 上全面可用,為編碼、計算機使用和專業工作負載帶來更強的推理能力。該模型在 DeepSWE v1.1 上以約五分之一的單任務成本實現了接近 GPT-6 Astra 的表現,並在複雜文件分析和多步驟工作流上超越了 GPT-6 Sol。

    推薦理由:原文公佈了模型在亞馬遜雲科技平臺上的可用性和基準表現,讀者可以據此評估其在自動化工作流中的價效比與落地可行性。

9月29日週二
  1. AWS Machine Learning Blog62

    Grok 4.7 現已登陸 Amazon Bedrock

    xAI 的 Grok 4.7 現已在 Amazon Bedrock 上線,支援 500K 上下文視窗、四級推理努力程度配置及圖文輸入。該模型可通過 Responses、Chat Completions 和 Converse API 進行呼叫,並提供 US 區域和 Global 跨區域推理配置選項。

    推薦理由:原文介紹了 xAI Grok 4.7 在 Amazon Bedrock 上的可用性與整合細節,讀者可以據此瞭解該模型在 Bedrock 上的呼叫方式與配置選項。

9月27日週日
9月26日週六
  1. AWS Machine Learning Blog65

    AWS 詳解基於 Amazon Bedrock 構建生產級大語言模型質量保障體系

    AWS 團隊詳細介紹了面向生產環境的大語言模型質量保障架構,通過自適應管道編排、跨賬戶多模型故障轉移、即時流式評估、複合評估框架以及資料準確性驗證五項技術,在 Amazon Bedrock 上實現了約 99% 的數值準確率並支援即時流式響應。文章重點闡述瞭如何通過三階段自適應處理、獨立配額空間網格、生產者消費者併發模式及兩階段級聯驗證來解決模型幻覺、API 限流和驗證延遲等工程挑戰。

    推薦理由:文章詳細拆解了五項用於保障大語言模型生產環境質量的技術實現,幫助開發者在實際業務中平衡準確率與響應延遲。

9月23日週三
9月21日週一
9月18日週五
  1. Vercel Blog72

    Jev 是 AI Gateway 歷史上最快被採用的模型

    Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。

    推薦理由:Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。

9月16日週三
  1. Google DeepMind66

    Google DeepMind 釋出 Gemini 3.8 Live 與 3.8 Live Extended Thinking 語音模型

    Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。

    推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。

9月8日週二
9月3日週四
9月2日週三
  1. Hugging Face Blog55

    BenchMIRT:大模型基準測試究竟在測量什麼?

    Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。

8月25日週二
  1. Hugging Face Blog74

    Granite 4.2 LLM:構建過程

    Granite 4.2 是 IBM 推出的三種規模(3B、8B、30B)的稠密解碼器推理 LLM,基於 Granite‑4.1 預訓練模型,使用約 15T 令牌的五階段訓練策略,擴充套件上下文視窗至 512K,並通過監督微調和多階段強化學習(包括 agentic RL)實現鏈式思考、工具呼叫與低成本思考模式。

    推薦理由:Granite 4.2 通過多階段 RL 訓練實現強推理與工具呼叫能力,讀者可瞭解其技術細節與效能提升。

8月24日週一
  1. Import AI31

    Import Inst 470:機器學習無版權;用 SPADE 自動化環境生成;用 Hawkeye 構建更好的 GPU kernel

    一項研究表明,大模型在網路安全領域帶來了大幅加速,在數學研究中帶來了較小加速,而在 AI 自身研究中尚未帶來可測量的加速。多所高校研究者聯合推出了 SPADE,這是一個通過自我對弈協同演化環境合成與智慧體能力的通用框架。該框架在 30B 規模下利用 Qwen3 骨幹網路進行了測試,在遊戲和工具使用環境評測中均提升了效能。

8月13日週四
  1. Microsoft Research61

    Microsoft Research 推出 MindTopo 評測 VLM 的空間推理能力

    Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。

    推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。

8月12日週三
  1. Google Research63

    空書架還是丟了鑰匙?研究稱檢索是大語言模型引數化真實性的瓶頸

    Google Research 介紹了知識 profiling 行為框架和 WikiProfile 基準,用以衡量大語言模型的編碼與檢索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事實已被編碼,但模型仍無法直接檢索其中 26% 至 34% 的事實。這說明事實性錯誤主要源於知識無法可靠呼叫的檢索失敗,而非知識未被編碼的儲存缺失。

    推薦理由:研究指出前沿大語言模型的知識編碼已接近飽和,準確率瓶頸在於檢索而非儲存,為後續訓練與推理最佳化提供了新方向。

8月10日週一
  1. Hugging Face Blog64

    讓知識蒸餾足夠低成本以實現規模化執行

    Multiverse Computing 在其最新論文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出離線 Top‑100 logits 快取與分塊 KL 損失兩項改進。

    推薦理由:本文提出的離線Top‑K logits快取和分塊KL損失顯著降低視訊記憶體需求,使大規模LLM蒸餾可在單GPU上完成,降低成本並提升實驗效率。

7月23日週四
  1. Google Research70

    讓量子計算機從錯誤中學習

    Google Research 在其 Willow 超導處理器上演示了利用強化學習實現量子計算機持續校準的方法,顯著降低了邏輯錯誤率。實驗中,RL 訓練將錯誤率降低 3.5 倍,最終邏輯錯誤率低至每千個糾錯週期不到一次,並在數百量子位元的模擬中驗證了可擴充套件性。該方法將量子錯誤檢測事件作為主動學習訊號,展示了可持續計算的新範式。

    推薦理由:通過強化學習實現量子計算機持續校準,顯著降低邏輯錯誤率,展示了可擴充套件的自適應控制方法,為未來大規模量子計算提供可行路徑。

7月2日週四
  1. Mistral AI64

    Mistral AI 釋出 Leanstral 1.5 形式化推理模型

    Mistral AI 釋出 Leanstral 1.5,這是一款採用 Apache-2.0 許可證、擁有 119B 總引數和 6B 啟用引數的開源形式化驗證模型。該模型經過中訓練、監督微調與 CISPO 強化學習,在 miniF2F、PutnamBench 以及 FATE-H 和 FATE-X 等基準測試中取得顯著效能提升,並支援通過 Hugging Face 和免費 API 獲取。

    推薦理由:文章詳細說明了 Leanstral 1.5 的引數規模、訓練階段與測試集表現,讀者可以據此評估該開源形式化驗證模型在數學推理和程式碼驗證上的實際效能。

7月1日週三
  1. Berkeley AI Research23

    2026 BAIR 畢業生展示

    2026 年,Berkeley Artificial Intelligence Research (BAIR) Lab 慶祝其畢業生的成就。他們的研究涵蓋機器人、LLM、計算機視覺、生成模型、AI 安全、人機互動、科學與醫療 AI,並已發表影響力論文、構建實用系統、指導同輩。畢業生正投身學術、工業研究實驗室及創業公司,期待未來發展。

6月25日週四
  1. Google Research63

    Google Research:思考以檢索:推理如何解鎖大語言模型中的引數化知識

    Google Research 探討了大語言模型中推理如何解鎖引數化知識,通過控制實驗揭示了計算緩衝區效應和事實啟動兩大機制。研究表明,即使面對簡單的單跳問題,啟用推理也能幫助模型召回原本難以觸及的正確答案。不過,推理階段產生的中途幻覺會顯著降低最終答案的正確率。

    推薦理由:研究揭示了推理如何解鎖大語言模型的引數化知識,並指出了中間事實對準確率的關鍵影響。

6月9日週二
  1. Google DeepMind86

    推出 Gemma 4 12B:無編碼器統一多模態模型

    DeepMind 推出 Gemma 4 12B,這是一款無編碼器的統一多模態模型,能夠直接在配備 16GB VRAM 的筆記本上執行。它在保持與 26B MoE 近似的推理效能的同時,顯著降低了記憶體佔用,並首次支援原生音訊輸入。

    推薦理由:Gemma 4 12B 以無編碼器的多模態架構實現低記憶體、強推理,適配本地 16GB VRAM 機器,讀者可據此評估在邊緣裝置上的部署可能。

5月22日週五
  1. Mistral AI87

    Mistral AI 釋出 Mistral Medium 3.5 與 Vibe 雲端非同步智慧體

    Mistral AI 推出 128B 開源旗艦模型 Mistral Medium 3.5,具備 256k 上下文視窗、可配置推理強度以及從頭訓練的視覺編碼器,並在 SWE-Bench Verified 上取得 77.6% 的成績。

    推薦理由:Mistral Medium 3.5 的釋出和雲端非同步智慧體能力的上線,展示瞭如何通過長上下文與多工具呼叫降低開發者的任務阻塞成本。

5月8日週五
  1. Berkeley AI Research42

    Adaptive Parallel Reasoning:高效推理擴充套件的下一範式

    Adaptive Parallel Reasoning 提出讓模型自行決定何時並行拆分、執行緒數量和協調方式,以提升推理效率。ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法已實現多執行緒並行推理,減少上下文旋轉和推理延遲。此範式可在數學、編碼和代理任務中顯著降低推理時間,避免上下文旋轉問題。

5月4日週一
  1. Import AI64

    Import AI 455:AI 系統正走向自我構建與自動化研發

    作者 Jack Clark 撰文分析認為,基於軟體工程、基準測試和智慧體自主執行時間的進展,AI 系統有較大可能在 2028 年底前實現端到端自動化的 AI 研發。文章指出,當前模型在程式碼生成、復現論文、Kaggle 競賽和核心最佳化等任務上的能力顯著提升,正在逐步承擔原本需要人類完成的大量工程與科學實驗工作。

4月22日週三
  1. Google Research64

    ReasoningBank:使智慧體能夠從經驗中學習

    Google Research 推出了 ReasoningBank 智慧體記憶框架,通過從成功和失敗經驗中提取結構化推理模式來實現測試期自我進化。該方法通過記憶感知測試期擴充套件(MaTTS)機制,在網頁瀏覽和軟體工程基準測試中顯著提升了智慧體的成功率和執行效率。

    推薦理由:文章介紹了從成功與失敗經驗中提取結構化推理模式的記憶框架,讀者可以據此瞭解如何通過記憶增強智慧體的測試期擴充套件能力。

4月20日週一
  1. Berkeley AI Research66

    GRASP:提升狀態、加入噪聲與梯度重塑實現長時序規劃

    GRASP 是一種新的梯度規劃器,針對學習到的世界模型實現長時序規劃。它通過將軌跡提升到虛擬狀態實現並行最佳化、在狀態迭代中加入噪聲以增強探索、並重塑梯度以避免脆弱的狀態輸入梯度,從而顯著提升規劃魯棒性和速度。實驗顯示在 Push‑T 任務中,GRASP 在更長時間步上取得更高成功率且耗時更短。詳情見論文 https://arxiv.org/abs/2602.00475。

    推薦理由:GRASP 通過提升狀態、加入噪聲與梯度重塑,解決了大規模世界模型長時序規劃的梯度爆炸與不穩定問題。

4月16日週四
  1. Google Research62

    Google Research 推出 Simula:基於第一性原理的推理驅動合成數據集生成與評估框架

    Google Research 介紹了 Simula 框架,這是一種採用第一性原理構建整個合成數據集的種子無關且具身智慧的方法。該框架通過全域性多元化、區域性多元化、複雜化和質量檢查四個可控軸來分解生成過程,並在多個領域評估中展示了最佳化資料屬性對下游效能的提升。

    推薦理由:文章介紹了通過第一性原理構建合成數據集的 Simula 框架,為解決稀缺領域的資料瓶頸提供了可程式設計的工作流方案。

4月13日週一
  1. Google DeepMind75

    Gemini Robotics-ER 1.6:通過增強具身推理驅動真實世界機器人任務

    Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。

    推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。

4月3日週五
  1. Google DeepMind69

    Gemma 4 釋出:最強開源模型

    Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。

    推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。