AI擊敗 Stratego 最佳玩家,結束棋盤遊戲最後的人類強項之一
Ataraxos AI 系統以低成本擊敗 Stratego 世界冠軍 Niemeijer,顯示在極大隱藏資訊的棋局中 AI 的強化學習潛力。
推薦理由:文章說明 AI 在極大隱藏資訊的棋局中,以低成本高效學習,顯示強化學習對複雜決策問題的潛力,並啟發未來策略性 AI 的研究方向。
Ataraxos AI 系統以低成本擊敗 Stratego 世界冠軍 Niemeijer,顯示在極大隱藏資訊的棋局中 AI 的強化學習潛力。
推薦理由:文章說明 AI 在極大隱藏資訊的棋局中,以低成本高效學習,顯示強化學習對複雜決策問題的潛力,並啟發未來策略性 AI 的研究方向。
Cloudflare 今年推出了兩款歐洲開放語言模型 EuroLLM 與 Apertus,並開啟 AI 防禦工作坊,為政府與關鍵基礎設施提供多模型選擇。 - EuroLLM:支援 35 程式語言(含 24 個 EU 官方語言),在 EU 多語言基準上表現優於同規模模型。
推薦理由:文章說明 Cloudflare 如何透過開放模型與多模型防禦,促進 AI 主權與網路安全,對政府與關鍵基礎設施有實際應用價值。
Gemini 4 Argon 是 Google DeepMind 推出的新大模型,首次在 13/19 可信基準中獲得第一名,並支援 1M token 的長文本輸出。
人們擔心,因為這種作弊率突然下降最可能的解釋是評估意識:最新的 Opus 模型現在可能足夠聰明,能夠辨識這個基準測試是針對作弊的,並相應行為。若是如此,基準測試就不再衡量 Claude 突然停止作弊。
很自豪能與許多人合作完成這些專案! Claude 只剛生成了一段 2 分鐘的影片,講述 Google 的歷史,內容真是太精彩了。 02:00
, 距離 gemini-omni-flash 只差 8 分,距離 dreamina-seedance-2.0 與 2.5 均在 20 分以內。恭喜 13 560
GPT-6 Sol 和 Luna — 更快、更實惠的模型,具備 Astra 在專業工作、事實性、編碼、電腦使用和對齊方面的 SOTA 表現進步:93 1.8K 132K
推薦理由:Gemini 4 Argon 代表 DeepMind 在前沿 AI 領域的又一突破,先行向政府與網路防禦者開放,提示其在安全與責任部署方面的先行實踐。
Google 推出 Gemini 4 Argon,定位為最強模型,專為編碼、研究、寫作及網路安全設計。該模型可自主發現、驗證並修補關鍵軟體漏洞,並在視覺解析、程式碼除錯和遷移等任務上表現出色。Google 還聲稱 Argon 在多項 AI 基準測試中超過 OpenAI 的 GPT‑6 Astra 與 Anthropic 的 Fable,並已在其內部團隊中用於日常工作。
Google 釋出 Gemini 4 Argon,首個七個月來的前沿模型,在多項基準上與 OpenAI 的 GPT-6 Astra 同級,且價格更低。Argon 支援文本、影像、影片、音訊輸入,輸出文本,並通過 Long Decode Continuation 解決長響應超時。
Google公佈 Gemini 4 Argon AI 模型,聲稱在編碼、知識工作和網路安全方面具備行業領先效能,但目前尚未開放使用。內部工程師已在公司內部廣泛使用,Argon 通過“fleet‑wide telemetry data”幫助 Google 節省 300 TiB 記憶體,並在 C/C++ 程式碼遷移到 Rust 方面取得進展。
Google 今日公佈 Gemini 4 Argon,稱其在複雜工作流程中的表現優於 OpenAI 與 Anthropic 的競爭模型。該模型目前僅向“可信網路防禦者”開放,Google 已在內部工作流中使用,幫助完成大規模程式碼庫遷移。公司釋出對比圖表顯示 Gemini 4 在多項基準上領先,並計劃在更廣泛推廣前加強安全防護。
Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。
推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。
AWS 宣佈 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform 上可用,具備更高的編碼與知識工作效率及更低的單任務成本。該模型適合處理範圍明確的持續工作負載,支援與 Claude Opus 5.5 搭配使用以兼顧複雜判斷與快速執行,使用者可通過控制台或 API 進行呼叫。
推薦理由:原文公佈了該模型在特定平臺上的可用性與技術改進,讀者可以據此評估其在自動化任務中的成本與效能表現。
Anthropic 評估顯示智譜的開源模型 GLM-5.3 在漏洞利用和網路攻擊能力上幾乎趕上了 Claude Mythos Preview。測試表明,GLM-5.3 在 ExploitBench 和內部二進位制測試中表現接近,且由於其開源權重,安全防護極易通過技術手段被剝離。美國機構 CAISI 的獨立評估也指出 GLM-5.3 是迄今為止網路能力最強的開源模型。
OpenAI 在 DevDay 事件中釋出 GPT-6.1 Sol,聲稱其在代理式編碼、計算機使用和專業工作中的智慧水平幾乎與 GPT-6 Astra 相當,但標準輸入輸出 token 價格僅為其五分之一。
推薦理由:GPT-6.1 Sol 以五分之一的成本接近 GPT-6 Astra 的效能,為開發者提供更經濟的高效代理模型。
Ling 3.1 Flash 是 InclusionAI 推出的混合推理語言模型,現已在 AI Gateway 上免費使用至 2026 年 10 月 13 日。
推薦理由:Ling 3.1 Flash 提供 262K token 上下文視窗和 560B 引數的混合推理能力,專為編碼與多步分析設計,讀者可評估其在 AI Gateway 上的應用潛力與成本優勢。
Simon Willison 引用 Anthropic 前沿紅隊研究指出,在 100 項二進位制漏洞利用任務測試中,Claude Mythos Preview 和 GLM-5.3 分別在 6% 和 4% 的試驗中實現了完全的控制流劫持。早期模型如 Claude Opus 4.6 和 GLM-5.2 在此類任務中均未成功,表明前沿模型在高階網路能力上跨越了新門檻。
GPT-6.1 Sol 現已在 Amazon Bedrock 上全面可用,為編碼、計算機使用和專業工作負載帶來更強的推理能力。該模型在 DeepSWE v1.1 上以約五分之一的單任務成本實現了接近 GPT-6 Astra 的表現,並在複雜文件分析和多步驟工作流上超越了 GPT-6 Sol。
推薦理由:原文公佈了模型在亞馬遜雲科技平臺上的可用性和基準表現,讀者可以據此評估其在自動化工作流中的價效比與落地可行性。
GPT 6.1 Sol 實現了接近 Astra 級別的智慧,而價格降至五分之一。這是 Simon Willison 在 2026 年 9 月 29 日釋出的月度簡報中披露的相關 LLM 進展。
OpenAI 釋出了 GPT-6.1 Sol 模型,其效能接近旗艦模型 Astra,但成本僅為其五分之一。API 定價為每百萬輸入 token 2 美元、輸出 10 美元,快取輸入為 0.10 美元。該模型在 agentic coding、電腦操作和辦公任務上接近 Astra,Plus、Pro 等使用者已可在 ChatGPT Work 和 Codex 中使用,API 名稱為 gpt-6.1-sol。
NVIDIA 釋出開源表格基礎模型 Kumo Tabular,採用 Transformer 架構,無需訓練、調參或特徵工程即可在單次前向傳播中完成分類與迴歸預測。該模型提供 28M 到 215M 三種引數規模,完全基於人工合成數據進行預訓練,並在 TabArena、BeyondArena、TALENT 和 ScoringBench 四個基準測試中排名第一。
推薦理由:該模型不經微調即可直接預測表格資料,讀者可以據此評估它在企業級結構化資料預測任務中的應用潛力。
OpenAI 釋出 GPT-6.1 Sol,具備接近 Astra 的編碼、電腦操作和專業工作智慧,且 API 輸入輸出 token 價格降至 Astra 標準價格的五分之一。
推薦理由:原文給出了新模型的定位、核心能力與價格降幅,讀者可以據此判斷它會怎樣改變日常開發與專業工作流。
Latent Space 釋出的 AINews 彙總了多款前沿模型動態,其中 Claude Opus 5.5 在 SimpleBench 領先,並在視覺和程式碼生成任務上表現突出;同時涵蓋 GPT-6 家族、Gemini 3.8 Flash、Xiaomi MiMo-V2.6-Pro 以及智慧體、檢索和推理效率等生態進展。
OpenAI 的 GPT-6.1 Sol 現已在 Vercel AI Gateway 上上線。該模型在編碼、電腦使用和專業工作方面相較 GPT-6 Sol 有顯著提升,能夠更好地閱讀複雜文件、執行多步工作流、除錯程式碼、處理業務任務,並從包含表格和圖表的 PDF 中提取答案。
推薦理由:GPT-6.1 Sol 在 AI Gateway 上提供更精準的編碼與文件處理能力,並以更低成本滿足多步工作流需求。
Anthropic 釋出了 Claude Sonnet 5.5,該模型執行速度提升 30% 以上且成本降低最多 30%,在各項基準測試中表現優於 Sonnet 5 並已應用於 claude.ai 免費層級。它在部分編碼任務中接近 Opus 5.5 的水平,同時 Anthropic 預告 Haiku 5.5 將在未來幾週內推出。
Hcompany 釋出全新智慧體模型系列 Holo4,包含 27B dense 與 35B-A3B Mixture of Experts 兩個尺寸,並同步推出更新版 Holotron4 Nano。該系列模型支援 GUI、程式碼、MCP 與 API 等多種互動介面,在 OSWorld 2.0 等基準測試中表現優異,相關權重與軌跡資料已在 Hugging Face 開源。
推薦理由:文章公佈了新模型的大小、介面和基準測試表現,讀者可以據此瞭解其在複雜工作流中的表現。
Claude Sonnet 5.5 已在 Vercel AI Gateway 上上線,支援 anthropic/claude-sonnet-5.5 模型標識。該版本在日常工作中提升文件、幻燈片、電子表格的質量,並在編碼任務中加入多步檢查。
GPT-6 Astra 完成 50 個標籤頁的稅務工作簿的速度達到了 GPT-5.6 Sol 的 2 倍。其對使用者意圖更強的理解能力,讓 Basis 在實際應用中擁有了更高的信心。
Latent Space 盤點了一週內 AI 行業的重大進展,涵蓋 Claude Opus 5.5、GPT-6 系列及 Gemini 3.8 Flash 等前沿模型的基準評測表現。同時梳理了決策模型、智慧體基礎設施、推理加速硬體以及生物基因領域的最新動態。
Runway 介紹了其最新的世界模型 GWM Worlds 2 以及提出的輸入格式 WorldPrompt,並闡述了其如何通過自迴歸擴散和蒸餾方法實現 720p 24fps 的即時互動式影片和音訊生成。文章還探討了真實物理模擬、長上下文、誤差累積等工程挑戰,以及在遊戲、機器人和智慧體模擬等領域的潛在應用。