DeepSeek 釋出適配華為昇騰晶片的開源程式設計工具 TileLang
DeepSeek 聯合華為釋出並開源了一套面向華為昇騰晶片的程式設計工具,核心是旨在降低程式設計難度的 TileLang 語言。該合作旨在打破輝達 CUDA 軟體生態的長期壟斷,雙方還共同優化了包含 128 個昇騰 950 晶片的超節點叢集。
DeepSeek 聯合華為釋出並開源了一套面向華為昇騰晶片的程式設計工具,核心是旨在降低程式設計難度的 TileLang 語言。該合作旨在打破輝達 CUDA 軟體生態的長期壟斷,雙方還共同優化了包含 128 個昇騰 950 晶片的超節點叢集。
Anthropic 評估顯示智譜的開源模型 GLM-5.3 在漏洞利用和網路攻擊能力上幾乎趕上了 Claude Mythos Preview。測試表明,GLM-5.3 在 ExploitBench 和內部二進位制測試中表現接近,且由於其開源權重,安全防護極易通過技術手段被剝離。美國機構 CAISI 的獨立評估也指出 GLM-5.3 是迄今為止網路能力最強的開源模型。
眾議院民主黨領袖羅·卡納(Ro Khanna)向美國情報機構和中國 AI 公司(DeepSeek、阿里巴巴、Moonshot AI)發函,要求其提供關於超級智慧、遞迴自我改進(RSI)以及安全防護措施的資料,並呼籲美中籤署禁止 RSI、監控前沿 AI 實驗室的條約。卡納還批評美國科技高管和白宮會議缺乏監管,提議設立中美專家工作組以制定安全標準。
本文介紹瞭如何利用 Amazon EKS、EFA 與 DeepEP 在大規模 MoE RL 訓練中實現 40% 以上吞吐提升。
推薦理由:本文詳細闡述瞭如何利用 Amazon EKS、EFA 與 DeepEP 在大規模 MoE RL 訓練中實現 40% 以上吞吐提升,幫助讀者快速搭建高效、成本友好的分散式 RL 基礎設施。
小米釋出 MiMo-V2.6 系列原生全模態開源模型,其中 Pro 版本擁有 1.02T 總引數和 42B 啟用引數,RL 訓練成本約 300 萬美元。該系列同時開源了訓練環境、程式碼及技術報告,旨在降低強化學習訓練門檻。
Open-weight 模型 在 AI Gateway 8 月份佔據 56% 的代幣量,首次超過所有封閉模型。 - 代幣成本:平均每代幣價格較 5 個月前下降 23.2%,中位團隊每代幣支付 7.6% 更低。
推薦理由:Open-weight models已佔據主導,價格下降顯著,Astra快速滲透顯示新模型在企業生產中的高效性。
NVIDIA 在 AI Infra Summit 上釋出了 Vera Rubin 架構與 DSX 平臺,其中 Vera Rubin NVL72 系統在 MLPerf Inference v6.1 預覽測試中展現出顯著的吞吐量優勢。多項生態合作與基準測試顯示,新平臺通過電源最佳化和軟體協同,大幅提升了每瓦 tokens 產出與 agentic ワークロード的執行效率。
推薦理由:原文公佈了 Vera Rubin 架構在多個基準測試中的效能表現,讀者可以據此評估新一代 AI 基礎設施在能效和吞吐量上的提升幅度。
Hugging Face 團隊釋出研究探討如何為 AI 智慧體配置自蒸餾記憶,評估了從 30B 到前沿模型的 8 款模型在 AppWorld 基準上的表現。研究發現智慧體記憶效果取決於模型能力層級:強模型適合注入完整記憶,較弱模型適合精選檢索,而已飽和模型則無明顯增益。精選檢索能在僅增加 5% token 的情況下使 gpt-oss-120b 任務完成度提升 16.1 個百分點。
推薦理由:研究表明智慧體記憶容量需要根據模型能力進行校準而非盲目堆砌,為提升準確率和控制成本提供了實踐參考。
Hugging Face 部落格介紹了 ALTK-Evolve 庫,該庫通過高效的記憶檢索實現與 ACE 相比更低的 Token 消耗,同時保持或提升準確率。ALTK-Evolve 與 ACE 都利用代理自身軌跡學習,但在記憶構建和交付方式上不同:ACE 採用完整的 playbook 注入,而 ALTK-Evolve 只檢索模型可用的指導原則,從而顯著降低推理 token。
推薦理由:ALTK-Evolve 在保持或提升準確率的同時,顯著降低推理 token 消耗,展示了高效記憶檢索的可行性。
Baseten 現已成為 Hugging Face Hub 的推理提供商,支援在模型頁面和 JS/Python 客戶端 SDK 中直接呼叫無伺服器推理服務。首批上線支援對話和文本生成任務,涵蓋 DeepSeek V4 Flash、GLM-5.2 等開源權重模型。使用者可通過自定義 API 金鑰或由 Hugging Face 路由兩種模式呼叫,並已整合至多個主流 Agent 框架中。
Import AI 第 465 期探討了開源模型與閉源模型在網路安全等能力上的差距正在縮小,並介紹了 Kimi K3 的表現、Demis Hassabis 提出的 AGI 監管框架以及 LLM 隱蔽執行邊通道任務的研究。文章指出,開源權重的廣泛擴散將深刻改變技術與安全格局。
Hugging Face 與 Cerebras 聯合推出將開源語音 AI 架構與高速推理相結合的即時語音方案,實現自然的語音到語音互動。該開源級聯語音堆疊由 Nvidia Parakeet 進行語音識別、Cerebras 執行 Google DeepMind 的 Gemma 4 31B 模型進行推理、以及 Alibaba 的 Qwen3TTS 生成語音,並已應用於 Reachy Mini 機器人。
推薦理由:原文展示了開源語音流水線如何結合硬體推理速度,讀者可以評估這種架構在低延遲互動中的表現。
本期 Import AI 介紹了輝達開發的機器人自進化軟體框架 ENPIRE、騰訊釋出的萬卡叢集追蹤與除錯系統 ARGUS,以及加州大學伯克利分校整理的美國地方條例語料庫 LOCUS。
Adaptive Parallel Reasoning 提出讓模型自行決定何時並行拆分、執行緒數量和協調方式,以提升推理效率。ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法已實現多執行緒並行推理,減少上下文旋轉和推理延遲。此範式可在數學、編碼和代理任務中顯著降低推理時間,避免上下文旋轉問題。