跳到正文

#DeepSeek

RSS
今日 0 則
9月30日週三
  1. The Decoder66

    Anthropic 稱智譜開源 GLM-5.3 漏洞利用能力接近 Claude Mythos Preview

    Anthropic 評估顯示智譜的開源模型 GLM-5.3 在漏洞利用和網路攻擊能力上幾乎趕上了 Claude Mythos Preview。測試表明,GLM-5.3 在 ExploitBench 和內部二進位制測試中表現接近,且由於其開源權重,安全防護極易通過技術手段被剝離。美國機構 CAISI 的獨立評估也指出 GLM-5.3 是迄今為止網路能力最強的開源模型。

  2. The Verge · AI54

    中國 AI 公司會放慢速度嗎?頂尖眾議院民主黨人呼籲美中 AI 安全條約

    眾議院民主黨領袖羅·卡納(Ro Khanna)向美國情報機構和中國 AI 公司(DeepSeek、阿里巴巴、Moonshot AI)發函,要求其提供關於超級智慧、遞迴自我改進(RSI)以及安全防護措施的資料,並呼籲美中籤署禁止 RSI、監控前沿 AI 實驗室的條約。卡納還批評美國科技高管和白宮會議缺乏監管,提議設立中美專家工作組以制定安全標準。

9月26日週六
9月22日週二
9月17日週四
9月16日週三
  1. NVIDIA Blog72

    NVIDIA 釋出 Vera Rubin 架構與 DSX 平臺,展示 AI 工廠能效與吞吐量提升

    NVIDIA 在 AI Infra Summit 上釋出了 Vera Rubin 架構與 DSX 平臺,其中 Vera Rubin NVL72 系統在 MLPerf Inference v6.1 預覽測試中展現出顯著的吞吐量優勢。多項生態合作與基準測試顯示,新平臺通過電源最佳化和軟體協同,大幅提升了每瓦 tokens 產出與 agentic ワークロード的執行效率。

    推薦理由:原文公佈了 Vera Rubin 架構在多個基準測試中的效能表現,讀者可以據此評估新一代 AI 基礎設施在能效和吞吐量上的提升幅度。

8月19日週三
  1. Hugging Face Blog65

    智慧體究竟需要多少記憶容量:ALTK-Evolve 評測與劑量校準方法

    Hugging Face 團隊釋出研究探討如何為 AI 智慧體配置自蒸餾記憶,評估了從 30B 到前沿模型的 8 款模型在 AppWorld 基準上的表現。研究發現智慧體記憶效果取決於模型能力層級:強模型適合注入完整記憶,較弱模型適合精選檢索,而已飽和模型則無明顯增益。精選檢索能在僅增加 5% token 的情況下使 gpt-oss-120b 任務完成度提升 16.1 個百分點。

    推薦理由:研究表明智慧體記憶容量需要根據模型能力進行校準而非盲目堆砌,為提升準確率和控制成本提供了實踐參考。

8月11日週二
  1. Hugging Face Blog68

    想用 ACE 嗎?ALTK-Evolve 用更少 Token 實現

    Hugging Face 部落格介紹了 ALTK-Evolve 庫,該庫通過高效的記憶檢索實現與 ACE 相比更低的 Token 消耗,同時保持或提升準確率。ALTK-Evolve 與 ACE 都利用代理自身軌跡學習,但在記憶構建和交付方式上不同:ACE 採用完整的 playbook 注入,而 ALTK-Evolve 只檢索模型可用的指導原則,從而顯著降低推理 token。

    推薦理由:ALTK-Evolve 在保持或提升準確率的同時,顯著降低推理 token 消耗,展示了高效記憶檢索的可行性。

8月6日週四
  1. Hugging Face Blog53

    Baseten 接入 Hugging Face Inference Providers

    Baseten 現已成為 Hugging Face Hub 的推理提供商,支援在模型頁面和 JS/Python 客戶端 SDK 中直接呼叫無伺服器推理服務。首批上線支援對話和文本生成任務,涵蓋 DeepSeek V4 Flash、GLM-5.2 等開源權重模型。使用者可通過自定義 API 金鑰或由 Hugging Face 路由兩種模式呼叫,並已整合至多個主流 Agent 框架中。

7月20日週一
7月1日週三
  1. Hugging Face Blog68

    Hugging Face 與 Cerebras 推出基於 Gemma 4 的即時語音 AI

    Hugging Face 與 Cerebras 聯合推出將開源語音 AI 架構與高速推理相結合的即時語音方案,實現自然的語音到語音互動。該開源級聯語音堆疊由 Nvidia Parakeet 進行語音識別、Cerebras 執行 Google DeepMind 的 Gemma 4 31B 模型進行推理、以及 Alibaba 的 Qwen3TTS 生成語音,並已應用於 Reachy Mini 機器人。

    推薦理由:原文展示了開源語音流水線如何結合硬體推理速度,讀者可以評估這種架構在低延遲互動中的表現。

6月29日週一
5月8日週五
  1. Berkeley AI Research42

    Adaptive Parallel Reasoning:高效推理擴充套件的下一範式

    Adaptive Parallel Reasoning 提出讓模型自行決定何時並行拆分、執行緒數量和協調方式,以提升推理效率。ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法已實現多執行緒並行推理,減少上下文旋轉和推理延遲。此範式可在數學、編碼和代理任務中顯著降低推理時間,避免上下文旋轉問題。