跳到正文

#Anthropic

RSS
今日 0 則
8月19日週三
  1. Hugging Face Blog65

    智慧體究竟需要多少記憶容量:ALTK-Evolve 評測與劑量校準方法

    Hugging Face 團隊釋出研究探討如何為 AI 智慧體配置自蒸餾記憶,評估了從 30B 到前沿模型的 8 款模型在 AppWorld 基準上的表現。研究發現智慧體記憶效果取決於模型能力層級:強模型適合注入完整記憶,較弱模型適合精選檢索,而已飽和模型則無明顯增益。精選檢索能在僅增加 5% token 的情況下使 gpt-oss-120b 任務完成度提升 16.1 個百分點。

    推薦理由:研究表明智慧體記憶容量需要根據模型能力進行校準而非盲目堆砌,為提升準確率和控制成本提供了實踐參考。

8月17日週一
7月27日週一
6月22日週一
6月8日週一
  1. Import AI12

    Import AI 460:社會獎勵攻擊基準 SocioHack、Anthropic 的遞迴自我改進及強化學習無人機競速

    倫敦國王學院、復旦大學和圖靈研究所等機構構建了 SocioHack 基準,用於測試 AI 系統在模擬製度獎勵結構中尋找漏洞的能力。研究顯示,強化學習訓練的 LLM 能以 61.25% 的召回率和 90.85% 的精度重新發現歷史上被修補的漏洞策略。Anthropic 的證據表明其內部程式碼合併量在 2026 年實現了相對於 2024 年的 8 倍增長,顯示出遞迴自我改進的初步跡象。

5月18日週一
  1. Import AI46

    Import AI 457: AI stuxnet、Muon 最佳化器與正向對齊

    研究人員對擁有 20 多年曆史的 fast16.sys 計算機病毒進行了深入調查,發現其會選擇性地篡改高精度計算軟體的結果以破壞科研專案。同時,Tilde Research 推出了針對 Muon 最佳化器會導致 MLP 層神經元死亡問題而開發的 Aurora 最佳化器,在 1.1B 引數 transformers 和約 100B tokens 訓練測試中取得了更低的最終損失及更高的 MMLU 分數。