跳到正文
Import AI· Jack Clark·· 2026-06-08AI 評分12

Import AI 460:社會獎勵攻擊基準 SocioHack、Anthropic 的遞迴自我改進及強化學習無人機競速

Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing

AI 導讀

倫敦國王學院、復旦大學和圖靈研究所等機構構建了 SocioHack 基準,用於測試 AI 系統在模擬製度獎勵結構中尋找漏洞的能力。

  • 研究顯示,強化學習訓練的 LLM 能以 61.25% 的召回率和 90.85% 的精度重新發現歷史上被修補的漏洞策略。
  • Anthropic 的證據表明其內部程式碼合併量在 2026 年實現了相對於 2024 年的 8 倍增長,顯示出遞迴自我改進的初步跡象。

來源:Import AI · importai.substack.com