Import AI· Jack Clark·· 2026-06-08AI 評分12
Import AI 460:社會獎勵攻擊基準 SocioHack、Anthropic 的遞迴自我改進及強化學習無人機競速
Import AI 460: Reward hacking society, RSI data from Anthropic; and RL-based quadcopter racing
AI 導讀
倫敦國王學院、復旦大學和圖靈研究所等機構構建了 SocioHack 基準,用於測試 AI 系統在模擬製度獎勵結構中尋找漏洞的能力。
- 研究顯示,強化學習訓練的 LLM 能以 61.25% 的召回率和 90.85% 的精度重新發現歷史上被修補的漏洞策略。
- Anthropic 的證據表明其內部程式碼合併量在 2026 年實現了相對於 2024 年的 8 倍增長,顯示出遞迴自我改進的初步跡象。
來源:Import AI · importai.substack.com