Simon Willison·· 1 天前AI 評分63
Simon Willison 引用 Anthropic 前沿紅隊研究
Quoting Anthropic Frontier Red Team
AI 導讀
Simon Willison 引用 Anthropic 前沿紅隊研究指出,在 100 項二進位制漏洞利用任務測試中,Claude Mythos Preview 和 GLM-5.3 分別在 6% 和 4% 的試驗中實現了完全的控制流劫持。
早期模型如 Claude Opus 4.6 和 GLM-5.2 在此類任務中均未成功,表明前沿模型在高階網路能力上跨越了新門檻。
來源:Simon Willison · simonwillison.net