Google DeepMind 推出全球首个双盲 AI 评测机制
Google DeepMind 推出全球首个专有前沿级别 AI 模型的双盲评测,通过密码学安全环境防止模型在测试前接触到评测问题。该机制与新加坡人工智能安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隐私保护环境中对 Gemini Flash Lite 模型进行保密基准测试,以提升评测的完整性。
Why Recommended: 原文给出了基于密码学环境开展模型评测的方案,读者可以据此评估它将如何解决行业中普遍存在的基准污染问题。