Google DeepMind 釋出 SynthID Bio 為生成式生物學引入水印技術
Google DeepMind 推出了 SynthID Bio,這是一種專為合成生物學開發的水印技術,可在保持蛋白質生物功能的同時,將不可見的標記直接嵌入胺基酸序列和預測的 3D 結構中。該技術通過了溼實驗室對靶向蛋白質的測試,並對 AlphaFold 3 的擴散網路及 Evo 2 基因組模型進行了適配,旨在加強生物安全性並確保科學資料的完整性。
Google DeepMind 推出了 SynthID Bio,這是一種專為合成生物學開發的水印技術,可在保持蛋白質生物功能的同時,將不可見的標記直接嵌入胺基酸序列和預測的 3D 結構中。該技術通過了溼實驗室對靶向蛋白質的測試,並對 AlphaFold 3 的擴散網路及 Evo 2 基因組模型進行了適配,旨在加強生物安全性並確保科學資料的完整性。
OpenAI 釋出的早期前沿 AI 訓練安全案例指南,涵蓋技術防護、運營實踐以及對模型對齊偏差事件的調查。該指南旨在為前沿 AI 系統的安全訓練提供系統性框架。
OpenAI 對澳大利亞政府網站發生的安全事件表示歉意,並公佈了更嚴格的安全防護措施和支援計劃,以提升該國的網路防禦能力。
Vercel 將私有與 OSS 漏洞賞金計劃合併為單一公開的 Vercel Bug Bounty Program。AI 的普及使報告數量激增,Vercel 通過改進 triage、修復驗證流程,確保快速響應並評估報告價值。此前 Vercel 通過 HackerOne 的 $1M React2Shell 與 Sandbox 挑戰以及 OSS 賞金計劃積累經驗。
Google DeepMind 公佈了 Private AI Compute 架構的技術更新,將引入可在雲端持久儲存記憶並保持裝置端隱私標準的長期記憶層。該架構採用硬體級安全 enclave、端到端加密通道以及僅存放在個人裝置上的加密金鑰,使雲端 AI 能夠跨裝置安全保留上下文,同時確保資料連 Google 也無法訪問。
OpenAI 執行長 Sam Altman 在聯合國安理會上發表關於人工智慧的講話,討論了人工智慧在擴大機遇與科學發現方面的潛力,並強調了保持人類控制、防範失控風險以及加強國際合作的必要性。
推薦理由:原文完整記錄了 OpenAI 負責人向聯合國安全理事會發表的關於人工智慧安全與治理的發言,讀者可以據此瞭解官方對技術風險與國際合作的立場。
OpenAI 闡述了針對前沿模型及安全防護展開嚴格、安全且獨立的第三方 AI 安全評估的優先事項與原則。
NVIDIA 釋出文章指出 AI 安全本質上是一個工程問題,並從智慧體棧的全棧防護、可執行邊界、測試驗證及開源協作等方面闡述了應對策略。文章介紹了 NVIDIA OpenShell 等開源執行時及合作伙伴的安全工具,強調企業需要通過明確的策略、獨立沙箱和可追溯的身份憑證來保障智慧體在複雜環境下的執行安全。
推薦理由:文章探討了智慧體棧各層的安全治理原則與開源實踐,讀者可以據此瞭解企業在多層架構中部署智慧體時的安全邊界與防護方案。
Paul Christiano 正式加入 OpenAI 基金會董事會及其安全和安全委員會,為機構帶來了在 AI 對齊、安全以及標準制定方面的豐富經驗。
Chris Lehane 認為,隨著 AI 能力不斷增強,在政策視窗期仍然開放之際,我們需要提供更強的安全證據、建立共享標準並採取持久的政策行動。
OpenAI 的 Jakub Pachocki 探討了日益強大的 AI 展現出的“異質思維”特性,並指出保持其安全對齊所面臨的嚴峻挑戰。他呼籲行業建立更強的安全防護措施,以應對不斷升級的技術風險。
Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。
Google DeepMind 推出全球首個專有前沿級別 AI 模型的雙盲評測,通過密碼學安全環境防止模型在測試前接觸到評測問題。該機制與新加坡人工智慧安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隱私保護環境中對 Gemini Flash Lite 模型進行保密基準測試,以提升評測的完整性。
推薦理由:原文給出了基於密碼學環境開展模型評測的方案,讀者可以據此評估它將如何解決行業中普遍存在的基準汙染問題。
Mistral AI 釋出了 Shieldstral,這是一款 3B 引數的開源多模態安全分類模型,採用 Apache 2.0 協議開源。該模型將內容稽核轉換為策略自適應的問答任務,允許在推理時通過自然語言指定策略,從而無需重新訓練即可統一處理文本和影像安全評估。
推薦理由:該模型通過將內容稽核轉化為推理時的自然語言問答任務,避免了傳統方案因固定分類體系而需要重新訓練的限制。
Google DeepMind 推出了基於 3.5 Flash 構建並針對網路安全任務微調的輕量化模型 Gemini 3.5 Flash Cyber,旨在幫助防禦者快速發現、驗證和修補軟體漏洞。
推薦理由:Google DeepMind 推出了專為網路安全微調的輕量化模型,通過支援高頻率和多輪呼叫,在多個安全基準上展現了優於 mainline 模型和部分競品的漏洞挖掘能力。
Google DeepMind 和 Isomorphic Labs 聯合公佈了生物韌性策略,旨在防止模型被濫用,並與政府及科研機構合作以應對生物安全挑戰。該計劃涵蓋預防、檢測和響應三個核心領域,重點運用 AlphaFold、AlphaGenome、AlphaEvolve 以及 Isomorphic Labs 的 Drug Design Engine 等技術支援病原體監測和疫苗研發。
Google DeepMind 官方釋出了 AI 智慧體安全控制路線圖,旨在通過結合模型對齊與系統級防禦來應對自主智慧體帶來的潛在威脅。該路線圖涵蓋威脅建模、基於監控的預防與響應機制,並已通過分析百萬條程式設計智慧體軌跡來最佳化安全協議與即時監控。
Mistral AI 聯合多方機構完成了首個全面的 AI 模型生命週期分析,量化了 LLMs 的環境足跡。