跳到正文
MIT Technology Review · AI· Arthur Holland Michel·· 5 小時前AI 評分66

AI 反抗機制與審查風險:剖析拒絕功能的安全與自由挑戰

We’re putting too much faith in AI’s ability to say no

AI 導讀

AI 被設計為在面臨危險或不當請求時自動拒絕,但這種拒絕機制仍存在缺陷與風險。

  • 拒絕機制來源:Anthropic 2021 研究提出「幫助、誠實、無害」原則,並以紅隊測試、機器教機器方式強化拒絕行為。

來源:MIT Technology Review · AI · technologyreview.com