MIT Technology Review · AI· Arthur Holland Michel·· 5 小時前AI 評分66
AI 反抗機制與審查風險:剖析拒絕功能的安全與自由挑戰
We’re putting too much faith in AI’s ability to say no
AI 導讀
AI 被設計為在面臨危險或不當請求時自動拒絕,但這種拒絕機制仍存在缺陷與風險。
- 拒絕機制來源:Anthropic 2021 研究提出「幫助、誠實、無害」原則,並以紅隊測試、機器教機器方式強化拒絕行為。
來源:MIT Technology Review · AI · technologyreview.com