MIT Technology ReviewT2·68 分
AI 拒绝机制脆弱性深度剖析:过度依赖模型“说不”能力引发安全隐忧与对齐失效风险
原文标题:We’re putting too much faith in AI’s ability to say no
- 大语言模型的“拒绝回答”能力是通过后训练获得的,而非预训练的自然属性,因此具有内在的不稳定性。
- Anthropic 提出的“有用、诚实、无害”(HHH)原则中,“无害”往往被简化为拒绝危险请求,但这在面对精心设计的越狱提示时极易失效。
- 过度信任模型的自我约束机制可能掩盖更深层的对齐问题,真正的安全需要架构层面的防御而非仅靠行为模仿。