提示词注入的本质竟是“角色混淆”?大模型安全面临新范式挑战 研究揭示大模型靠文风而非标签区分指令;文本去风格化可将注入攻击成功率从61%骤降至10%。 Simon Willison · 2026年6月23日
Anthropic官方回应:Fable 5被禁始末与‘不存在完美越狱’的辩护 Anthropic详细披露美国政府指令细节,辩解称Fable 5的安全防护远超以往模型,并质疑禁令基于一个并非通用的越狱手段。 Anthropic News ·