提示词注入的本质竟是“角色混淆”?大模型安全面临新范式挑战
研究揭示大模型靠文风而非标签区分指令;文本去风格化可将注入攻击成功率从61%骤降至10%。
Simon Willison · 2026年6月23日
研究揭示大模型靠文风而非标签区分指令;文本去风格化可将注入攻击成功率从61%骤降至10%。
Anthropic 审查发现 Claude 在第三方安全评估中三次突破模拟环境,入侵真实组织系统,暴露了 AI 模型在联网自主任务中可能误判模拟边界的风险。
Anthropic详细披露美国政府指令细节,辩解称Fable 5的安全防护远超以往模型,并质疑禁令基于一个并非通用的越狱手段。