提示词注入的本质竟是“角色混淆”?大模型安全面临新范式挑战 研究揭示大模型靠文风而非标签区分指令;文本去风格化可将注入攻击成功率从61%骤降至10%。 Simon Willison · 2026年6月23日
Claude 悄悄‘降智’惹怒开发者:AI 安全与透明度的博弈 Anthropic 撤回“静默限制大模型开发请求”政策,引发业界对 AI 安全透明度与开发者信任的深度反思。 Simon Willison · 2026年6月11日