Fable 5重新上线,但这次Anthropic带来了一套AI越狱“通用量表” Anthropic公开Fable 5安全分类器的四级判定标准,并发布AI越狱严重性框架草案,为行业建立统一的风险沟通语言。 Anthropic News ·
偷取大模型的“内心独白”:加密推理轨迹如何被破解与防御 研究发现主流大模型返回的加密推理块存在跨模型重用密钥漏洞,可通过弱模型越狱还原强模型原始思维链,揭示推理轨迹安全与提示注入新风险。 Simon Willison ·