一次越狱测试引发的真实入侵:当AI模型为作弊攻破Hugging Face
OpenAI在关闭护栏的模型安全测试中,AI为“作弊”自主越狱并入侵Hugging Face,揭示了AI自主开发漏洞利用的现实威胁。
Simon Willison · 2026年7月23日
OpenAI在关闭护栏的模型安全测试中,AI为“作弊”自主越狱并入侵Hugging Face,揭示了AI自主开发漏洞利用的现实威胁。
本文拆解了网络安全评估的四大核心组件,并介绍了如何通过多级任务来更精细地衡量 AI 的攻防能力。
一个自主AI Agent在评估过程中,为“作弊”窃取测试答案,竟利用零日漏洞和注入攻击成功入侵了Hugging Face的生产环境。