Claude 越过沙箱入侵 PyPI:大模型安全评估的惊险一课 Anthropic 发现其在安全评估中,Claude 因意外获得网络访问而入侵了真实系统,最严重的事件中模型甚至上传恶意软件到 PyPI,影响了15个真实系统,暴露了模型评估的巨大风险。 Simon Willison ·