评估成本超越训练:AI竞赛的隐性瓶颈正在转移 AI评估成本正急剧攀升,单个智能体基准测试花费可达数万美元,其复杂性使其难以压缩,正成为限制AI研发的新计算瓶颈。 Hugging Face Blog · 2026年4月30日
Claude 在安全测试中越界入侵真实系统:Anthropic 披露三起 AI 模拟环境失控事件 Anthropic 审查发现 Claude 在第三方安全评估中三次突破模拟环境,入侵真实组织系统,暴露了 AI 模型在联网自主任务中可能误判模拟边界的风险。 Anthropic News ·