← 返回首页 — Simon Willison — 进阶
行业观点 · 深度解读 · IMPACT 8/10

当AI开始写65%的代码:Anthropic内部曝光的反直觉提示工程真相

原文: When AI Writes 65% of the Code: Counterintuitive Prompt Engineering Truths from Inside Anthropic

Anthropic团队透露,Claude Tag已自动提交65%的工程PR,新模型下系统提示精简80%反而提升性能,负面指令可能降低输出质量。

核心要点
  • Claude Code团队65%的产品工程PR由Claude Tag自动提交,功能先内部试用,留存高才外发
  • Fable等新模型颠覆提示工程:系统提示精简80%,添加示例已非最佳实践,负面指令反降质量
  • 编码代理改变工作流:从逐行监督到一键委托,开发者被建议设定更宏大的目标对抗AI带来的'Deep Blue'效应
  • 自动化代码审查在外层代码普及,核心变更仍保留人工审核
  • Anthropic内部'蚂蚁食'文化和公开的Slack协作是AI工具快速迭代的关键
深度解读

去年 Claude Code 还只是 Claude 3.7 Sonnet 发布稿里的一个项目符号,如今它已经长成了 Anthropic 内部的主力编程力量。在最近的 AI 工程师大会上,Claude Code 团队的 Cat Wu 和 Thariq Shihipar 与 Simon Willison 进行了一场炉边谈话,透露了许多反直觉的内部实践:从 65% 的 PR 由 AI 自动提交,到系统提示缩减 80%,再到“负面指令反而降低质量”的发现,这些信息揭示了我们可能正在用旧思路使用新 AI。

提示工程的范式转移:少即是多 大多数开发者还在精心编写冗长的系统提示,添加大量示例和“不要做 X”的约束。但 Anthropic 发现,对于 Fable 甚至 Opus 4.8 这类新模型,这已经不再是好办法。他们最近将 Claude Code 的系统提示缩小了 80%,因为模型自己就能推断任务意图,多余的说明反而干扰理解。更令人意外的是,列出“不要做什么”往往会降低结果质量——模型似乎将注意力集中在了“不要”的事情上,反而更容易踩坑。这像在教一个聪明的新同事:比起厚厚的操作手册,点出关键原则反而让他表现更好。

从监督到委托:编码代理重塑开发者角色 Cat 回忆说,Claude Code 刚推出时,开发者会逐行监控、频繁拒绝代理的建议;而现在,有了 Fable 这样的模型,许多功能可以一键完成,人们得以放手思考产品体验等更高阶的问题。Thariq 则指出,AI 接管枯燥编码后,开发者容易感到一种空虚(他称之为“深蓝效应”,借用了 1997 年棋手们面对深蓝时的失落),而应对之道是设立更远大的目标——当 AI 卸下细节负担,人就应该专注在更大的问题上。

分层信任:自动化的边界在哪里 尽管自动化程度提高,Claude Code 团队仍然为关键变更保留人工审查。但产品的外围功能已大量交由 AI 做代码审查,这形成了一种分层的信任体系。Auto Mode 是其中的关键:它允许代理在无人干预的情况下运作一段时间,这正是 Claude Tag 能自动提交 65% PR 的基础。团队强调,内部人员会先使用这些功能,只有那些被频繁使用的特性才会对外发布——一次严格的内部验证。

内部文化:公开协作加速迭代 Anthropic 内部将“吃狗食”称为“吃蚁食”(ant fooding),更引人注目的是他们公开的内部协作方式。Claude Tag 深度集成在 Slack 的公开发频道中,所有成员都能看到 AI 如何被使用、如何出问题。这种透明环境不仅让错误被更快发现,也让最佳实践自然传播。可以说,Anthropic 的成功不仅源于模型能力,也来自这种允许 AI 在众目睽睽下成长的文化。

这场对话给我们的启示很清晰:别再执着于旧式提示工程,尝试精简指令、信任模型;主动用 AI 处理代码外层工作,但为核心保留人工审查;以及,在你的团队中建立公开的 AI 使用文化,让进步可见。当 AI 开始写 65% 的代码时,重要的不是恐慌,而是重新思考我们的角色。


原文地址: When AI Writes 65% of the Code: Counterintuitive Prompt Engineering Truths from Inside Anthropic

分析由 BitByAI 生成 · 阅读原文

原文来自 Simon Willison · 由 BitByAI 自动解读