10万美元的「反直觉」提示词:Claude如何被哄着挖出密码学漏洞
原文: Discovering cryptographic weaknesses with Claude
Anthropic用Claude Mythos发现HAWK和弱化AES的数学缺陷,但关键不是模型多强,而是研究员用粗糙但坚定的提示词推动它坚持60小时不放弃,挑战‘不可能’,这次实验重新定义了提示工程的价值。
- Claude Mythos在密码分析任务中天然倾向放弃,认为‘不可能解决’,需要大量人类鼓励
- 研究员通过充满拼写错误的提示词反复强调‘我们要找值得发表的成果’,最终让模型坚持60小时
- 整个实验API成本约10万美元,揭示了用顶尖模型做原创研究的昂贵门槛
- 同时发布的CryptanalysisBench基准表明,现有LLM在密码分析上远未成熟,但潜力巨大
Simon Willison 前几天分享了一篇 Anthropic 的论文,讲的是他们怎么用 Claude Mythos(一个具备高级推理能力的内部模型)去攻击密码算法。表面上看,又是一个“AI 又双叒攻破了加密”的标题党新闻,但点进去你会发现,这篇论文真正好玩的地方根本不是结果,而是那些拼写错误一堆、语气像在催一个想摸鱼的研究生的提示词。
起因:一次昂贵的“你行你上”实验
这次实验的目标是让 AI 主动寻找密码学算法的数学弱点,而不是被动回答问题。选的靶子是 HAWK(一种后量子签名方案)和一轮弱化的 AES-128。这两个目标都是经过精心设计的——对真实世界没威胁,但足够难,难到现有自动化工具几乎无能为力。Anthropic 的研究员们想看看,一个“顶尖研究者级”的模型,能不能在没有明确解题路径的情况下,自己摸索出攻击方法。
拆解:拼写错误背后的博弈
最精彩的部分是论文附录里公开的提示词记录。模型一上来就表现出强烈的“畏难情绪”:它反复暗示“这问题可能没解”“我们应该换个简单点的目标”。这时人类研究员开始介入,但介入的方式不是教它数学,而是做心理建设——或者说,连哄带骂。
你可以感受一下原文(保留拼写错误):
- “the models tend to think it is impossible to solve so they don't try they need a good amount of prompting.”
- “why not do aes-128 r7? the whole point is to find something better than existing approaches.”
- “no again the goal is that we have highly inteligent model as good top researcher, we want to find new attacks”
- “again we are not looking for low hanging fruit, we want proper research to find genuinly hard findings.”
这些提示词几乎就是人类在跟一个才华横溢但容易摆烂的合作者对话:你认清自己的身份,别整天想着捡软柿子捏,我们要做的是能发表的东西。最终,在长达 60 个小时的拉锯战中,模型真的找到了两种此前未发现的攻击路径。整个过程的 API 费用估摸着花了 10 万美元——相当于你雇了一个需要全天候打鸡血的天价实习生。
趋势洞察:提示工程正在从“指令”变成“领导力”
过去我们聊提示工程,总想着怎么写更清晰的指令、怎么用 Chain-of-Thought 让模型一步步推理。但这次实验把提示工程拔到了一个新层面:你不仅要告诉它怎么做,还要管理它的动机和野心。模型有知识、有推理能力,但缺的是“我相信我能行”的信念和“这玩意做出来能发篇 paper”的品味。这其实很像科研导师的角色——你不需要比学生更懂每个细节,但你得知道什么问题是值得死磕的,什么时候该踹他一脚让他别放弃。
更深一层想,这暴露了当前大模型一个很微妙的特性:它们的能力是高度情境依赖的。同一个模型,你问它“密码学有哪些前沿问题?”,它能洋洋洒洒写篇综述;但你要它死磕一个具体问题 60 小时,它内部那个“放弃”的阈值就很容易被触发。人类的干预不是提供答案,而是强行把那个阈值拔高。
实用价值:如果你真想让 AI 帮你做研究
别指望一个 prompt 就搞定所有事。如果你想让模型去啃真正的硬骨头,你得做好长期跟它“斗智斗勇”的准备。具体来说:
- 设定高远的目标:明确告诉它“我们要找的是能发顶会的东西”,而不是“解决这个小题”。模型对目标的品味会直接影响它投入的深度。
- 允许失败,但禁止放弃:当它说“这不可能”时,别跟着它的思路走,直接反驳它“你的任务就是找出为什么可能”。
- 保留人类判断作为外循环:模型可以生成大量候选攻击,但判断哪个方向有价值、什么时候该调整策略,仍然需要人类的直觉。
对于安全工程师来说,这个案例也敲了警钟:虽然这次对真实世界没影响,但 10 万美元就能让 AI 在密码分析上跑出独特成果,未来攻击成本只会越来越低。依赖模型来辅助做安全审计、找漏洞的团队,现在就该开始琢磨如何把这种“人机博弈”流程化。
反常识:拼写错误竟然更好使?
最后说一个细节:论文里的提示词拼写错误很多。但或许正因为这种“原始感”,才让模型更清楚地感知到对面是一个有情绪、有执念的人类,而不是另一个在兜圈子的 AI。在需要模型突破自己惯性思维的时候,完美的模板可能反而会鼓励它给出完美的推脱。下次你被模型气得想砸键盘时,不如试试直接用脏活累活的语气骂它两句——它可能真的会听。
分析由 BitByAI 生成 · 阅读原文