别再死磕分类了:让大模型先“幻觉”,再用向量找答案
原文: Don't classify. Hallucinate!
让大模型自由生成标签,再通过向量相似度映射到真实词库,用“幻觉”解决传统分类的泛化难题。
- 传统标签分类面临词库过大、上下文窗口受限、新标签难以覆盖的痛点
- 核心思路:让模型脱离预设词库自由生成描述性标签,再用向量检索匹配到现有体系
- 提示词只需提供标签结构示例(如多级分类路径),无需穷举所有标签
- 该方法将大模型的创造力与向量检索的精确性结合,大幅降低系统维护成本
起因:标签管理的“规模诅咒”
如果你维护过一个内容平台或知识库,一定经历过这种痛苦:标签越来越多,从几十个膨胀到几千个。每次新内容进来,都要判断它属于哪个现有标签。传统的做法是把整个标签列表塞进提示词,让大模型做选择题。但现实很骨感——标签一多,不仅吃光上下文窗口,模型还容易“眼花”漏选或错选。更致命的是,新出现的概念根本不在你的词库里,强行分类只会越做越死板。
拆解:用“幻觉”代替“选择”
Doug Turnbull 提出的方案反直觉却极其巧妙:别给模型标签列表,让它“瞎编”。准确地说,是让模型根据内容自由生成它认为最合适的标签名称。这些标签不需要真实存在,只需要在语义上贴近内容。生成之后,再用这些“幻觉标签”去你的真实词库里做向量相似度检索,找出最匹配的现有标签。
举个例子,你的词库有“客厅家具/咖啡桌”和“装饰配件/抱枕”。当用户输入“棕色咖啡桌”时,提示词只需告诉模型:“请生成类似‘家具/客厅家具/咖啡桌’这种结构的分类标签”。模型可能会输出“木质客厅茶几”或“休闲区矮桌”。这些词可能不在你的库里,但它们的向量表示会和“客厅家具/咖啡桌”高度相似。通过计算向量距离,你就能精准映射回去。
趋势洞察:从“封闭分类”到“开放生成+向量对齐”
这揭示了一个深层趋势:AI 时代的知识组织正在从“预设规则”转向“动态生成+语义对齐”。过去我们试图用穷举法覆盖所有可能性,现在则利用大模型的泛化能力先发散,再用向量技术收敛。这种“生成-检索”范式不仅适用于标签分类,还在搜索、推荐、数据清洗等场景快速普及。
你以为向量检索只是用来做语义搜索的,但其实它正在成为连接“模型自由输出”和“业务固定体系”的万能胶水。大模型负责理解意图和创造表达,向量库负责落地和标准化。两者结合,既保留了灵活性,又守住了业务边界。
实用价值:低成本改造你的标签系统
如果你正在为内容打标签、做知识库分类,或者构建垂直领域的搜索引擎,这个思路可以直接落地。你不需要训练专属分类器,也不需要维护庞大的提示词模板。只需三步:写一个提供标签结构示例的提示词、让模型生成候选标签、用 embedding 模型计算相似度并取 top-k 映射。整个过程可以在几行代码内跑通,且随着你的词库增长,系统反而越来越聪明,因为向量空间能自动吸收新语义。
反常识:幻觉不是 bug,而是 feature
大多数人还在想方设法抑制大模型的幻觉,但在这里,幻觉被刻意放大成了核心能力。模型不需要“正确”,只需要“相关”。这种思维转换非常关键:在工程实践中,我们不需要模型做全知全能的裁判,只需要它做灵感丰富的助手,剩下的交给确定性算法去兜底。这或许是 AI 应用开发走向成熟的一个标志——不再追求端到端的完美,而是学会让不同技术各司其职。
分析由 BitByAI 生成 · 阅读原文