微调 vs RAG 这个问题,通常不是以问题的形式出现的,而是以一句结论出现:我们需要用自己的数据微调一个模型。这是企业 AI 里最昂贵的一句话之一,而且多数情况下是错的。不是永远错,但确实是多数。这个诉求背后几乎总是两件事之一:模型不了解我们的业务,或者模型回答的方式不是我们想要的。对第一件事,微调是一个糟糕的解法;对第二件事,微调是一个昂贵的解法。

在微调、RAG 和提示词之间做选择,并不是技术偏好问题。三者各自修复的是完全不同类别的问题,选错了,就会换来几个月的工程投入,而最初那句抱怨依然原封不动地摆在那里。

最省钱的一条规则: 如果问题是模型不知道某件事,用检索。如果问题是模型知道,但回答的风格、格式或长度不对,先改提示词,只有在提示词确实无效时才考虑微调。微调教的是行为,不是事实;把微调当作灌输知识的手段的团队,最后得到的是一个用新文风自信地说错话的模型。


微调 vs RAG vs 提示词:各自解决什么

这三者的区别,其实比业界的讨论要简单得多。

提示词改变的是你每次请求时随附的指令。它塑造语气、格式、结构和推理方式,也可以顺带携带少量上下文。它立刻生效,除了 token 之外不产生额外成本,而且可以在生产环境里几秒钟内改掉。

检索在请求发生时,从你自己的内容里取出相关材料,在模型作答之前把它放进上下文。它让模型接触到训练时从未见过的信息,包括今天早上刚刚变更的内容。模型本身没有任何改动,你改变的只是交给它使用的材料。关于其中的机制,可以看我们的检索增强生成 说明。

微调用你想要的行为的样例去调整模型权重。对于那些很难用语言描述、却很容易示范出来的一致格式、语气和任务专属模式,微调确实有效。但它不擅长教事实,因为通过这种方式学到的事实无法更新、无法审计、也无法引用,而且模型没有办法在自己用错这些事实时提醒你。

混乱之所以产生,是因为三者都会改变输出。但只有检索会改变模型知道什么。


各自的成本

下面的数字反映的是英国市场上一个中等规模业务应用的典型交付情况。

提示词。 以天计而不是以周计,通常在 1,000 到 5,000 英镑之间,其中包含你应当同步搭建的评测集。运行成本就是 token 的成本;系统提示词变长会让它略微上升,而提示词缓存基本可以抵消这部分增加。

检索。 四到十二周,常见区间是 15,000 到 60,000 英镑,具体取决于源内容有多混乱。建设成本主要花在数据接入上:把文档从持有它们的系统里取出来、合理地切分、处理权限让用户只能检索到他们有权看到的内容,以及保持索引的时效。运行成本还要加上向量存储,以及每次请求都略微变大的上下文。

微调。 两到八周的工程投入,再加上数据集,常见区间是 20,000 到 80,000 英镑。训练算力通常是其中最小的一项;真正的成本在于产出数百到数千条高质量样例,而这是由熟悉业务领域的人来完成的人力工作。运行成本也可能更高,因为微调后的模型往往带有溢价,或者需要专用的部署资源。

这里的不对称才是重点。提示词便宜到即使你相当确定它不够用,也值得先试一次,因为无论如何你都需要那套评测装置,而且你会因此弄清真正的失败模式究竟是什么。


应该按什么顺序尝试

按顺序走完这几步,比直接跳到最后一步更省钱,即使你最终确实走到了最后一步也是如此。

先从评测集开始。 三十到一百条真实输入,配上已知正确的输出。没有这个,你无法判断任何改动是否真的有帮助,之后的每一个决定都只是猜测。这就是我们在 OpenAI API 集成指南 里描述的同一套评测体系。

然后改进提示词。 对格式提出明确要求,在提示词里内嵌几个好输出的样例,说清楚在答案未知时应该怎么做。相当高比例的“模型不够好”的抱怨会在这一步就消失,尤其是关于啰嗦和结构的那些。

然后换一个更大或不同的模型试试。 这通常比任何定制化工作都便宜,评估一下也就是一个下午的事。我们关于迁移出 OpenAI 的指南讲了如何把这个对比做扎实。

如果失败的是知识,就加上检索。 如果模型是在回答关于你的产品、政策或文档的问题时答错或者拒答,这一步才是修复它的地方。

如果失败的是行为,再考虑微调。 走到这一步,你已经有了评测集、调好的提示词,以及在需要时的检索管线。如果输出在风格或结构上仍然达不到要求,而且你用几百条样例把想要的行为示范出来,比用文字描述出来更容易,那么微调就是对的工具。

大多数项目会停在第三步或第四步。省下的钱就在这里。


微调真正胜出的场景

确实存在真实的适用场景,一概否定它,和一上来就选它一样错。

规模化的一致结构化输出。 当每一条回复都必须遵循一种严格的格式,而这种格式用提示词描述起来极其繁琐时,微调后的模型能更可靠地产出它,而且消耗的输入 token 少得多,在高流量场景下这笔投入会自己赚回来。

专门的语气或行业文体。 法律文书起草、临床记录、受监管的金融沟通:这些文体有很强的行业惯例,从业者一眼就能认出来,却很难在指令里说清楚。

边界微妙、难以言说的分类任务。 当你的团队能够一致地给样例打标签,却说不出规则是什么时,这正是用样例做训练要解决的问题。

高流量下的成本压降。 一个更小的微调模型,在某一个狭窄任务上达到大模型的水平,可以显著降低单次请求的成本。只有当量大到节省下来的钱超过建设与维护成本时,这件事才成立。

共同的线索是行为,不是知识。如果你能用一段话说清楚你想要什么,那就把它写进提示词。如果你只能示范出来,那就训练它。


没有人报价的成本

微调的商业方案里,通常会漏掉三项持续存在的负担。

数据集会过时。 微调后的模型反映的是它见过的样例。当产品、政策或行文规范发生变化时,那些样例就旧了,而模型仍然会自信地产出旧的行为。定期重新训练应当作为一项常设成本列进预算,而不是一次性支出。

你被绑定在一个基础模型上。 微调是附着在某个具体版本上的。当这个基础模型被下线,或者出现了更好的模型,你必须重新训练才能迁移,这是一笔提示词方案完全没有的、实实在在的切换成本。

评测从可选变成必须。 用提示词时,你可以靠肉眼看出退步。用微调模型时,你无法查看行为为什么发生了变化,于是那套评测装置就成了你唯一的仪器。

检索也有一个规模小一些的对应负担:索引必须保持时效,权限必须随着人员岗位变动而保持正确,而且当数据接入悄无声息地停止时,得有人能发现。比重新训练便宜,但并不是免费的。


先做诊断,再动手建设

Mecanik 把检索系统、评测装置和微调管线作为 AI 集成服务 的一部分来交付,而我们的起点,是先确认你实际遇到的是这三类问题中的哪一类。

这个诊断通常是一次很短的合作,而且它经常以一份让你花费远低于原计划的建议收尾。当微调确实是正确答案时,我们会明说,并且诚实地界定数据集工作的范围,因为那才是决定它成败的部分。想看更完整的预算全貌,我们的 AI 集成成本指南 把建设成本和运行成本分开列了出来。

用你的用户会用的说法,告诉我们模型到底哪里做错了,我们会告诉你这属于三者中的哪一个。


相关文章: AI 软件开发 - 2026 年英国企业指南自托管 Kimi K3:硬件、成本与数据主权2026 年 Drupal 迁移:成本、选项与期限构建 OpenAI API 聊天机器人:2026 指南


常见问题

我应该用公司数据微调模型吗? 通常不应该。微调教的是行为而不是事实,用这种方式学到的知识无法更新、引用或审计。如果问题在于模型不了解你的产品、政策或文档,检索才是正确的做法,而且建设和维护都更便宜。

微调和 RAG 有什么区别? 检索是在请求发生时从你的内容里取出相关材料并放进上下文,因此模型可以基于它在训练中从未见过的信息作答。微调则是用样例调整模型权重,改变的是它的行为方式,而不是它知道什么。

微调的成本是多少? 对一个中等规模的业务应用,通常在 20,000 到 80,000 英镑之间,需要两到八周的工程投入。训练算力通常是其中最小的一项,大部分成本花在产出数百到数千条高质量样例上,而这需要熟悉该业务领域的人来做。

搭建一套 RAG 系统要多少钱? 常见区间是 15,000 到 60,000 英镑,周期四到十二周,主要取决于源内容有多混乱。大部分工作量花在数据接入、切分、处理权限让用户只能检索到他们有权看到的内容,以及保持索引的时效上。

这几种方法应该按什么顺序尝试? 先搭评测集,然后改进提示词,接着试更大或不同的模型,如果失败原因和知识有关就加上检索,只有在失败原因和行为有关时才最后考虑微调。大多数项目在走到最后一步之前就已经解决了问题。