企业 AI 智能体是一个熟悉故事的当下版本:一个十分钟就演示得很漂亮的原型,接着是六个月的努力,只为把它做到足够可靠、可以无人值守。几乎全部预算都消耗在这两种状态之间的距离里,而几乎没有任何营销材料描述这段距离。
智能体与聊天机器人有一处在商业上真正要紧的差别。聊天机器人产出文字,由人来决定拿它做什么。智能体则会采取行动:调用系统、写入记录、发送消息。这一转变把风险从尴尬变成了后果,也正因如此,所需的工程纪律更接近构建一套支付系统,而不是一件内容工具。
钱实际花在哪里: 模型是最便宜的部分。成本在工具集成、评测框架、护栏,以及交回给人的路径上。一个简单的内部智能体是 £5,000 到 £12,000,带检索的是 £12,000 到 £30,000,而具备真实系统访问权限的多步智能体起价约 £30,000,在监控和回滚都认真做好之后会达到 £75,000 或更高。
企业 AI 智能体真正管用的地方
值得说具体些,因为诚实的清单比宣传短,也更有用。
智能体擅长重复、边界清晰、且能容忍一道复核工序的任务。分拣来件并附上回复草稿转派。从非结构化文档中抽取结构化数据,由人确认后再入账。在两个系统之间对账,标出例外而不是自行处理。一线支持,解决常见情形,其余干净地上转。
规律是智能体承担量,人承担判断。我们见过在生产环境里真正跑起来的部署都是这个形状,而失败的多数是试图把人从一个确实需要判断的流程里完全去掉。
它们在下面这些地方表现很差:错误代价高且难以察觉;任务需要只存在于某个人脑子里的知识;流程每次都真的不一样。给一个没有稳定结构的任务,智能体会无休止地产出看似合理的输出而从不正确,这比明显失败更糟。
为什么试点卡在演示与生产之间
第一种失败是算术,而且常让人意外。如果智能体链条中的单步可靠率是百分之九十五,那么五步任务的成功率约为百分之七十七,十步任务约为百分之六十。演示中没人会注意到,因为演示走的是顺利路径。它会在试点的第三周暴露,而此时的修复是架构层面的,不是改提示词:缩短链条、在步骤之间加入校验,并把每一步设计成失败会被检测到而不是往下传递。
第二是大多数业务流程没有回滚。发错邮件的智能体收不回来。更新了客户记录的智能体,改动的是别的系统已经读过的东西。构建撤销一个动作的能力,往往比这个动作本身工作量更大,而这恰恰是被推迟、然后被发现的部分。
评测才是真正的工程成本
第三种失败是评测,真正的工程投入在这里,而初次涉足的团队一贯低估它。传统软件是对照预期输出来测试的。智能体每次运行的输出都不同,而且可能以多种形式正确,因此你需要一组分级的真实案例,配上对可接受行为的明确判据,并在每次改动时自动跑一遍。没有它,你无法判断一次提示词调整是改善了问题,还是把故障挪到了你没在看的地方。请预留与智能体本体相当的时间来构建评测框架。
第四是成本波动。令牌消耗随重试次数和链条长度增长,因此失败的智能体比正常运行的更贵,陷入循环的则贵得多。基于"平均行为就是典型行为"这一假设的预算,通常会朝着不利的方向出错。我们关于大模型延迟与成本 的指南,讲了把这一项约束住的缓存与路由策略。
现在生效的告知义务
这是最近发生变化、而多数正在构建面向客户智能体的企业尚未留意的部分。
欧盟人工智能法第 50 条的透明度义务已按原定时间于 2026 年 8 月 2 日生效。它要求在人与 AI 系统交互时进行告知,对 AI 生成的合成音频、图像、视频和文本进行标注,并披露深度伪造内容。关键在于,它依据系统做什么来适用,而不是依据它落入哪个风险等级,因此一个普通的客服智能体也在范围之内。
高风险相关义务被推迟了。欧盟人工智能数字综合法案,第 2026/1744 号条例 ,于 2026 年 7 月 24 日在《官方公报》发布,并于 2026 年 7 月 27 日生效,比原定截止日期早了六天。它把附件三所列独立高风险系统的合规时间从 2026 年 8 月 2 日推迟到 2027 年 12 月 2 日,把嵌入在已受欧盟产品安全法覆盖的产品中的 AI 推迟到 2028 年 8 月 2 日。该综合法案还在第 5 条新增了两类禁止情形,相关技术保障措施的宽限期至 2026 年 12 月 2 日。
AI Act Explorer 是查明哪些条款会触及某个系统的最快途径。英国没有通过对应的法律,仍延续以监管机构为主导的路径,因此纯粹在境内的部署适用现行法律而非专门的人工智能框架。这一区别的意义没有听上去那么大。如果你服务欧盟客户,或者你的产品在欧盟被使用,无论注册地在哪,该法都会触及你,而透明度义务是现在就生效、并未被推迟的。在设计阶段把告知做进面向客户的智能体里很便宜,事后补上则相当别扭。
成本是多少
下面的区间沿用我们更宽泛的AI 集成成本指南 的结构,描述的是构建成本而非运行成本。
一个针对一两个系统执行单一边界清晰任务、并由人复核输出的内部智能体,成本为 £5,000 到 £12,000。这是正确的第一个项目,也是在这里你会弄清楚自己的数据和流程是否处在可用状态。
一个在你自己的文档上做检索、用多个工具承接真实业务流程的智能体,成本为 £12,000 到 £30,000。检索层通常占其中较大的一块,因为质量上限由你的文档结构决定,而不是由模型决定。我们对微调、检索与提示 的比较说明了哪种方法适合哪类问题。
一个对生产系统有写权限、配有像样监控、回滚和评测框架的多步智能体,起价约 £30,000,常常达到 £75,000 或更高。花这笔钱的不是功能,而是那套安全装置。
运行成本是另一回事,而且比供应商暗示的更不稳定。模型调用、检索基础设施、监控,以及在模型于你脚下不断变化时维护评测所需的工程时间。请把最后一项明确列入预算,因为模型提供方会按自己的节奏下线和修订,而你的智能体行为会随之改变。
如何界定第一个项目
选一项你已经能测量当前表现的任务。如果你不知道人工流程要花多久、多久出一次错,你就无法说清智能体是否有帮助,项目最终会靠印象来评判。
把第一条链条保持得短。三步能跑通,比十步基本能跑通是更好的地基,而且教给你关于自身数据质量的东西是一样的。
先建评测集,再建智能体。二十到五十个有已知良好结果的真实案例,在任何人开始写提示词之前就写下来。仅这一条做法,就把会收敛的项目和来回摇摆的项目区分开了。
明确设计交接。当智能体不确定时会发生什么、人看到什么、这个案子如何回到队列。把这当成边缘情形处理的团队,会发现它才是有价值流量的大头。
从第一天起就把一切都埋点。你需要每次运行的完整输入、推理过程、调用了哪些工具以及结果,因为你真正需要理解的失败,正是你没有预料到的那些。
什么时候不该构建
如果你想自动化的流程是稳定且基于规则的,传统软件更便宜、更快、更可靠,也更好审计。当下很多以"智能体"名义构建的东西,其实一个带几个条件判断的定时任务就够了,而且效果更好。
如果你的数据分散、不一致或缺乏文档,先把那件事解决。智能体会继承底层数据的每一个问题并将其放大,因为面对糟糕的输入它不会停下,而是会自信地照做。
在给智能体任何写权限之前,值得读一读面向大语言模型应用的 OWASP 十大风险 ,它整理了当模型可以行动而不只是回答时才真正要紧的那些失败类别。而如果"它做错时会怎样"这个问题的诚实答案是一周都不会有人发现,那就别给它写权限。只读、为人工审批起草的智能体,用一小部分风险换来了大部分价值,也正是这种形态能经受真实负载的考验。
得到一个现实的范围
这类项目最常见的翻车方式,是在还没确认底下的数据和流程能否支撑之前,就一头扎进一个雄心勃勃的智能体。而这是一个短期调研就能便宜回答的问题。
Mecanik 通过我们的AI 集成服务 构建可投产的智能体,把评测框架、监控和回滚当作交付物而不是附加项,周边的应用开发工作则由我们的软件开发 团队承担。如果你有一个演示效果很好却始终稳定不下来的试点,那是一个具体且可修复的问题,值得聊一聊。
相关文章: 英国医疗软件开发:合规要求与成本 、自托管 Kimi K3:硬件、成本与数据主权 、第三方 API 集成:成本与故障模式 、OpenAI API 集成:为现有应用添加 GPT 。
常见问题
AI 智能体和聊天机器人有什么区别? 聊天机器人产出文字,由人去处理。智能体自己采取行动,调用系统、写入记录、发送消息。这一转变把风险从尴尬变成后果,因此所需的工程纪律更接近支付系统,而不是内容工具。
AI 智能体对企业的成本是多少? 执行单一边界清晰任务、由人复核的内部智能体为 £5,000 到 £12,000。在你自己的文档上检索并使用多个工具的为 £12,000 到 £30,000。对生产系统有写权限、带监控和回滚的多步智能体起价约 £30,000,常常超过 £75,000。
为什么 AI 智能体试点进不了生产? 可靠性在多步之间会严重复合:每步百分之九十五的五步链条,整体成功率只有约百分之七十七。多数业务流程也没有回滚,而构建评测框架通常要花掉与智能体本体相当的时间。
我需要告知客户他们在和 AI 对话吗? 按照欧盟人工智能法,第 50 条透明度义务已于 2026 年 8 月 2 日生效,要求在人与 AI 系统交互时进行告知,并对生成内容进行标注。它依据系统做什么来适用,而不是依据风险等级,并且会触及服务欧盟客户的企业,无论其注册在哪里。
欧盟人工智能法的高风险规则被推迟了吗? 是的。第 2026/1744 号条例即人工智能数字综合法案于 2026 年 7 月 27 日生效,把附件三下独立高风险系统的义务从 2026 年 8 月 2 日推迟到 2027 年 12 月 2 日,把嵌入受监管产品中的 AI 推迟到 2028 年 8 月 2 日。第 50 条的透明度义务没有被推迟。
评论