企業 AI 代理人是一個熟悉故事的當下版本:一個十分鐘就展示得很漂亮的原型,接著是六個月的努力,只為把它做到夠可靠、可以無人看管。幾乎全部預算都消耗在這兩種狀態之間的距離裡,而幾乎沒有任何行銷資料描述這段距離。
代理人與聊天機器人有一處在商業上真正要緊的差別。聊天機器人產出文字,由人來決定拿它做什麼。代理人則會採取行動:呼叫系統、寫入紀錄、發送訊息。這一轉變把風險從尷尬變成了後果,也正因如此,所需的工程紀律更接近建置一套支付系統,而不是一件內容工具。
錢實際花在哪裡: 模型是最便宜的部分。成本在工具整合、評測框架、護欄,以及交回給人的路徑上。一個簡單的內部代理人是 £5,000 到 £12,000,帶檢索的是 £12,000 到 £30,000,而具備真實系統存取權限的多步代理人起價約 £30,000,在監控與回滾都認真做好之後會達到 £75,000 或更高。
企業 AI 代理人真正管用的地方
值得說具體些,因為誠實的清單比宣傳短,也更有用。
代理人擅長重複、邊界清楚、且能容忍一道複核工序的任務。分揀來件並附上回覆草稿轉派。從非結構化文件中擷取結構化資料,由人確認後再入帳。在兩個系統之間對帳,標出例外而不是自行處理。第一線支援,解決常見情形,其餘乾淨地上轉。
規律是代理人承擔量,人承擔判斷。我們見過在正式環境裡真正跑起來的部署都是這個形狀,而失敗的多數是試圖把人從一個確實需要判斷的流程裡完全拿掉。
它們在下面這些地方表現很差:錯誤代價高且難以察覺;任務需要只存在於某個人腦子裡的知識;流程每次都真的不一樣。給一個沒有穩定結構的任務,代理人會無休止地產出看似合理的輸出而從不正確,這比明顯失敗更糟。
為什麼試點卡在展示與正式上線之間
第一種失敗是算術,而且常讓人意外。如果代理人鏈條中的單步可靠率是百分之九十五,那麼五步任務的成功率約為百分之七十七,十步任務約為百分之六十。展示中沒人會注意到,因為展示走的是順利路徑。它會在試點的第三週暴露,而此時的修復是架構層面的,不是改提示詞:縮短鏈條、在步驟之間加入檢核,並把每一步設計成失敗會被偵測到而不是往下傳遞。
第二是大多數業務流程沒有回滾。寄錯信的代理人收不回來。更新了客戶紀錄的代理人,改動的是別的系統已經讀過的東西。建立撤銷一個動作的能力,往往比這個動作本身工作量更大,而這恰恰是被延後、然後被發現的部分。
評測才是真正的工程成本
第三種失敗是評測,真正的工程投入在這裡,而初次涉足的團隊一貫低估它。傳統軟體是對照預期輸出來測試的。代理人每次執行的輸出都不同,而且可能以多種形式正確,因此你需要一組分級的真實案例,配上對可接受行為的明確判準,並在每次改動時自動跑一遍。沒有它,你無法判斷一次提示詞調整是改善了問題,還是把故障挪到了你沒在看的地方。請預留與代理人本體相當的時間來建置評測框架。
第四是成本波動。權杖消耗隨重試次數與鏈條長度增長,因此失敗的代理人比正常運作的更貴,陷入迴圈的則貴得多。基於「平均行為就是典型行為」這一假設的預算,通常會朝著不利的方向出錯。我們關於大型語言模型延遲與成本 的指南,講了把這一項約束住的快取與路由策略。
現在生效的告知義務
這是最近發生變化、而多數正在建置面向客戶代理人的企業尚未留意的部分。
歐盟人工智慧法第 50 條的透明度義務已按原定時間於 2026 年 8 月 2 日生效。它要求在人與 AI 系統互動時進行告知,對 AI 生成的合成音訊、影像、影片與文字進行標示,並揭露深度偽造內容。關鍵在於,它依據系統做什麼來適用,而不是依據它落入哪個風險等級,因此一個普通的客服代理人也在範圍之內。
高風險相關義務被延後了。歐盟人工智慧數位綜合法案,第 2026/1744 號規則 ,於 2026 年 7 月 24 日在《官方公報》發布,並於 2026 年 7 月 27 日生效,比原定截止日期早了六天。它把附件三所列獨立高風險系統的合規時間從 2026 年 8 月 2 日延後到 2027 年 12 月 2 日,把嵌入在已受歐盟產品安全法涵蓋的產品中的 AI 延後到 2028 年 8 月 2 日。該綜合法案還在第 5 條新增了兩類禁止情形,相關技術保障措施的寬限期至 2026 年 12 月 2 日。
AI Act Explorer 是查明哪些條款會觸及某個系統的最快途徑。英國沒有通過對應的法律,仍延續以主管機關為主導的路徑,因此純粹在境內的部署適用現行法律而非專門的人工智慧框架。這一區別的意義沒有聽上去那麼大。如果你服務歐盟客戶,或者你的產品在歐盟被使用,無論註冊地在哪,該法都會觸及你,而透明度義務是現在就生效、並未被延後的。在設計階段把告知做進面向客戶的代理人裡很便宜,事後補上則相當彆扭。
成本是多少
下面的區間沿用我們更寬泛的AI 整合成本指南 的結構,描述的是建置成本而非運行成本。
一個針對一兩個系統執行單一邊界清楚任務、並由人複核輸出的內部代理人,成本為 £5,000 到 £12,000。這是正確的第一個專案,也是在這裡你會弄清楚自己的資料與流程是否處在可用狀態。
一個在你自己的文件上做檢索、用多個工具承接真實業務流程的代理人,成本為 £12,000 到 £30,000。檢索層通常佔其中較大的一塊,因為品質上限由你的文件結構決定,而不是由模型決定。我們對微調、檢索與提示 的比較說明了哪種方法適合哪類問題。
一個對正式系統有寫入權限、配有像樣監控、回滾與評測框架的多步代理人,起價約 £30,000,常常達到 £75,000 或更高。花這筆錢的不是功能,而是那套安全裝置。
運行成本是另一回事,而且比供應商暗示的更不穩定。模型呼叫、檢索基礎設施、監控,以及在模型於你腳下不斷變化時維護評測所需的工程時間。請把最後一項明確列入預算,因為模型供應方會按自己的節奏下線與修訂,而你的代理人行為會隨之改變。
如何界定第一個專案
選一項你已經能量測目前表現的任務。如果你不知道人工流程要花多久、多久出一次錯,你就無法說清代理人是否有幫助,專案最終會靠印象來評判。
把第一條鏈條保持得短。三步能跑通,比十步大致能跑通是更好的地基,而且教給你關於自身資料品質的東西是一樣的。
先建評測集,再建代理人。二十到五十個有已知良好結果的真實案例,在任何人開始寫提示詞之前就寫下來。僅這一條做法,就把會收斂的專案和來回擺盪的專案區分開了。
明確設計交接。當代理人不確定時會發生什麼、人看到什麼、這個案子如何回到佇列。把這當成邊緣情形處理的團隊,會發現它才是有價值流量的大宗。
從第一天起就把一切都埋點。你需要每次執行的完整輸入、推論過程、呼叫了哪些工具以及結果,因為你真正需要理解的失敗,正是你沒有預料到的那些。
什麼時候不該建置
如果你想自動化的流程是穩定且基於規則的,傳統軟體更便宜、更快、更可靠,也更好稽核。當下很多以「代理人」名義建置的東西,其實一個帶幾個條件判斷的排程工作就夠了,而且效果更好。
如果你的資料分散、不一致或缺乏文件,先把那件事解決。代理人會繼承底層資料的每一個問題並將其放大,因為面對糟糕的輸入它不會停下,而是會自信地照做。
在給代理人任何寫入權限之前,值得讀一讀針對大型語言模型應用的 OWASP 十大風險 ,它整理了當模型可以行動而不只是回答時才真正要緊的那些失敗類別。而如果「它做錯時會怎樣」這個問題的誠實答案是一週都不會有人發現,那就別給它寫入權限。唯讀、為人工審批起草的代理人,用一小部分風險換來了大部分價值,也正是這種形態能經受真實負載的考驗。
得到一個務實的範圍
這類專案最常見的翻車方式,是在還沒確認底下的資料與流程能否支撐之前,就一頭栽進一個雄心勃勃的代理人。而這是一個短期調研就能便宜回答的問題。
Mecanik 透過我們的AI 整合服務 建置可上線的代理人,把評測框架、監控與回滾當作交付物而不是附加項,周邊的應用開發工作則由我們的軟體開發 團隊承擔。如果你有一個展示效果很好卻始終穩定不下來的試點,那是一個具體且可修復的問題,值得聊一聊。
相關文章: 英國醫療軟體開發:法規要求與成本 、自架 Kimi K3:硬體、成本與資料主權 、第三方 API 整合:成本與故障模式 、OpenAI API 整合:為既有應用加入 GPT 。
常見問題
AI 代理人和聊天機器人有什麼區別? 聊天機器人產出文字,由人去處理。代理人自己採取行動,呼叫系統、寫入紀錄、發送訊息。這一轉變把風險從尷尬變成後果,因此所需的工程紀律更接近支付系統,而不是內容工具。
AI 代理人對企業的成本是多少? 執行單一邊界清楚任務、由人複核的內部代理人為 £5,000 到 £12,000。在你自己的文件上檢索並使用多個工具的為 £12,000 到 £30,000。對正式系統有寫入權限、帶監控與回滾的多步代理人起價約 £30,000,常常超過 £75,000。
為什麼 AI 代理人試點進不了正式環境? 可靠性在多步之間會嚴重複合:每步百分之九十五的五步鏈條,整體成功率只有約百分之七十七。多數業務流程也沒有回滾,而建置評測框架通常要花掉與代理人本體相當的時間。
我需要告知客戶他們在和 AI 對話嗎? 依照歐盟人工智慧法,第 50 條透明度義務已於 2026 年 8 月 2 日生效,要求在人與 AI 系統互動時進行告知,並對生成內容進行標示。它依據系統做什麼來適用,而不是依據風險等級,並且會觸及服務歐盟客戶的企業,無論其註冊在哪裡。
歐盟人工智慧法的高風險規則被延後了嗎? 是的。第 2026/1744 號規則即人工智慧數位綜合法案於 2026 年 7 月 27 日生效,把附件三下獨立高風險系統的義務從 2026 年 8 月 2 日延後到 2027 年 12 月 2 日,把嵌入受規範產品中的 AI 延後到 2028 年 8 月 2 日。第 50 條的透明度義務沒有被延後。
評論