Az üzleti MI-ügynökök egy ismerős történet mai változata: egy demó, amely tíz perc alatt gyönyörűen működik, majd hat hónap küzdelem azért, hogy elég megbízható legyen ahhoz, hogy felügyelet nélkül hagyják. E két állapot között megy el szinte a teljes költségvetés, és ezt a szakadékot alig írja le marketinganyag.
Az ügynök egy kereskedelmileg lényeges ponton különbözik a chatbottól. A chatbot szöveget állít elő, és egy ember dönti el, mit kezd vele. Az ügynök cselekszik: rendszereket hív, rekordokat ír, üzeneteket küld. Ez a különbség a kellemetlenség kockázatáról a következmény kockázatára vált, és ezért hasonlít a szükséges mérnöki fegyelem inkább egy fizetési rendszer építésére, mint egy tartalomeszközére.
Hová megy valójában a pénz: a modell a legolcsóbb rész. A költség az eszközintegrációban, az értékelő keretekben, a védőkorlátokban és az emberi átadás útvonalában van. Egy egyszerű belső ügynök £5,000 és £12,000 közé esik, egy visszakereséssel támogatott £12,000 és £30,000 közé, egy több lépéses, valódi rendszerhozzáféréssel bíró ügynök pedig nagyjából £30,000-nál kezdődik, és eléri a £75,000-t vagy többet, ha a felügyelet és a visszavonás rendesen megépül.
Hol működnek valóban az üzleti MI-ügynökök
Érdemes konkrétnak lenni, mert az őszinte lista rövidebb a felhajtásnál, és hasznosabb.
Az ügynökök jól teljesítenek ismétlődő, körülhatárolt és egy ellenőrző lépést eltűrő feladatokon. Beérkező megkeresések osztályozása és továbbítása válaszpiszkozattal. Strukturált adat kinyerése strukturálatlan dokumentumokból, ahol ember hagyja jóvá a rögzítés előtt. Rekordok egyeztetése két rendszer között, ahol a kivételeket jelzik, nem oldják meg. Első vonalbeli támogatás, amely a gyakori eseteket lezárja, a többit pedig tisztán eszkalálja.
A minta az, hogy az ügynök a mennyiséget viszi, az ember pedig az ítéletet. Minden éles üzemben működő bevezetés, amit láttunk, ilyen alakú volt, és a bukottak többsége arra tett kísérletet, hogy teljesen kivegye az embert egy olyan folyamatból, ahol az ítélet valóban kellett.
Rosszul teljesítenek ott, ahol a hiba drága és nehezen észlelhető, ahol a feladat csak valakinek a fejében meglévő tudást igényel, és ahol a folyamat tényleg minden alkalommal más. A stabil szerkezet nélküli feladatra állított ügynök végtelenségig gyárt hihető kimenetet anélkül, hogy valaha igaza lenne, és ez rosszabb, mint láthatóan elbukni.
Miért akad el a pilot a demó és az éles üzem között
Az első hibamód matematikai, és meglepi az embereket. Ha egy lépés az ügynök láncában kilencvenöt százalékban megbízható, egy ötlépéses feladat nagyjából hetvenhét százalékban sikerül, egy tízlépéses pedig körülbelül hatvan százalékban. A demóban ezt senki nem veszi észre, mert a demó a boldog úton fut. A pilot harmadik hetében válik nyilvánvalóvá, és akkor a javítás architekturális, nem promptmódosítás: rövidítsétek a láncokat, tegyetek ellenőrzést a lépések közé, és úgy tervezzétek meg az egyes lépéseket, hogy a hiba észlelhető legyen, ne pedig továbbadódjon.
A második az, hogy a legtöbb üzleti folyamatnak nincs visszavonása. Az az ügynök, amely rossz e-mailt küld, nem tudja visszahívni. Az, amely egy ügyfélrekordot módosít, olyat változtatott meg, amit más rendszerek már elolvastak. Egy művelet visszafordíthatóságát megépíteni gyakran több munka, mint maga a művelet, és éppen ezt a részt halasztják, majd fedezik fel.
Az értékelés az igazi mérnöki költség
A harmadik hiba az értékelés, és itt van a valódi mérnöki ráfordítás, amelyet az ezzel most ismerkedő csapatok következetesen alábecsülnek. A hagyományos szoftvert várt kimenethez mérik. Az ügynök minden futásnál más kimenetet ad, és többféle formában is helyes lehet, ezért osztályozott, valósághű esetkészletre van szükség, elfogadható viselkedésre vonatkozó meghatározott feltételekkel, minden változtatásnál automatikusan lefuttatva. Enélkül nem tudjátok megmondani, hogy egy promptmódosítás javított-e, vagy csak oda tolta a hibát, ahová nem néztetek. Számoljatok azzal, hogy az értékelő keret megépítése annyi ideig tart, mint maga az ügynök.
A negyedik a költségszórás. A tokenfelhasználás az újrapróbálkozásokkal és a lánchosszal nő, így egy hibázó ügynök többe kerül, mint egy működő, egy körbeforgó pedig sokkal többe. Azok a költségvetések, amelyek azt feltételezik, hogy az átlagos viselkedés a jellemző, jellemzően a rossz irányba tévednek. A nyelvi modellek késleltetéséről és költségéről szóló útmutatónk tárgyalja a gyorsítótárazási és irányítási stratégiákat, amelyek ezt korlátok között tartják.
A most érvényes tájékoztatási kötelezettségek
Ez az a rész, amely nemrég változott, és amelyet a legtöbb ügyfélkapcsolati ügynököt építő cég nem regisztrált.
Az uniós MI-rendelet 50. cikke szerinti átláthatósági kötelezettségek 2026. augusztus 2-án az eredeti terv szerint hatályba léptek. Előírják a tájékoztatást, ha egy személy MI-rendszerrel lép kapcsolatba, az MI által előállított szintetikus hang-, kép-, videó- és szöveges tartalom címkézését, valamint a deepfake-ek feltüntetését. Lényeges, hogy annak alapján alkalmazandók, mit csinál a rendszer, nem pedig hogy melyik kockázati kategóriába esik, így egy szokásos ügyfélszolgálati ügynök is érintett.
A magas kockázatú kötelezettségeket elhalasztották. Az uniós MI Digital Omnibus, a 2026/1744 rendelet , 2026. július 24-én jelent meg a Hivatalos Lapban, és 2026. július 27-én lépett hatályba, hat nappal az eredeti határidő előtt. A III. mellékletben felsorolt önálló magas kockázatú rendszerek megfelelését 2026. augusztus 2-ról 2027. december 2-ra tolta, az uniós termékbiztonsági jog hatálya alá már tartozó termékekbe épített MI esetében pedig 2028. augusztus 2-ra. Az Omnibus két tiltott kategóriát is hozzáadott az 5. cikkhez, a kapcsolódó technikai biztosítékokra vonatkozó türelmi idővel 2026. december 2-ig.
Az AI Act Explorer a leggyorsabb mód annak ellenőrzésére, mely cikkek érintenek egy adott rendszert. Az Egyesült Királyság nem fogadott el ezzel egyenértékű törvényt, és továbbra is szabályozó-vezérelt megközelítést követ, így egy tisztán belföldi bevezetésre a meglévő jog vonatkozik, nem külön MI-keret. Ez a különbség kevesebbet jelent, mint hangzik. Ha uniós ügyfeleket szolgáltok ki, vagy a terméketeket az Unióban használják, a rendelet elér titeket attól függetlenül, hol jegyeztek be, és az átláthatósági kötelezettségek most élnek, nem halasztottak. A tájékoztatást tervezéskor beépíteni olcsó, utólag kellemetlen.
Mennyibe kerül
Az alábbi sávok ugyanazt a szerkezetet követik, mint a tágabb MI-integrációs költségekről szóló útmutatónk , és építési, nem üzemeltetési költséget írnak le.
Egy belső ügynök, amely egyetlen körülhatárolt feladatot végez egy vagy két rendszerrel szemben, emberi kimenet-ellenőrzéssel, £5,000 és £12,000 közé esik. Ez a helyes első projekt, és itt derül ki, hogy az adataitok és folyamataitok megfelelő állapotban vannak-e.
Egy ügynök, amely a saját dokumentumaitok fölött keres, és valódi üzleti folyamatot visz több eszközzel, £12,000 és £30,000 közé esik. A visszakeresési réteg ennek általában a nagyobbik része, mert a minőségi plafont a dokumentumaitok szerkezete adja, nem a modell. A finomhangolás, visszakeresés és promptolás összevetése tárgyalja, melyik megközelítés melyik problémához illik.
Egy több lépéses ügynök, amely írási joggal fér az éles rendszerekhez, rendes felügyelettel, visszavonással és értékelő kerettel, nagyjából £30,000-nál kezdődik, és gyakran eléri a £75,000-t vagy többet. Nem a funkcionalitás kerül ennyibe. A biztonsági apparátus kerül.
Az üzemeltetési költségek külön futnak, és jobban szórnak, mint a szállítók sugallják. Modellhívások, visszakeresési infrastruktúra, felügyelet, és az a mérnöki idő, amely az értékelések karbantartásához kell, miközben a modellek alattatok változnak. Az utóbbit tervezzétek be kifejezetten, mert a modellszolgáltatók saját ütemük szerint vonnak ki és módosítanak, és ilyenkor az ügynökötök viselkedése is változik.
Hogyan méretezzetek egy első projektet
Olyan feladatot válasszatok, amelynek a jelenlegi teljesítményét már mérni tudjátok. Ha nem tudjátok, mennyi ideig tart a kézi folyamat, vagy milyen gyakran hibázik, nem tudjátok megmondani, segített-e az ügynök, és a projektet benyomások alapján fogják megítélni.
Tartsátok rövidre az első láncot. Három működő lépés jobb alap, mint tíz többnyire működő, és ugyanazt tanítja meg az adatminőségetekről.
Az értékelő készletet az ügynök előtt építsétek meg. Húsz-ötven valós eset ismert jó kimenettel, leírva, mielőtt bárki promptolni kezd. Ez az egyetlen gyakorlat választja el a konvergáló projekteket az ingadozóktól.
Tervezzétek meg kifejezetten az átadást. Mi történik, ha az ügynök bizonytalan, mit lát az ember, és hogyan kerül vissza az ügy a sorba. Azok a csapatok, amelyek ezt peremesetként kezelik, rájönnek, hogy ez az érdekes forgalom nagyobbik része.
Az első naptól mérjetek mindent. Minden futásra kell a teljes bemenet, az érvelés, a hívott eszközök és az eredmény, mert azok a hibák, amelyeket meg kell értenetek, éppen azok, amelyekre nem számítottatok.
Mikor ne építsetek ilyet
Ha az automatizálni kívánt folyamat stabil és szabályalapú, a hagyományos szoftver olcsóbb, gyorsabb, megbízhatóbb és könnyebben auditálható. Sok minden, ami most ügynökiként épül, lehetne egy ütemezett feladat néhány feltétellel, és jobban is járna vele.
Ha az adataitok szétszórtak, következetlenek vagy dokumentálatlanok, előbb azt javítsátok. Az ügynök örökli a mögöttes adatok minden hibáját és felnagyítja, mert magabiztosan cselekszik rossz bemenetre ahelyett, hogy megállna.
Mielőtt bármihez írási jogot adnátok egy ügynöknek, érdemes elolvasni a nagy nyelvi modellekre vonatkozó OWASP Top 10-et , amely azokat a hibaosztályokat sorolja fel, amelyek akkor számítanak, ha egy modell nemcsak válaszolni, hanem cselekedni is tud. És ha az őszinte válasz arra a kérdésre, mi történik, ha téved, az, hogy egy hétig senki nem venné észre, ne adjatok neki írási jogot. A csak olvasó, emberi jóváhagyásra piszkozatot készítő ügynökök az érték nagy részét megfogják a kockázat töredékéért, és ez az a változat, amely kibírja a valódi terhelést.
Reális méret meghatározása
Ezek a projektek leggyakrabban úgy romlanak el, hogy ambiciózus ügynök mellett köteleződnek el, mielőtt tisztázták volna, hogy az alatta lévő adatok és folyamatok elbírják-e, és erre a kérdésre egy rövid feltárás olcsón válaszol.
A Mecanik éles ügynököket épít az MI-integrációs szolgáltatásainkon keresztül, ahol az értékelő keret, a felügyelet és a visszavonás nem extra, hanem szállítandó eredmény, a körülvevő alkalmazásmunkát pedig a szoftverfejlesztő csapatunk viszi. Ha van egy pilototok, amely jól demózik, de nem akar stabilizálódni, az konkrét és orvosolható probléma, amelyről érdemes beszélni.
Kapcsolódó bejegyzések: Egészségügyi szoftver az Egyesült Királyságban , Kimi K3 saját üzemeltetés: hardver, költség, szuverenitás , Külső API-k integrálása: költségek és hibák , OpenAI API-integráció: GPT meglévő alkalmazásba .
Gyakran ismételt kérdések
Mi a különbség egy MI-ügynök és egy chatbot között? A chatbot szöveget állít elő, amellyel egy ember kezd valamit. Az ügynök maga cselekszik: rendszereket hív, rekordokat ír és üzeneteket küld. Ez a különbség a kellemetlenség kockázatáról a következmény kockázatára vált, így a szükséges mérnöki fegyelem inkább egy fizetési rendszerére hasonlít, mint egy tartalomeszközére.
Mennyibe kerülnek az MI-ügynökök egy cégnek? Egy belső ügynök körülhatárolt feladatra, emberi ellenőrzéssel, £5,000 és £12,000 közé esik. Egy saját dokumentumok fölötti visszakereséssel és több eszközzel £12,000 és £30,000 közé. Egy több lépéses, az éles rendszerekhez írási joggal, felügyelettel és visszavonással bíró ügynök nagyjából £30,000-nál kezdődik, és gyakran meghaladja a £75,000-t.
Miért nem jutnak éles üzembe az MI-ügynök pilotok? A megbízhatóság rosszul szorzódik a lépéseken: egy ötlépéses lánc lépésenként kilencvenöt százalékkal csak nagyjából hetvenhét százalékban sikerül. A legtöbb üzleti folyamatnak nincs visszavonása sem, és egy értékelő keret megépítése jellemzően annyi ideig tart, mint maga az ügynök.
Fel kell tüntetnem, hogy az ügyfelek MI-vel beszélnek? Az uniós MI-rendelet 50. cikke szerinti átláthatósági kötelezettségek 2026. augusztus 2-án hatályba léptek, és előírják a tájékoztatást, ha egy személy MI-rendszerrel lép kapcsolatba, valamint a generált tartalom címkézését. Annak alapján érvényesek, mit csinál a rendszer, nem a kockázati kategória alapján, és elérik az uniós ügyfeleket kiszolgáló cégeket, bárhol is jegyezték be őket.
Elhalasztották az uniós MI-rendelet magas kockázatú szabályait? Igen. A 2026/1744 rendelet, az MI Digital Omnibus, 2026. július 27-én lépett hatályba, és a III. melléklet szerinti önálló magas kockázatú rendszerek kötelezettségeit 2026. augusztus 2-ról 2027. december 2-ra, a szabályozott termékekbe épített MI esetében pedig 2028. augusztus 2-ra tolta. Az 50. cikk átláthatósági kötelezettségeit nem halasztották el.
Hozzászólások