A legtöbb csapat közvetlenül az alkalmazáskódból hívja a modellszolgáltatót. Az API-kulcs egy környezeti változóban ül, az SDK-hívás három sor, és elsőre működik. A Cloudflare AI Gateway amiatt létezik, ami ezután következik. Megérkezik a számla, és senki nem tudja megmondani, melyik funkció okozta. A szolgáltatónak rossz délutánja van, és magával rántja a terméket. Valaki átírja a rendszerpromptot, és nem marad nyoma annak, mit adott vissza a régi.

A gateway egy proxy az alkalmazásod és a szolgáltató között. Minden kérés áthalad rajta, tehát minden kérés megszámolható, naplózható, gyorsítótárazható, sebességkorlátozható, és ha a szolgáltató elesik, máshol újrapróbálható. Ez a legolcsóbb szerkezeti javítás három olyan problémára, amelyet egyébként későn és kézzel oldanak meg.

Következik, hogy mit csinál, mit kényszerít ki szemben azzal, amit csak megfigyel, mennyibe kerül pénzben és ezredmásodpercben, és hol húzódnak az őszinte határai.

Tényleg pénzt takarít meg, ha gateway kerül a modell-API elé? Nem közvetlenül. A Cloudflare AI Gateway magja minden csomagban ingyenes, és semmit nem tesz rá az inferencia árára, tehát a megtakarítás abból származik, amit megmutat, nem abból, amit blokkol. A funkciónkénti költségbontás megmondja, a termék melyik része drága, a gyorsítótár kiveszi az ismételt azonos hívásokat ott, ahol ez biztonságos, a tartalék útválasztás pedig megakadályozza, hogy a szolgáltató kiesése a te kieséseddé váljon. A költségkeret kikényszerítése létezik, de az, hogy mi történik a keret kimerülésekor, terméktervezési és nem beállítási kérdés.


A három kérdés, amelyre egy közvetlen modellhívás nem tud válaszolni

A gateway mellett szóló minden érv visszavezethető három kérdés egyikére, amelyet a közvetlen SDK-hívás megválaszolatlanul hagy. Az elvont változat, a láthatóság és a kontroll, senkit nem győz meg, akinek indokolnia kell a munkát.

Senki nem tudja a számlát hozzárendelni

A tokenalapú számlázás fogyasztásfüggő, a szolgáltatói számlák pedig összesítenek. API-kulcsonként kapsz havi végösszeget, nem funkciónkénti végösszeget. Ha egy összefoglaló, egy csevegőasszisztens és egy éjszakai osztályozási feladat osztozik egy kulcson, a számla nem tudja megmondani, melyikük háromszorozódott meg. A szokásos válasz a funkciónkénti kulcs, ami addig működik, amíg tizenegy funkciód és egy kulcscsere-szabályzatod nem lesz.

Senki nem tudja a hibát reprodukálni

Amikor egy hívás az alkalmazáskódon belül elhasal, csak az marad meg, amit a naplózód elkapott, rendszerint egy állapotkód és egy csonkolt üzenet. Ritkán a pontos prompt, a válaszoló modell verziója vagy az a késleltetés, amelynél feladta. Egy incidens másnapi reprodukálása találgatássá válik a bemenetekről. Közben a szolgáltató kiesése egyenesen a felhasználóidig ér.

Semmi nem fogja meg az elszabadult ciklust

Egy önmagát újrapróbáló ügynök, egy sorfogyasztó, amely hiba esetén újrakézbesít, vagy egy ciklus, amelynek leállási feltételét a modell folyton teljesítetlennek ítéli: mindegyik több ezer hívást tud generálni, mielőtt bárki észrevenné. Ha semmi nem számol az útvonalon, az első jelzés a számla. A felhasználónkénti korlátok és a kemény leállítások addig nem léteznek, amíg egy útvonalba tett komponens ki nem kényszeríti őket, és az alkalmazáskód rossz hely erre, mert minden hívási pontnak emlékeznie kell rá.

Mi a Cloudflare AI Gateway, és hol ül a kérés útvonalán

A Cloudflare AI Gateway áttekintése olyan szolgáltatást ír le, amely az alkalmazásod és az MI-modellszolgáltatók között ül, hogy figyelhesd a használatot és kezelhesd, hogyan skálázódik az alkalmazás. A funkciók az analitika, a naplózás, a gyorsítótárazás, a sebességkorlátozás és az újrapróbálás tartalékkal, minden Cloudflare-csomagban. A Cloudflare azt állítja, egyetlen sor kód kell az induláshoz, és az integráció alakja miatt ez majdnem igaz.

Az integráció egy alap-URL cseréje

Ahelyett, hogy az SDK-t a szolgáltatóra irányítanád, egy olyan gateway-címre irányítod, amely a fiókazonosítódat, a gateway-azonosítódat és a szolgáltató nevét hordozza. A Cloudflare az OpenAI-formát így dokumentálja: https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai, amelyet baseURL néven adsz meg a kliens létrehozásakor. A modellnevek, a paraméterek, a streamelés és a válasz feldolgozása változatlan marad. A Cloudflare szolgáltatói listája két tucat szolgáltatást fed le ugyanezzel a mintával, köztük az OpenAI, az Anthropic, a Google Vertex AI, az Amazon Bedrock, az Azure OpenAI, a Mistral, a Groq, a DeepSeek, az xAI és a Cloudflare saját Workers AI szolgáltatását.

Mit jelent ez az alak

A bevezetés valóban olcsó: szolgáltatásonként egyetlen beállítási érték, amely visszaállítással visszavonható, és ettől ez azon kevés infrastrukturális változtatás egyike, amelyet projektterv nélkül ki lehet próbálni.

A szolgáltatói kulcsod mostantól a Cloudflare-en halad át, mert a proxynak továbbítania kell, hacsak nem térsz át tárolt kulcsokra vagy a Cloudflare által kezelt hitelesítő adatokra. Ez bizalmi döntés, nem részletkérdés.

És minden, amit kínál, azzal határolt, amit egy proxy láthat. Kéréseket és válaszokat lát, nem az alkalmazásod szándékát, ezért a hozzárendeléshez neked kell címkézned a kéréseket, ahelyett hogy azt várnád, a gateway kitalálja, mire szolgált egy hívás.

Az analitika és a naplózás azok a funkciók, amelyek a pénzt megtakarítják

A gateway minden kérést megszámol. A Cloudflare naplózási dokumentációja felsorolja, mit tartalmaz egy bejegyzés: a felhasználói promptot, a modell válaszát, a szolgáltatót, az időbélyeget, a kérés állapotát, a tokenfogyasztást, a költséget, az időtartamot és a kliens böngészőazonosítóját. Kérésenként és nem havonta, ráadásul lekérdezhetően.

Mondd ki nyíltan, miért itt van a pénz, és nem a kikényszerítő funkciókban. A költés blokkolása a leállított hívások árát spórolja meg, ami korlátos. Az, hogy tudod, hová megy a költés, megváltoztatja, mit építesz, és ez nem korlátos.

A hozzárendelés nem történik meg magától. Az egyedi metaadatok a saját címkéidet csatolják, például a funkció vagy az ügyfél nevét, hogy az analitika ezek szerint csoportosíthasson. Ha ezt kihagyod, egy végösszeget kapsz, vagyis pontosan azt, amit a számla már megadott.

A gyorsítótár és az esetek, amikor egy találat tönkreteszi a terméket

A gyorsítótárazás az a funkció, amelyet a leggyakrabban rossz okból kapcsolnak be, és amely a leginkább képes csendben tönkretenni egy terméket.

Hogyan épül fel a gyorsítótárkulcs

A Cloudflare gyorsítótárazási dokumentációja szerint a kulcs a szolgáltató, a végpont, a modell, a hitelesítési fejléc és a teljes kéréstörzs SHA-256 lenyomata. A mindenre kiterjedő pontos egyezés találat, minden más tévesztés. Egy találathoz tehát bájtazonos kérés kell, ami egy felhalmozott előzményt cipelő csevegővégponton az első kör után ritkaság. A minimális élettartam 60 másodperc, a maximális egy hónap. A kérésenkénti vezérlést a cf-aig-cache-ttl, a cf-aig-skip-cache és a cf-aig-cache-key adja, míg a cf-aig-cache-status HIT vagy MISS értéket ad vissza, hogy mérhesd a valódi találati arányt.

Mikor biztonságos a találat és mikor nem

A találat ott biztonságos, ahol azonos bemenetnek azonos kimenetet kell adnia, és az elavulás elfogadható: osztályozás, strukturált kinyerés, rögzített szövegek fordítása, változatlan dokumentumok beágyazásai, kiértékelési forgalom. Ott nem biztonságos, ahol a termék értéke a változatosságtól függ. Ha két felhasználó ugyanazt kérdezi, és a második az elsőnek generált választ kapja, a hőmérséklet-beállításod puszta díszlet.

A súlyosabb hiba adatvédelmi. Ha a kéréstörzsben semmi nem különbözteti meg a felhasználókat, egy gyorsítótárazott válasz átléphet egy felhasználói határt, és ez adatkiszivárgás, nem minőségi probléma. A gyorsítótárazás emellett csak szöveges és képi válaszokra terjed ki.

Sebességkorlátozás, újrapróbálás és tartalék útválasztás

Ezt a hármat együtt szokás megbízhatósági funkcióként leírni. Csak az egyikük szorítja meg érdemben a költséget.

A sebességkorlát a kéréseket fogja meg, nem a tokeneket

A Cloudflare rögzített és csúszó ablakot kínál, és a korlát fölötti kérések 429-es választ kapnak. Figyeld meg, mit számol: kéréseket. Egyetlen nagyon nagy kontextust cipelő hívás sokkal többe kerül egy rövidnél, és a korlátozó nem tudja megkülönböztetni őket. A sebességkorlátozás az elszabadult ciklustól és a visszaélésszerűen használt végponttól véd, nem a drága prompttól, és költségkontrollként kezelni a szokásos hiba.

Újrapróbálás és időkorlátok

A Cloudflare kéréskezelési fejlécei legfeljebb 5 próbálkozást engednek a cf-aig-max-attempts fejléccel, legfeljebb 5000 ezredmásodperces késleltetést a cf-aig-retry-delay fejléccel, és állandó, lineáris vagy exponenciális stratégiát a cf-aig-backoff fejléccel. A cf-aig-request-timeout fejlécet attól mérik, hogy a válasz első része megérkezik, tehát streamelt híváson inkább az első bájtig eltelt időre vonatkozó korlát, mint a teljes időtartamra. Az utolsó próbálkozásnál a gateway megvárja a kérés befejeződését, bármeddig tartson is.

A tartalék útválasztás alakot váltott

A Universal Endpoint, amely szolgáltatói objektumok tömbjét vette át és hiba esetén végigjárta, elavult. A Cloudflare mostantól az OpenAI-kompatibilis végpont felé tereli az új integrációkat, a tartalékokhoz, az újrapróbálásokhoz és a feltételes útválasztáshoz pedig a Dynamic Routing felé. A dinamikus útvonal egy elnevezett, verziózott folyamat, amelyet vizuálisan vagy JSON-ként építesz, és amely modellcsomópontokból, a kéréstörzs, a fejlécek vagy a metaadatok szerint elágazó feltételes csomópontokból, A/B-tesztekhez való százalékos csomópontokból, valamint sebesség- és költségkeret-korlát csomópontokból áll, amelyek túllépéskor tartalékra terelnek. Úgy hívod meg, hogy az útvonal nevét írod oda, ahová a modell neve kerülne.

Annak vizsgálata, ami bemegy és ami visszajön

Mivel a proxy a csere mindkét felét kezében tartja, ki is tudja értékelni őket. A Cloudflare Guardrails elfogja a felhasználói promptokat és a modellválaszokat, felülvizsgálatra jelöli vagy továbbhaladásában blokkolja a tartalmat, és egyetlen szabályzatot alkalmaz attól függetlenül, melyik szolgáltató válaszolt.

Az útvonalba, nem pedig a kódba tett szabályzat mellett az szól, hogy az alkalmazásszintű moderálást hívási pontonként egyszer meg kell írni, és a múlt héten hozzáadott hívási pont az, amelyik kimarad. Az ára az, hogy a vizsgálat maga is inferencia: a Guardrails tokenalapú Workers AI használatként számlázódik, tehát az ár a vizsgált szöveg hosszával nő. Az adatszivárgás megelőzését szolgáló ellenőrzés minden csomagban ingyenes.

Mi változott a 2026 augusztusi Agents Week alatt

A Cloudflare 2026. augusztus 3. és 7. között tartotta az első Agents Week rendezvényét, és az utolsó napon tette közzé a Workers AI és az AI Gateway egyesítését egyetlen vezérlősíkba. Válaszd külön, mi jelent meg ténylegesen, és mit jelentettek be.

Ami megjelent: két MI-binding helyett egy, így az env.AI.run() a Workers AI modelljeit és a külső szolgáltatókat is lefedi. A gateway-en át vezető útválasztás a Workers AI alapértelmezésévé vált a korábbi opció helyett, a gateway: { id: 'default' } pedig az első használatkor létrehozza a gateway-t, és minden további módosítás nélkül hozza a kérésnaplózást, a tokenkövetést és a költségbontást. A kredit szolgáltatók között költhetővé vált, tehát a Workers AI ugyanabból az előre feltöltött egyenlegből fizethető, mint az OpenAI vagy az Anthropic.

Ami nem jelent meg: a modellből kiinduló útválasztás, amelynél modellt kérsz, és a platform választ szolgáltatót, csak ezután következik és nem elérhető, a promptokat osztályozó okos útválasztó pedig belső próbaüzem. Ez a számlázás, a bindingek és a vezérlőpultok összevonása, nem új képesség. Ha eddig is a peremhálózaton futó Workers AI szolgáltatást hívtad gateway nélkül, mostantól alapértelmezés szerint kapsz megfigyelhetőséget.

Mennyibe kerül a Cloudflare AI Gateway

A Cloudflare AI Gateway árazási oldala szerint a ma elérhető alapfunkciókat ingyen kínálják, és ez minden csomagban lefedi a vezérlőpulti analitikát, a gyorsítótárazást és a sebességkorlátozást. Az alábbi számok mind a Cloudflare által közzétett amerikai dolláros árak, abban a pénznemben idézve, amelyben a Cloudflare közli őket.

Hol jelennek meg valójában a díjak

A tartós naplók ingyen használhatók, de csomagfüggően korlátozottak: 100 000 napló az összes gateway-re együtt a Workers Free csomagban, és 10 millió gateway-enként a Workers Paid csomagban. A Logpush, amely ezeket a naplókat máshová exportálja, a Paid csomag funkciója, havi 10 millióval és minden további millió után 0,05 dollárral. Maga a Workers AI a saját árazási oldala szerint napi 10 000 neurons mennyiséget tartalmaz ingyen, és e fölött a Paid csomagban 1000 neurons egységenként 0,011 dollárt számít fel, ahol a neuron a Cloudflare GPU-számítási egysége.

Az egységes számlázás 5 százalékba kerül

Ha saját szolgáltatói kulcsok helyett a Cloudflare által kezelt hitelesítő adatokat használod, a kreditvásárlás 5 százalékos díjat visel. A Cloudflare saját példája egy 100 dolláros kreditvásárlás, amelyet 105 dollárral számláznak. Az inferenciát felár nélkül továbbítják. Ha saját kulcsot hozol, az egységes számlázás nem érvényes, mert a szolgáltatói hitelesítést vagy tárolt kulcsot hordozó kérés kihagyja.

Költségkontroll rendesen csinálva

A gateway megbízhatóan három dolgot kényszerít ki: a kérések ütemét, a dinamikus útvonalon belüli költségkeretet, és azt, hogy egy kérést a gyorsítótárból szolgálnak-e ki. Minden más, amit csinál, mérés. A két kategória összekeverése miatt fordul elő, hogy csapatok telepítenek egyet, minden kapcsolót bekapcsolnak, és mégis meglepi őket a számla.

A kemény költségkeret üzleti döntés, mielőtt beállítás lenne. Valaminek történnie kell, amikor a keret kimerül, és minden lehetőség a maga módján rossz. Ha elbukik a kérés, az a termék minőségét rontja annak, aki utoljára kérdezett, és hibának látszik. Az olcsóbb modellre való visszalépés csendben rontja a minőséget. A sorba állítás költségproblémát késleltetésivé alakít. A választás ezek között maga a munka.

A számláig elérő megtakarítás rendszerint a megfigyelhetőségből ered, nem a kikényszerítésből. Amint a költés funkciónként csoportosul, a drága dolog szinte mindig javítható modellváltás nélkül: minden körben elküldött, túlméretezett rendszerprompt, teljes beszélgetési előzmény ott, ahol egy gördülő összefoglaló is elég lenne, újrapróbálási ciklus, amely olyan hibára tüzel, amely sosem járhatott sikerrel. A napló mindezt megtalálja. A sebességkorlátozó egyiket sem.

A késleltetés, amelyet hozzáadsz

Egy extra ugrás nem ingyenes, és az ellenkezőjét állítani az a mód, ahogy jó döntés rossz okból születik. A kérésed mostantól egy Cloudflare-adatközpontban ér véget, ott dolgozzák fel, és onnan továbbítják a szolgáltatóhoz, ami egy TLS-kézfogással és egy hálózati szakasszal told meg, amelyet korábban nem fizettél.

A szokásos esetben ez kicsi ahhoz képest, amit körülölel. Egy csevegőválasz néhány száz ezredmásodperctől több másodpercig tart, és a generálási idő uralja, a gateway pedig a Cloudflare peremhálózatán ül, tehát az első szakasz a hívóhoz közel ér véget. Egy kétmásodperces válaszhoz mérve a többlet csak zaj.

Ott szűnik meg zaj lenni, ahol rövid, olcsó és nagy tömegű hívások vannak. Egy beágyazási kérés, amely bőven egytized másodperc alatt tér vissza, olyan eset, ahol a fix többlet látható százalékká válik. A streamelés a másik, mert a felhasználók által érzékelt szám az első tokenig eltelt idő, és minden, ami ez elé kerül, éppen a számító mérőszámra rakódik. Mérd meg abból az időtartamból, amelyet a gateway naplóz, ugyanannak a hívásnak a közvetlen változatához hasonlítva.

Többszolgáltatós stratégia és a bezártság, amely elől nem menekülsz

Az ígéret az, hogy a gateway felcserélhetővé teszi a szolgáltatókat, és a szállítási rétegben ez igaz. Az OpenAI-kompatibilis végpont egyetlen kérésformát ad, a dinamikus útválasztás telepítés nélküli átállást ad, a modellnév megváltoztatása pedig beállítássá válik kód helyett.

A szállítási réteg soha nem volt a drága rész. A modellváltás azért drága, mert a modellek másképp viselkednek. Egy hónapokon át egy modellhez hangolt rendszerprompt más kimenetet ad egy másikon. Az eszközhívások formátuma és megbízhatósága eltér. Az elutasítási viselkedés eltér, tehát a korábban átmenő tartalmat elutasítják. A kért JSON-alak betartása eltér, és az egyik modell szokásaira írt feldolgozó elhasal a másikén. A kontextusablakok eltérnek.

Amit valóban megveszel, az az, hogy a váltás egy délutánnyi kiértékelés lesz egy sprintnyi vezetékszerelés helyett, és hogy a kiesés miatti átállás anélkül létezik, hogy megépítenéd. Ezt érdemes birtokolni, de nem hordozhatóság. Egy másodlagos függőséget érdemes néven nevezni: a gateway mostantól minden modellhívás útvonalán ül, tehát az ő rendelkezésre állása lesz a tiéd. Ugyanez az alku, amelyet a Cloudflare Workers és az AWS Lambda összevetésekor vizsgáltunk.

A promptok naplózása személyes adatok kezelését jelenti

Ez az a szakasz, amelyet át szoktak ugrani, és amelyhez jogi kockázat tapad. A naplózás minden gateway-en alapértelmezés szerint be van kapcsolva, és egy bejegyzés teljes egészében tartalmazza a felhasználói promptot és a modell válaszát. Ha a felhasználóid bármit leírnak magukról, dokumentumot illesztenek be, vagy egészségügyi vagy pénzügyi helyzetet vázolnak az asszisztensednek, az a tartalom személyes adat egy harmadik fél naplótárában, és a UK GDPR szerint továbbra is te vagy az adatkezelője.

Takard ki, mielőtt elhagyja az alkalmazásodat

Az egyetlen megbízható hely, ahol el lehet távolítani valamit, az elküldés előtt van. A gateway a cf-aig-collect-log-payload: false fejlécet kínálja arra, hogy a metaadatok megmaradjanak, a törzsek pedig elvesszenek, és a cf-aig-collect-log: false fejlécet arra, hogy semmit ne naplózzon. Az adattakarékosság viszont arról szól, hogy eleve ne gyűjts többet a szükségesnél, tehát a tartós javítás feljebb van: vedd ki a számlaszámokat, az azonosítókat és a szabad szöveges mezőket, amelyekre a modellnek nincs szüksége, még mielőtt a kérés elhagyja a folyamatodat.

A megőrzési idő olyan döntés, amelyet neked kell meghoznod

Az ICO tárolási korlátozásról szóló útmutatója nem szab meg rögzített időtartamokat. Azt követeli meg, hogy ne őrizd a személyes adatokat tovább, mint amennyi ideig szükséged van rájuk, hogy meg tudd indokolni a választott időtartamot, hogy legyen szabályzatod szokásos időtartamokkal, és hogy felülvizsgáld, majd töröld vagy anonimizáld azt, amire már nincs szükséged. A csomagszintű felső korláttal rendelkező naplótár nem megőrzési szabályzat, mert a korlát tárolási határ, nem pedig megindokolt időtartam.

Az alternatívák, tisztességesen megnevezve

Három valódi alternatíva létezik, és a választás főként arról szól, ki üzemelteti a dolgot.

Egy saját üzemeltetésű, nyílt forráskódú LLM-proxy ugyanazt a kérésútvonalat adja, a naplókkal az általad felügyelt infrastruktúrán, és ez akkor helyes, ha maguknak a promptoknak az érzékenysége a probléma. Az ára egy komponens üzemeltetése minden modellhívás kritikus útvonalán.

Egy LLM-megfigyelhetőségre szakosodott szállító mélyebbre megy a kiértékelésben, a promptok verziózásában és a nyomkövetések vizsgálatában. Ha a problémád az, hogy a kimenetek rosszak, nem pedig az, hogy a költségek átláthatatlanok, ez jobban illik, és a kettő nem zárja ki egymást.

A saját megépítés akkor védhető, ha a szükséglet szűk. Egy csomagoló, amely a kérést, a választ, a tokenszámokat és egy funkciócímkét beír a meglévő megfigyelhetőségi rendszeredbe, talán két nap munka, és megválaszolja a hozzárendelés kérdését. Amit nem kapsz meg olcsón, az a helyes kulccsal működő gyorsítótár és a szolgáltatók közötti átállás.

A szabály: ha senki nem tudja, hová megy a költés, a gateway a leggyorsabb javítás, és az ingyenes csomag ezt be is bizonyítja. Ha a promptok nem hagyhatják el az infrastruktúrádat, üzemeltesd magad. Ha a kimenetek rosszak, semmilyen gateway nem segít, és kiértékelő eszközökre van szükséged.

Mit igényel a bevezetés, és mit ad vissza

Egyetlen, már egy szolgáltatót hívó szolgáltatás esetén fél nap. Létrehozod a gateway-t, kicseréled az alap-URL-t a beállításban, kapcsoló mögött vezeted be, hogy a visszalépés környezeti változó legyen és ne kiadás, nézed, ahogy a naplók feltöltődnek, és megerősíted, hogy a streamelés továbbra is rendben viselkedik.

Egy valódi termék esetén számolj három-öt mérnöknappal, és ennek nagyobb része nem a gateway. Az a metaadatséma eldöntése, hogy a hozzárendelés olyan kérdésekre feleljen, amelyeket tényleg fel fogsz tenni, minden hívási pont átvizsgálása, beleértve az ütemezett feladatokat és a kódot, amelyet egy éve nem nyitott ki senki, annak kiderítése, mely végpontok gyorsítótárazhatók biztonságosan, és a kitakarási lépés megírása. Adj hozzá egy napot a tartalék útválasztásra, mert a tartalék csak akkor ér valamit, ha kipróbáltad, hogy a tartalékmodell elfogadható kimenetet ad.

A hozam nem látványos. Nem lep meg többé a számla, ami a legtöbb csapatnál többet ér az abszolút megtakarításnál. A szolgáltató kiesése gyengébb válasszá válik incidens helyett. Az ügynöki munkafolyamatokat építő csapatok járnak a legjobban, mert egyetlen felhasználói művelet, amely tucatnyi modellhívássá terül szét, pontosan ott van, ahol a becslések elválnak a valóságtól, és ezt a mintát tárgyaltuk abban a cikkben, hogy mennyibe kerülnek az MI-ügynökök és hol hibáznak.

Hogyan tegyél be egyet a termelés megtörése nélkül

A működő sorrend szándékosan unalmas. Tedd a gateway-t az útvonalba bekapcsolt naplózással és semmi mással. Gyűjts egy hét adatot. Olvasd el a hozzárendelést. Aztán pontosan azokat a funkciókat kapcsold be, amelyeket az adatok indokolnak, és a gyorsítótárazást hagyd a végére, csak azokon a végpontokon, ahol meg tudod fogalmazni, miért helyes válasz az ismételt válasz.

A Mecanik ezt a réteget az MI-integrációs munkánk részeként építi és üzemelteti, az OpenAI API-integrációs szolgáltatásunk pedig a szolgáltatói oldalt fedi le. A megbízások szinte mindig ugyanúgy indulnak, egy hét naplózással és semmilyen más változtatással, mert a hozzárendelési adatok többnyire átrendezik a prioritási listát.



Gyakran ismételt kérdések

Ingyenes a Cloudflare AI Gateway? Az alapfunkciók minden csomagban ingyenesek, amit a Cloudflare árazási oldala vezérlőpulti analitikaként, gyorsítótárazásként és sebességkorlátozásként ír le, és az adatszivárgás megelőzését szolgáló ellenőrzés is ingyenes. A díjak a széleken jelennek meg: a Logpush a Paid csomag funkciója, a Guardrails tokenalapú Workers AI inferenciaként számlázódik, a naplótár pedig csomagfüggően korlátozott, nem naplónként árazott.

Növeli az AI gateway a modellhívások késleltetését? Igen, hozzáad egy TLS-kézfogást és egy hálózati szakaszt. Egy néhány száz ezredmásodperctől több másodpercig tartó csevegőválaszhoz mérve ez a többlet általában elhanyagolható. Rövid, nagy tömegű hívásoknál válik láthatóvá, például beágyazásoknál vagy kis osztályozásoknál, valamint a streamelt válaszoknál, ahol a felhasználó által érzékelt mérőszám az első tokenig eltelt idő, nem a teljes időtartam.

Mikor nem biztonságos gyorsítótárazni az LLM-válaszokat? Mindig, amikor a termék értéke a válaszok közötti változatosságtól függ, vagy amikor a kéréstörzs nem különbözteti meg az egyik felhasználót a másiktól. A Cloudflare a gyorsítótárkulcsot a szolgáltatóból, a végpontból, a modellből, a hitelesítési fejlécből és a teljes kéréstörzsből építi, tehát a találat bájtazonos kérést jelent. A gyorsítótár osztályozáshoz, kinyeréshez és beágyazásokhoz illik, nem olyan társalgási válaszokhoz, amelyeknek felhasználónként el kell térniük.

Könnyűvé teszi a gateway a modellszolgáltató váltását? A szállítási rétegben igen. Egyetlen kérésforma, egyetlen beállítási változtatás, és átállás telepítés nélkül. A váltás drága része érintetlen marad: az egy modellhez hangolt promptok másképp viselkednek egy másikon, az eszközhívások formátuma és az elutasítási viselkedés eltér, a JSON betartása eltér, és a kontextusablakok is eltérnek. A gateway a vezetékszerelést veszi le rólad, nem a kiértékelés munkáját.

Mit változtatott a Cloudflare 2026 augusztusában? 2026. augusztus 7-én, az Agents Week zárónapján a Cloudflare egyetlen vezérlősíkba vonta össze a Workers AI és az AI Gateway szolgáltatást: egy MI-binding fedi a Workers AI modelljeit és a külső szolgáltatókat, a gateway-en át vezető útválasztás alapértelmezésben bekapcsolt a Workers AI esetén, a kredit pedig egyetlen előre feltöltött egyenlegből költhető a szolgáltatók között. A modellből kiinduló útválasztást következő lépésként jelentették be, nem adták ki.