Die meisten Teams rufen einen Modellanbieter direkt aus dem Anwendungscode auf. Der API-Schlüssel liegt in einer Umgebungsvariablen, der SDK-Aufruf ist drei Zeilen lang, und es funktioniert auf Anhieb. Cloudflare AI Gateway existiert wegen dem, was danach passiert. Die Rechnung kommt und niemand kann sagen, welche Funktion sie verursacht hat. Der Anbieter hat einen schlechten Nachmittag und reißt Ihr Produkt mit. Ein System-Prompt wird bearbeitet und es gibt keine Aufzeichnung darüber, was der alte zurückgegeben hat.

Ein Gateway ist ein Proxy zwischen Ihrer Anwendung und dem Anbieter. Jede Anfrage läuft hindurch, also kann jede Anfrage gezählt, protokolliert, zwischengespeichert und ratenbegrenzt werden, und wenn der Anbieter ausfällt, anderswo erneut versucht werden. Es ist die billigste strukturelle Lösung für drei Probleme, die sonst spät und von Hand gelöst werden.

Es folgt, was es tut, was es erzwingt statt nur beobachtet, was es an Geld und an Millisekunden kostet und wo die ehrlichen Grenzen liegen.

Spart ein Gateway vor Ihrer Modell-API wirklich Geld? Nicht direkt. Der Kern von Cloudflare AI Gateway ist in allen Tarifen kostenlos und schlägt nichts auf die Inferenz auf, die Ersparnis entsteht also aus dem, was es Ihnen zeigt, nicht aus dem, was es blockiert. Kostenzuordnung pro Funktion sagt Ihnen, welcher Teil des Produkts teuer ist, Caching entfernt wiederholte identische Aufrufe, wo das sicher ist, und Fallback-Routing verhindert, dass ein Anbieterausfall zu Ihrem Ausfall wird. Budgetdurchsetzung gibt es, aber was passiert, wenn das Budget aufgebraucht ist, ist eine Produktentscheidung und keine Konfigurationsfrage.


Die drei Fragen, die ein direkter Modellaufruf nicht beantworten kann

Jedes Argument für ein Gateway lässt sich auf eine von drei Fragen zurückführen, die ein direkter SDK-Aufruf unbeantwortet lässt. Die abstrakte Fassung, Sichtbarkeit und Kontrolle, überzeugt niemanden, der die Arbeit rechtfertigen muss.

Niemand kann die Rechnung zuordnen

Die Abrechnung pro Token ist nutzungsbasiert, und Anbieterrechnungen aggregieren. Sie erhalten eine Monatssumme pro API-Schlüssel, nicht eine Summe pro Funktion. Wenn sich ein Zusammenfasser, ein Chat-Assistent und ein nächtlicher Klassifizierungsjob einen Schlüssel teilen, kann die Rechnung nicht sagen, welcher davon sich verdreifacht hat. Die übliche Antwort ist ein Schlüssel pro Funktion, was funktioniert, bis Sie elf Funktionen und eine Rotationsrichtlinie haben.

Niemand kann den Fehler reproduzieren

Wenn ein Aufruf im Anwendungscode fehlschlägt, überlebt nur das, was Ihr Logger erfasst hat, meist ein Statuscode und eine abgeschnittene Meldung. Selten der exakte Prompt, die Modellversion, die geantwortet hat, oder die Latenz, bei der sie aufgab. Einen Vorfall einen Tag später zu reproduzieren wird zum Rätselraten über Eingaben. Unterdessen schlägt ein Anbieterausfall direkt zu Ihren Nutzern durch.

Nichts deckelt eine außer Kontrolle geratene Schleife

Ein Agent, der sich selbst wiederholt, ein Queue-Consumer, der bei Fehlern erneut zustellt, oder eine Schleife, deren Abbruchbedingung ein Modell immer wieder als nicht erfüllt beurteilt: jedes davon kann Tausende Aufrufe erzeugen, bevor es jemand bemerkt. Ohne etwas im Pfad, das zählt, ist das erste Signal die Rechnung. Limits pro Nutzer und harte Stopps existieren nicht, solange keine Komponente im Pfad sie durchsetzt, und Anwendungscode ist ein schlechter Ort dafür, weil jede Aufrufstelle daran denken muss.

Was Cloudflare AI Gateway ist und wo es im Anfragepfad sitzt

Cloudflares Überblick zu AI Gateway beschreibt einen Dienst, der zwischen Ihrer Anwendung und den KI-Modellanbietern sitzt, damit Sie die Nutzung überwachen und steuern können, wie die Anwendung skaliert. Die Funktionen sind Analytik, Logging, Caching, Rate Limiting und Wiederholung mit Fallback, in allen Cloudflare-Tarifen. Cloudflare behauptet, der Einstieg brauche eine einzige Codezeile, und die Form der Integration ist der Grund, warum das fast stimmt.

Die Integration ist eine geänderte Basis-URL

Statt Ihr SDK auf den Anbieter zu richten, richten Sie es auf eine Gateway-Adresse, die Ihre Konto-Kennung, Ihre Gateway-Kennung und den Anbieternamen trägt. Cloudflare dokumentiert die OpenAI-Form als https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai, angegeben als baseURL beim Erzeugen des Clients. Modellnamen, Parameter, Streaming und das Parsen der Antwort bleiben, wie sie waren. Cloudflares Anbieterliste deckt zwei Dutzend Dienste nach demselben Muster ab, darunter OpenAI, Anthropic, Google Vertex AI, Amazon Bedrock, Azure OpenAI, Mistral, Groq, DeepSeek, xAI und Cloudflares eigenes Workers AI.

Was diese Form bedeutet

Die Einführung ist wirklich billig: ein Konfigurationswert pro Dienst, umkehrbar durch Zurückändern, was dies zu einer der wenigen Infrastrukturänderungen macht, die Sie ohne Projektplan ausprobieren können.

Ihr Anbieterschlüssel läuft nun durch Cloudflare, weil der Proxy ihn weiterleiten muss, sofern Sie nicht auf hinterlegte Schlüssel oder von Cloudflare verwaltete Zugangsdaten umsteigen. Das ist eine Vertrauensentscheidung, kein Detail.

Und alles Angebotene ist durch das begrenzt, was ein Proxy sehen kann. Er sieht Anfragen und Antworten, nicht die Absicht Ihrer Anwendung, weshalb die Zuordnung verlangt, dass Sie Anfragen selbst kennzeichnen, statt zu erwarten, dass das Gateway errät, wofür ein Aufruf gedacht war.

Analytik und Logging sind die Funktionen, die das Geld sparen

Das Gateway zählt jede Anfrage. Cloudflares Logging-Dokumentation listet auf, was ein Eintrag enthält: den Nutzer-Prompt, die Modellantwort, den Anbieter, den Zeitstempel, den Anfragestatus, den Token-Verbrauch, die Kosten, die Dauer und den User-Agent des Clients. Pro Anfrage statt pro Monat, und abfragbar.

Seien Sie deutlich, warum hier und nicht bei den Durchsetzungsfunktionen das Geld liegt. Ausgaben zu blockieren spart die Kosten der Aufrufe, die Sie gestoppt haben, und das ist begrenzt. Zu wissen, wohin die Ausgaben fließen, verändert, was Sie bauen, und das ist es nicht.

Die Zuordnung passiert nicht automatisch. Benutzerdefinierte Metadaten hängen Ihre eigenen Labels an, etwa den Namen einer Funktion oder eines Mandanten, damit die Analytik danach gruppieren kann. Lassen Sie das weg, erhalten Sie eine Gesamtsumme, also genau das, was die Rechnung Ihnen schon gab.

Caching und die Fälle, in denen ein Cache-Treffer das Produkt ruiniert

Caching ist die Funktion, die am häufigsten aus dem falschen Grund aktiviert wird, und diejenige, die ein Produkt am ehesten stillschweigend kaputt macht.

Wie der Cache-Schlüssel gebildet wird

Cloudflares Caching-Dokumentation erklärt den Schlüssel als SHA-256-Hash aus Anbieter, Endpunkt, Modell, Authentifizierungs-Header und dem vollständigen Anfragekörper. Eine exakte Übereinstimmung in allem ist ein Treffer, alles andere ein Fehltreffer. Ein Treffer setzt also eine Byte-identische Anfrage voraus, was bei einem Chat-Endpunkt mit angesammelter Historie nach dem ersten Zug selten ist. Die minimale Lebensdauer beträgt 60 Sekunden, die maximale einen Monat. Die Steuerung pro Anfrage kommt von cf-aig-cache-ttl, cf-aig-skip-cache und cf-aig-cache-key, während cf-aig-cache-status HIT oder MISS zurückgibt, damit Sie die echte Trefferquote messen können.

Wann ein Treffer sicher ist und wann nicht

Ein Treffer ist sicher, wo identische Eingaben identische Ausgaben erzeugen sollen und Veraltetes akzeptabel ist: Klassifikation, strukturierte Extraktion, Übersetzung fester Zeichenketten, Embeddings unveränderter Dokumente, Evaluationsverkehr. Er ist überall dort unsicher, wo der Wert des Produkts von Variation abhängt. Wenn zwei Nutzer dieselbe Frage stellen und der zweite eine Antwort erhält, die für den ersten erzeugt wurde, ist Ihre Temperatur-Einstellung reine Dekoration.

Der schlimmere Fehlerfall betrifft den Datenschutz. Wenn der Anfragekörper nichts enthält, was Nutzer voneinander unterscheidet, kann eine zwischengespeicherte Antwort eine Nutzergrenze überschreiten, und das ist eine Offenlegung und kein Qualitätsproblem. Caching deckt außerdem nur Text- und Bildantworten ab.

Rate Limiting, Wiederholungen und Fallback-Routing

Diese drei werden gemeinsam als Zuverlässigkeitsfunktionen beschrieben. Nur eine davon begrenzt Kosten in nennenswerter Weise.

Rate Limiting deckelt Anfragen, nicht Token

Cloudflare bietet ein festes Fenster und ein gleitendes Fenster, und Anfragen über dem Limit erhalten eine 429. Beachten Sie, was gezählt wird: Anfragen. Ein einzelner Aufruf mit sehr großem Kontext kostet weit mehr als ein kurzer, und der Limiter kann die beiden nicht unterscheiden. Rate Limiting schützt Sie vor einer außer Kontrolle geratenen Schleife und vor einem missbrauchten Endpunkt, nicht vor einem teuren Prompt, und es als Kostenkontrolle zu behandeln ist der übliche Fehler.

Wiederholungen und Zeitlimits

Cloudflares Header zur Anfragebehandlung erlauben bis zu 5 Versuche mit cf-aig-max-attempts, eine Verzögerung von bis zu 5000 Millisekunden mit cf-aig-retry-delay und eine konstante, lineare oder exponentielle Strategie mit cf-aig-backoff. Der Header cf-aig-request-timeout wird ab dem Eintreffen des ersten Antwortteils gemessen, ist bei einem Streaming-Aufruf also eher ein Limit für die Zeit bis zum ersten Byte als für die Gesamtdauer. Beim letzten Versuch wartet das Gateway, bis die Anfrage abgeschlossen ist, wie lange das auch dauert.

Fallback-Routing hat die Form gewechselt

Der Universal Endpoint, der ein Array von Anbieterobjekten entgegennahm und es bei einem Fehler durchlief, ist veraltet. Cloudflare verweist neue Integrationen jetzt auf den OpenAI-kompatiblen Endpunkt und für Fallbacks, Wiederholungen und bedingtes Routing auf Dynamic Routing. Eine dynamische Route ist ein benannter, versionierter Ablauf, visuell oder als JSON gebaut, aus Modellknoten, bedingten Knoten, die anhand von Anfragekörper, Headern oder Metadaten verzweigen, Prozentknoten für A/B-Tests sowie Rate-Limit- und Budget-Limit-Knoten, die bei Überschreitung auf einen Fallback umleiten. Sie rufen sie auf, indem Sie den Routennamen dorthin setzen, wo sonst der Modellname steht.

Prüfen, was hineingeht und was zurückkommt

Weil der Proxy beide Hälften des Austauschs hält, kann er sie bewerten. Cloudflares Guardrails fangen Nutzer-Prompts und Modellantworten ab, markieren Inhalte zur Prüfung oder blockieren ihre Weitergabe und wenden eine einzige Richtlinie an, unabhängig davon, welcher Anbieter geantwortet hat.

Das Argument für Richtlinien im Pfad statt im Code lautet, dass Moderation auf Anwendungsebene einmal pro Aufrufstelle geschrieben werden muss, und die letzte Woche hinzugefügte Aufrufstelle ist die, die sie vergisst. Der Preis ist, dass die Prüfung selbst Inferenz ist: Guardrails werden als tokenbasierte Workers-AI-Nutzung abgerechnet, der Preis skaliert also mit der Länge dessen, was Sie prüfen. Das Scannen zur Verhinderung von Datenabfluss ist in allen Tarifen kostenlos.

Was sich während der Agents Week im August 2026 geändert hat

Cloudflare veranstaltete vom 3. bis 7. August 2026 seine erste Agents Week und veröffentlichte am letzten Tag die Vereinheitlichung von Workers AI und AI Gateway zu einer einzigen Steuerungsebene. Trennen Sie, was ausgeliefert wurde, von dem, was angekündigt wurde.

Ausgeliefert wurde: ein KI-Binding statt zwei, sodass env.AI.run() sowohl Workers-AI-Modelle als auch externe Anbieter abdeckt. Gateway-Routing wurde für Workers AI zur Voreinstellung statt eine Option, wobei gateway: { id: 'default' } das Gateway bei der ersten Nutzung automatisch anlegt und ohne weitere Änderung Anfrage-Logging, Token-Erfassung und Kostenzuordnung liefert. Guthaben wurde anbieterübergreifend einsetzbar, sodass Workers AI aus demselben Prepaid-Guthaben bezahlt werden kann wie OpenAI oder Anthropic.

Nicht ausgeliefert wurde: Model-First-Routing, bei dem Sie ein Modell anfordern und die Plattform den Anbieter wählt, kommt als Nächstes und ist nicht verfügbar, und ein Smart Router, der Prompts klassifiziert, ist ein interner Pilot. Das ist eine Konsolidierung von Abrechnung, Bindings und Dashboards, keine neue Fähigkeit. Wenn Sie Workers AI am Edge bereits ohne Gateway aufgerufen haben, erhalten Sie jetzt Observability standardmäßig.

Was Cloudflare AI Gateway kostet

Cloudflares Preisseite für AI Gateway besagt, dass die heute verfügbaren Kernfunktionen kostenlos angeboten werden, einschließlich Dashboard-Analytik, Caching und Rate Limiting in allen Tarifen. Alle Zahlen unten sind Cloudflares veröffentlichte US-Dollar-Preise, angegeben in der Währung, in der Cloudflare sie veröffentlicht.

Wo die Gebühren tatsächlich anfallen

Persistente Logs sind kostenlos nutzbar, aber je nach Tarif gedeckelt: 100.000 Logs über alle Gateways hinweg bei Workers Free und 10 Millionen pro Gateway bei Workers Paid. Logpush, das diese Logs anderswohin exportiert, ist eine Funktion des Paid-Tarifs mit 10 Millionen pro Monat und 0,05 USD je weiterer Million. Workers AI selbst enthält laut seiner Preisseite 10.000 Neurons pro Tag ohne Kosten und berechnet darüber hinaus im Paid-Tarif 0,011 USD je 1.000 Neurons, wobei ein Neuron Cloudflares Einheit für GPU-Rechenleistung ist.

Einheitliche Abrechnung kostet 5 Prozent

Wenn Sie von Cloudflare verwaltete Zugangsdaten statt eigener Anbieterschlüssel nutzen, tragen Guthabenkäufe eine Gebühr von 5 Prozent. Cloudflares eigenes Beispiel ist ein Guthabenkauf über 100 USD, der mit 105 USD abgerechnet wird. Inferenz wird ohne Aufschlag durchgereicht. Bringen Sie Ihren eigenen Schlüssel mit, gilt die einheitliche Abrechnung nicht, weil eine Anfrage mit Anbieter-Authentifizierung oder hinterlegtem Schlüssel sie überspringt.

Kostenkontrolle richtig gemacht

Ein Gateway erzwingt zuverlässig drei Dinge: eine Anfragerate, ein Budgetlimit innerhalb einer dynamischen Route und ob eine Anfrage aus dem Cache bedient wird. Alles andere, was es tut, ist Messung. Diese beiden Kategorien zu verwechseln ist der Grund, warum Teams eines installieren, jedes Kästchen ankreuzen und trotzdem von der Rechnung überrascht werden.

Eine harte Budgetobergrenze ist eine Geschäftsentscheidung, bevor sie eine Konfiguration ist. Irgendetwas muss passieren, wenn die Grenze erreicht ist, und jede Option ist auf ihre eigene Weise schlecht. Die Anfrage scheitern zu lassen verschlechtert das Produkt für den, der zuletzt gefragt hat, und sieht aus wie ein Fehler. Der Rückfall auf ein billigeres Modell verschlechtert die Qualität stillschweigend. Eine Warteschlange verwandelt ein Kostenproblem in ein Latenzproblem. Zwischen diesen Optionen zu wählen ist die eigentliche Arbeit.

Die Ersparnis, die eine Rechnung erreicht, kommt meist aus Observability statt aus Durchsetzung. Sobald sich Ausgaben nach Funktion gruppieren, ist das Teure fast immer ohne Modellwechsel behebbar: ein überdimensionierter System-Prompt, der in jedem Zug mitgeschickt wird, eine vollständige Gesprächshistorie, die erneut gesendet wird, wo eine rollierende Zusammenfassung genügen würde, eine Wiederholungsschleife, die gegen einen Fehler feuert, der nie erfolgreich sein konnte. Ein Log findet all das. Ein Rate Limiter findet nichts davon.

Die Latenz, die Sie hinzufügen

Ein zusätzlicher Hop ist nicht kostenlos, und etwas anderes zu behaupten ist der Weg, auf dem eine gute Entscheidung aus einem schlechten Grund getroffen wird. Ihre Anfrage endet jetzt in einem Rechenzentrum von Cloudflare, wird dort verarbeitet und an den Anbieter weitergeleitet, was einen TLS-Handshake und eine Netzwerkstrecke hinzufügt, die Sie vorher nicht bezahlt haben.

Im Normalfall ist das klein im Verhältnis zu dem, was es umschließt. Eine Chat-Vervollständigung läuft von einigen hundert Millisekunden bis zu mehreren Sekunden und wird von der Generierungszeit dominiert, und das Gateway sitzt in Cloudflares Edge-Netz, sodass die erste Strecke nahe beim Aufrufer endet. Gegen eine Vervollständigung von zwei Sekunden ist der Overhead Rauschen.

Wo er aufhört, Rauschen zu sein, sind kurze, billige Aufrufe in hoher Zahl. Eine Embedding-Anfrage, die in deutlich unter einer Zehntelsekunde zurückkommt, ist ein Fall, in dem fester Overhead ein sichtbarer Prozentsatz wird. Streaming ist der andere, denn die Zahl, die Nutzer spüren, ist die Zeit bis zum ersten Token, und alles, was davor hinzukommt, landet auf der Metrik, die zählt. Messen Sie es an der Dauer, die das Gateway protokolliert, gegen denselben Aufruf ohne Umweg.

Multi-Provider-Strategie und das Lock-in, dem Sie nicht entkommen

Der Pitch lautet, dass ein Gateway Anbieter austauschbar macht, und auf der Transportebene stimmt das. Der OpenAI-kompatible Endpunkt gibt Ihnen eine Anfrageform, dynamisches Routing gibt Ihnen Failover ohne Deployment, und einen Modellnamen zu ändern wird Konfiguration statt Code.

Die Transportebene war nie der teure Teil. Modelle zu wechseln ist teuer, weil Modelle sich unterschiedlich verhalten. Ein über Monate gegen ein Modell abgestimmter System-Prompt erzeugt gegen ein anderes andere Ausgaben. Formate und Zuverlässigkeit von Tool-Aufrufen unterscheiden sich. Das Ablehnungsverhalten unterscheidet sich, sodass Inhalte, die vorher durchgingen, abgelehnt werden. Die Einhaltung einer angeforderten JSON-Form unterscheidet sich, und ein Parser, der gegen die Gewohnheiten eines Modells geschrieben wurde, bricht gegen die eines anderen. Kontextfenster unterscheiden sich.

Was Sie tatsächlich kaufen, ist, dass ein Wechsel zu einem Nachmittag Evaluation wird statt zu einem Sprint Klempnerarbeit, und dass ausfallgetriebenes Failover existiert, ohne dass Sie es bauen. Das ist es wert, aber es ist keine Portabilität. Eine Abhängigkeit zweiter Ordnung verdient es, benannt zu werden: das Gateway sitzt jetzt im Pfad jedes Modellaufrufs, also wird seine Verfügbarkeit zu Ihrer Verfügbarkeit. Das ist derselbe Kompromiss, den wir beim Vergleich von Cloudflare Workers und AWS Lambda untersucht haben.

Prompts zu protokollieren heißt personenbezogene Daten zu verarbeiten

Das ist der Abschnitt, der übersprungen wird, und der mit rechtlichem Risiko. Logging ist für jedes Gateway standardmäßig aktiv, und ein Eintrag enthält den Nutzer-Prompt und die Modellantwort vollständig. Wenn Ihre Nutzer irgendetwas über sich tippen, ein Dokument einfügen oder Ihrem Assistenten eine medizinische oder finanzielle Lage schildern, sind diese Inhalte personenbezogene Daten in einem Log-Speicher eines Dritten, und nach der UK GDPR bleiben Sie deren Verantwortlicher.

Schwärzen Sie, bevor es Ihre Anwendung verlässt

Der einzig verlässliche Ort, etwas zu entfernen, ist, bevor es gesendet wird. Das Gateway bietet cf-aig-collect-log-payload: false, um Metadaten zu behalten und Inhalte zu verwerfen, und cf-aig-collect-log: false, um gar nichts zu protokollieren. Aber Datenminimierung bedeutet, nicht mehr zu erheben als nötig, die dauerhafte Lösung liegt also weiter oben: entfernen Sie Kontonummern, Kennungen und Freitextfelder, die das Modell nicht braucht, bevor die Anfrage Ihren Prozess verlässt.

Aufbewahrung ist eine Entscheidung, die Sie treffen müssen

Die Leitlinie der ICO zur Speicherbegrenzung legt keine festen Fristen fest. Sie verlangt, dass Sie personenbezogene Daten nicht länger aufbewahren als nötig, dass Sie die gewählte Frist begründen können, dass Sie eine Richtlinie mit Standardfristen haben und dass Sie prüfen und dann löschen oder anonymisieren, was Sie nicht mehr brauchen. Ein Log-Speicher mit einer tarifbedingten Obergrenze ist keine Aufbewahrungsrichtlinie, denn eine Obergrenze ist eine Speichergrenze und keine begründete Frist.

Alternativen, fair benannt

Es gibt drei echte Alternativen, und die Wahl hängt vor allem davon ab, wer das Ding betreibt.

Ein selbst gehosteter Open-Source-LLM-Proxy gibt Ihnen denselben Anfragepfad mit den Logs auf Infrastruktur, die Sie kontrollieren, was richtig ist, wenn die Sensibilität der Prompts selbst das Problem ist. Der Preis ist der Betrieb einer Komponente im kritischen Pfad jedes Modellaufrufs.

Ein spezialisierter Anbieter für LLM-Observability geht bei Evaluation, Prompt-Versionierung und Trace-Inspektion tiefer. Wenn Ihr Problem ist, dass Ausgaben falsch sind, statt dass Kosten undurchsichtig sind, passt das besser, und beides schließt sich nicht aus.

Es selbst zu bauen ist vertretbar, wenn der Bedarf eng ist. Ein Wrapper, der Anfrage, Antwort, Token-Zahlen und ein Label pro Funktion in Ihren bestehenden Observability-Stack schreibt, sind vielleicht zwei Tage Arbeit und beantworten die Frage nach der Zuordnung. Was Sie nicht billig bekommen, ist Caching mit einem korrekten Schlüssel und Failover über Anbieter hinweg.

Die Regel: wenn niemand weiß, wohin die Ausgaben gehen, ist ein Gateway die schnellste Lösung und der kostenlose Tarif beweist es. Wenn Prompts Ihre Infrastruktur nicht verlassen dürfen, hosten Sie selbst. Wenn die Ausgaben falsch sind, hilft kein Gateway und Sie brauchen Werkzeuge zur Evaluation.

Was die Umsetzung braucht und was sie zurückgibt

Für einen einzelnen Dienst, der bereits einen Anbieter aufruft, einen halben Tag. Gateway anlegen, die Basis-URL in der Konfiguration ändern, hinter einem Flag ausrollen, damit ein Zurückrollen eine Umgebungsvariable statt eines Releases ist, zusehen, wie sich die Logs füllen, und bestätigen, dass Streaming sich weiterhin richtig verhält.

Für ein echtes Produkt planen Sie drei bis fünf Entwicklertage ein, und das meiste davon ist nicht das Gateway. Es ist die Entscheidung über ein Metadatenschema, damit die Zuordnung Fragen beantwortet, die Sie wirklich stellen werden, das Prüfen jeder Aufrufstelle einschließlich geplanter Jobs und Code, den seit einem Jahr niemand geöffnet hat, das Herausfinden, welche Endpunkte sicher zwischengespeichert werden können, und das Schreiben des Schwärzungsschritts. Rechnen Sie einen Tag für Fallback-Routing dazu, denn ein Fallback lohnt sich erst, wenn Sie getestet haben, dass das Fallback-Modell akzeptable Ausgaben liefert.

Der Ertrag ist unspektakulär. Sie werden nicht mehr von der Rechnung überrascht, was für die meisten Teams mehr wiegt als die absolute Ersparnis. Ein Anbieterausfall wird zu einer verschlechterten Antwort statt zu einem Vorfall. Teams, die Agenten-Workflows bauen, profitieren am meisten, denn eine Nutzeraktion, die sich in Dutzende Modellaufrufe auffächert, ist genau dort, wo Schätzungen von der Realität abweichen, ein Muster, das wir in was KI-Agenten kosten und wo sie scheitern behandelt haben.

Eines einbauen, ohne die Produktion zu brechen

Die Reihenfolge, die funktioniert, ist absichtlich langweilig. Setzen Sie das Gateway mit aktiviertem Logging und sonst nichts in den Pfad. Sammeln Sie eine Woche Daten. Lesen Sie die Zuordnung. Aktivieren Sie dann genau die Funktionen, die die Daten rechtfertigen, und aktivieren Sie Caching zuletzt, nur an Endpunkten, bei denen Sie begründen können, warum eine wiederholte Antwort eine richtige Antwort ist.

Mecanik baut und betreibt diese Schicht als Teil unserer Arbeit zur KI-Integration, und unser Service zur OpenAI-API-Integration deckt die Anbieterseite ab. Aufträge beginnen fast immer gleich, mit einer Woche Logging und keinen weiteren Änderungen, weil die Daten zur Zuordnung die Prioritätenliste meist neu ordnen.



Häufig gestellte Fragen

Ist Cloudflare AI Gateway kostenlos? Die Kernfunktionen sind in allen Tarifen kostenlos, was Cloudflares Preisseite als Dashboard-Analytik, Caching und Rate Limiting beschreibt, und das Scannen zur Verhinderung von Datenabfluss ist ebenfalls kostenlos. Gebühren tauchen an den Rändern auf: Logpush ist eine Funktion des Paid-Tarifs, Guardrails werden als tokenbasierte Workers-AI-Inferenz abgerechnet, und der Log-Speicher ist je nach Tarif gedeckelt statt pro Log bepreist.

Erhöht ein AI Gateway die Latenz von Modellaufrufen? Ja, es fügt einen TLS-Handshake und eine Netzwerkstrecke hinzu. Gegen eine Chat-Vervollständigung, die einige hundert Millisekunden bis mehrere Sekunden dauert, ist dieser Overhead meist vernachlässigbar. Sichtbar wird er bei kurzen Aufrufen in hoher Zahl wie Embeddings oder kleinen Klassifikationen und bei Streaming-Antworten, wo die spürbare Metrik die Zeit bis zum ersten Token statt die Gesamtdauer ist.

Wann ist es unsicher, LLM-Antworten zwischenzuspeichern? Immer dann, wenn der Wert des Produkts von der Variation zwischen den Antworten abhängt, oder wenn der Anfragekörper einen Nutzer nicht vom anderen unterscheidet. Cloudflare bildet den Cache-Schlüssel aus Anbieter, Endpunkt, Modell, Authentifizierungs-Header und vollständigem Anfragekörper, ein Treffer bedeutet also eine Byte-identische Anfrage. Caching passt zu Klassifikation, Extraktion und Embeddings, nicht zu Gesprächsantworten, die sich pro Nutzer unterscheiden sollen.

Macht ein Gateway den Wechsel des Modellanbieters einfach? Auf der Transportebene ja. Eine Anfrageform, eine Konfigurationsänderung und Failover ohne Deployment. Der teure Teil des Wechsels bleibt unberührt: Prompts, die gegen ein Modell abgestimmt wurden, verhalten sich bei einem anderen anders, Formate von Tool-Aufrufen und Ablehnungsverhalten unterscheiden sich, die Einhaltung von JSON unterscheidet sich, und Kontextfenster unterscheiden sich. Ein Gateway nimmt Ihnen die Klempnerarbeit ab, nicht die Evaluation.

Was hat Cloudflare im August 2026 geändert? Am 7. August 2026, zum Abschluss der Agents Week, vereinheitlichte Cloudflare Workers AI und AI Gateway zu einer einzigen Steuerungsebene: ein KI-Binding für Workers AI und externe Anbieter, Gateway-Routing standardmäßig aktiv für Workers AI und Guthaben, das anbieterübergreifend aus einem Prepaid-Konto ausgegeben werden kann. Model-First-Routing wurde als Nächstes angekündigt, nicht ausgeliefert.