대부분의 팀은 애플리케이션 코드에서 모델 제공업체를 곧바로 호출합니다. API 키는 환경 변수에 들어 있고, SDK 호출은 세 줄이면 끝나며, 처음부터 잘 동작합니다. Cloudflare AI Gateway가 존재하는 이유는 그다음에 벌어지는 일 때문입니다. 청구서가 도착했는데 어떤 기능이 그 금액을 만들었는지 아무도 말하지 못합니다. 제공업체가 하루 오후를 망치면 제품도 함께 끌려 내려갑니다. 시스템 프롬프트를 고쳤는데, 예전 프롬프트가 무엇을 돌려주었는지에 대한 기록이 남아 있지 않습니다.

게이트웨이는 애플리케이션과 제공업체 사이에 놓이는 프록시입니다. 모든 요청이 그곳을 지나가므로 모든 요청을 세고, 기록하고, 캐시하고, 요청 수를 제한하고, 제공업체가 실패했을 때 다른 곳으로 재시도할 수 있습니다. 그대로 두면 뒤늦게 수작업으로 해결하게 되는 세 가지 문제에 대한, 가장 값싼 구조적 처방입니다.

아래에서는 이 계층이 무엇을 하는지, 단순히 관찰하는 것과 달리 무엇을 강제할 수 있는지, 돈과 밀리초로 얼마를 치르는지, 그리고 솔직한 한계는 어디에 있는지를 살펴봅니다.

모델 API 앞에 게이트웨이를 두면 정말 비용이 줄어드나요? 직접적으로는 아닙니다. Cloudflare AI Gateway의 핵심은 모든 요금제에서 무료이고 추론에 마진을 붙이지 않으므로, 절감은 무엇을 막았느냐가 아니라 무엇을 보여 주었느냐에서 나옵니다. 기능별 비용 배분은 제품의 어느 부분이 비싼지 알려 주고, 캐싱은 안전한 경우에 한해 동일한 호출의 반복을 없애며, 폴백 라우팅은 제공업체의 장애가 우리 쪽 장애가 되는 것을 막습니다. 예산 강제도 있지만, 예산이 바닥났을 때 무엇을 일으킬지는 설정이 아니라 제품에 관한 결정입니다.


직접 모델 호출로는 답할 수 없는 세 가지 질문

게이트웨이를 도입해야 한다는 주장은 결국, SDK를 직접 호출하는 한 답이 나오지 않는 세 가지 질문 중 하나로 귀결됩니다. 가시성과 통제라는 추상적인 표현은, 그 작업을 정당화해야 하는 사람을 아무도 설득하지 못합니다.

청구서를 아무도 나눠 볼 수 없다

토큰 단위 과금은 사용량 기반이고 제공업체의 청구서는 합산됩니다. 손에 들어오는 것은 API 키별 월 합계이지 기능별 합계가 아닙니다. 요약 기능과 챗봇 어시스턴트와 야간 분류 작업이 키 하나를 공유하고 있다면, 청구서는 그중 무엇이 세 배가 되었는지 알려 주지 못합니다. 흔한 대응은 기능마다 키를 나누는 것이고, 이 방법은 기능이 열한 개가 되고 키 교체 정책까지 붙기 전까지는 잘 통합니다.

장애를 아무도 재현할 수 없다

애플리케이션 코드 안에서 호출이 실패하면 남는 것은 로거가 붙잡은 내용뿐이고, 대개는 상태 코드와 잘려 나간 메시지입니다. 정확한 프롬프트도, 응답한 모델의 버전도, 얼마나 기다리다 포기했는지도 좀처럼 남지 않습니다. 하루 뒤에 사고를 재현하려 하면 입력에 대한 추측 게임이 됩니다. 그러는 동안에도 제공업체의 장애는 그대로 사용자에게 전달됩니다.

폭주하는 루프를 막는 것이 없다

스스로 재시도하는 에이전트, 실패할 때마다 다시 배달하는 큐 컨슈머, 종료 조건이 충족되지 않았다고 모델이 계속 판정하는 루프. 어느 쪽이든 누군가 알아차리기 전에 수천 번의 호출을 만들어 냅니다. 경로 어딘가에서 세고 있는 것이 없다면 첫 신호는 청구서입니다. 사용자별 상한도, 강제 중단도, 경로 위의 구성 요소가 강제하지 않으면 존재하지 않습니다. 그리고 애플리케이션 코드는 그것을 두기에 나쁜 자리인데, 모든 호출 지점이 잊지 않고 구현해야 하기 때문입니다.

Cloudflare AI Gateway는 무엇이고 요청 경로의 어디에 앉는가

Cloudflare의 AI Gateway 개요는 이 서비스를, 애플리케이션과 AI 모델 제공업체 사이에 앉아 사용량을 관찰하고 애플리케이션이 확장되는 방식을 관리하게 해 주는 것으로 설명합니다. 기능은 분석, 로깅, 캐싱, 요청 수 제한, 그리고 폴백을 동반한 요청 재시도이며 Cloudflare의 모든 요금제에서 제공됩니다. Cloudflare는 코드 한 줄로 시작할 수 있다고 말하는데, 통합의 모양을 보면 그 말이 거의 사실인 이유를 알 수 있습니다.

통합은 베이스 URL 하나를 바꾸는 일이다

SDK를 제공업체로 향하게 하는 대신, 계정 식별자와 게이트웨이 식별자와 제공업체 이름을 담은 게이트웨이 주소로 향하게 합니다. Cloudflare는 OpenAI용 형식https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai로 문서화하고 있으며, 클라이언트를 만들 때 baseURL로 넘깁니다. 모델 이름도, 파라미터도, 스트리밍도, 응답 파싱도 그대로 둡니다. Cloudflare의 제공업체 목록은 같은 방식으로 스무 개가 넘는 서비스를 다루며, 여기에는 OpenAI, Anthropic, Google Vertex AI, Amazon Bedrock, Azure OpenAI, Mistral, Groq, DeepSeek, xAI, 그리고 Cloudflare 자신의 Workers AI가 포함됩니다.

그 모양이 뜻하는 것

도입은 정말로 저렴합니다. 서비스마다 설정값 하나이고 되돌리면 취소되므로, 프로젝트 계획 없이 시험해 볼 수 있는 몇 안 되는 인프라 변경입니다.

대신 제공업체 키가 이제 Cloudflare를 거쳐 갑니다. 프록시가 그것을 전달해야 하기 때문이며, 저장된 키나 Cloudflare가 관리하는 자격 증명으로 옮기지 않는 한 그렇습니다. 이것은 세부 사항이 아니라 신뢰에 관한 결정입니다.

그리고 제공되는 모든 것은 프록시가 볼 수 있는 범위에 묶여 있습니다. 프록시가 보는 것은 요청과 응답이지 애플리케이션의 의도가 아닙니다. 비용 배분이 게이트웨이의 추론에 기대는 대신 우리가 요청에 라벨을 붙이는 일이 되는 이유가 여기에 있습니다.

돈을 아껴 주는 기능은 분석과 로깅이다

게이트웨이는 모든 요청을 셉니다. Cloudflare의 로깅 문서는 항목 하나에 담기는 내용을 나열합니다. 사용자 프롬프트, 모델 응답, 제공업체, 타임스탬프, 요청 상태, 토큰 사용량, 비용, 소요 시간, 그리고 클라이언트 사용자 에이전트입니다. 월 단위가 아니라 요청 단위이고, 질의할 수 있습니다.

왜 강제 기능이 아니라 이쪽에 돈이 걸려 있는지 솔직하게 적겠습니다. 지출을 막아서 아끼는 것은 멈춘 호출의 비용뿐이고 거기에는 상한이 있습니다. 지출이 어디로 가는지 아는 것은 무엇을 만들지를 바꾸고, 거기에는 상한이 없습니다.

비용 배분은 자동이 아닙니다. 사용자 지정 메타데이터로 기능 이름이나 테넌트 같은 라벨을 붙여 두면 분석에서 그 기준으로 묶을 수 있습니다. 그것을 건너뛰면 손에 남는 것은 합계뿐이고, 그것은 청구서가 이미 주던 값입니다.

캐싱, 그리고 캐시 적중이 제품을 망치는 경우

캐싱은 잘못된 이유로 켜지는 일이 가장 많고, 제품을 조용히 망가뜨릴 힘이 가장 큰 기능입니다.

캐시 키는 어떻게 만들어지는가

Cloudflare의 캐싱 문서는 키를 제공업체, 엔드포인트, 모델, 인증 헤더, 그리고 요청 본문 전체의 SHA-256 해시로 설명합니다. 그 전부가 정확히 일치하면 적중이고 나머지는 실패입니다. 즉 적중하려면 바이트 단위로 동일한 요청이어야 하는데, 대화 기록이 쌓여 가는 채팅 엔드포인트에서는 첫 턴 이후에 거의 일어나지 않습니다. 유효 기간은 최소 60초, 최대 한 달입니다. 요청별 제어는 cf-aig-cache-ttl, cf-aig-skip-cache, cf-aig-cache-key로 하고, cf-aig-cache-status가 HIT 또는 MISS를 돌려주므로 실제 적중률을 측정할 수 있습니다.

적중이 안전할 때와 그렇지 않을 때

같은 입력이 같은 출력을 내야 하고 조금 오래된 답이어도 괜찮은 곳에서는 적중이 안전합니다. 분류, 구조화된 추출, 고정 문자열의 번역, 바뀌지 않은 문서의 임베딩, 평가용 트래픽이 여기에 해당합니다. 제품의 가치가 응답의 편차에 달려 있는 곳에서는 안전하지 않습니다. 두 사용자가 같은 질문을 했는데 두 번째 사람이 첫 번째 사람을 위해 생성된 응답을 받는다면, temperature 설정은 장식입니다.

더 나쁜 실패는 프라이버시 쪽입니다. 요청 본문에 사용자를 구별하는 것이 하나도 없다면 캐시된 응답이 사용자 경계를 넘을 수 있고, 이것은 품질 문제가 아니라 정보 유출입니다. 또한 캐싱의 대상은 텍스트와 이미지 응답뿐입니다.

요청 수 제한, 재시도, 폴백 라우팅

이 세 가지는 신뢰성 기능으로 묶여 설명됩니다. 비용을 의미 있게 묶는 것은 그중 하나뿐입니다.

요청 수 제한이 세는 것은 요청이지 토큰이 아니다

Cloudflare는 고정 윈도와 슬라이딩 윈도를 제공하며, 한도를 넘은 요청은 429를 받습니다. 무엇을 세는지 눈여겨보십시오. 요청입니다. 아주 큰 컨텍스트를 실은 호출 한 번은 짧은 호출보다 훨씬 비싸지만, 제한기는 그 둘을 구별하지 못합니다. 요청 수 제한이 지켜 주는 것은 폭주하는 루프와 남용된 엔드포인트이지 비싼 프롬프트가 아니며, 이것을 비용 통제로 여기는 것이 흔한 실수입니다.

재시도와 타임아웃

Cloudflare의 요청 처리 헤더cf-aig-max-attempts로 최대 5회의 시도를, cf-aig-retry-delay로 최대 5000밀리초의 지연을, cf-aig-backoff로 고정, 선형, 지수 중 하나의 전략을 지정하게 해 줍니다. cf-aig-request-timeout 헤더는 응답의 첫 부분이 도착한 시점부터 재므로, 스트리밍 호출에서는 전체 소요 시간의 한도가 아니라 첫 바이트까지의 시간에 대한 한도가 됩니다. 마지막 시도에서는 게이트웨이가 얼마가 걸리든 요청이 끝날 때까지 기다립니다.

폴백 라우팅은 모양이 바뀌었다

제공업체 객체의 배열을 받아 실패할 때마다 아래로 내려가던 Universal Endpoint는 더 이상 권장되지 않습니다. Cloudflare는 이제 새 통합을 OpenAI 호환 엔드포인트로, 그리고 폴백과 재시도와 조건부 라우팅에 대해서는 Dynamic Routing으로 안내합니다. 동적 경로는 이름과 버전을 가진 흐름이고 화면에서도 JSON으로도 만들 수 있으며, 모델 노드, 요청 본문이나 헤더나 메타데이터로 분기하는 조건 노드, A/B 테스트용 비율 노드, 그리고 초과했을 때 폴백으로 돌리는 요청 수 제한 노드와 예산 한도 노드로 이루어집니다. 호출할 때는 모델 이름이 들어갈 자리에 경로 이름을 적습니다.

들어가는 것과 돌아오는 것을 검사하기

프록시는 주고받는 양쪽을 모두 쥐고 있으므로 그것을 평가할 수 있습니다. Cloudflare의 Guardrails는 사용자 프롬프트와 모델 응답을 가로채 검토 대상으로 표시하거나 더 진행되지 못하게 막고, 어느 제공업체가 답했는지와 무관하게 하나의 정책을 적용합니다.

정책을 코드가 아니라 경로에 두자는 주장의 근거는, 애플리케이션 수준의 검열이 호출 지점마다 한 번씩 작성되어야 하고 지난주에 추가된 호출 지점이 바로 그것을 빠뜨리는 자리라는 점입니다. 대가는 검사 자체가 추론이라는 사실입니다. Guardrails는 Workers AI의 토큰 기반 사용량으로 과금되므로 가격은 검사 대상의 길이에 비례합니다. 데이터 유출 방지 검사는 모든 요금제에서 무료입니다.

2026년 8월 Agents Week에서 바뀐 것

Cloudflare는 첫 Agents Week를 2026년 8월 3일부터 7일까지 열었고, 마지막 날에 Workers AI와 AI Gateway의 통합을 단일 컨트롤 플레인으로 발표했습니다. 출시된 것과 예고된 것을 구분해서 읽어야 합니다.

출시된 것. 바인딩이 둘에서 하나가 되어 env.AI.run()이 Workers AI 모델과 외부 제공업체를 모두 다룹니다. 게이트웨이 라우팅은 Workers AI에서 선택 사항이 아니라 기본값이 되었고, gateway: { id: 'default' }를 주면 첫 사용 때 게이트웨이가 자동으로 만들어지며 다른 변경 없이 요청 로깅과 토큰 추적과 비용 배분이 따라옵니다. 크레딧은 제공업체를 넘나들며 쓸 수 있게 되어, Workers AI를 OpenAI나 Anthropic과 같은 선불 잔액에서 결제할 수 있습니다.

출시되지 않은 것. 모델을 요청하면 플랫폼이 제공업체를 고르는 모델 우선 라우팅은 이미 쓸 수 있는 것이 아니라 다음에 올 것으로 예고되었고, 프롬프트를 분류하는 스마트 라우터는 사내 시범 단계입니다. 이번 발표는 과금과 바인딩과 대시보드의 통합 정리이지 새로운 능력이 아닙니다. 이미 게이트웨이 없이 엣지에서 Workers AI를 호출하고 있었다면, 이제는 관측 가능성이 기본으로 따라옵니다.

Cloudflare AI Gateway의 비용

Cloudflare의 AI Gateway 요금 페이지는 현재 제공되는 핵심 기능이 무료로 제공된다고 밝히며, 여기에는 모든 요금제의 대시보드 분석과 캐싱과 요청 수 제한이 포함됩니다. 아래의 모든 숫자는 Cloudflare가 공개한 미국 달러 가격이며, Cloudflare가 공개한 통화 그대로 적습니다.

요금이 실제로 발생하는 지점

영구 로그는 사용 자체는 무료이지만 요금제별로 상한이 있습니다. Workers Free에서는 모든 게이트웨이를 합쳐 100,000건, Workers Paid에서는 게이트웨이당 1,000만 건입니다. 그 로그를 밖으로 내보내는 Logpush는 유료 요금제 기능으로 월 1,000만 건까지이고, 초과분은 추가되는 백만 건마다 0.05달러입니다. Workers AI 자체는 요금 페이지에 따르면 하루 10,000뉴런까지 무료이고, 유료 요금제에서는 그것을 넘는 분량에 1,000뉴런당 0.011달러가 부과됩니다. 뉴런은 GPU 연산에 대한 Cloudflare의 단위입니다.

통합 청구는 5퍼센트가 붙는다

자신의 제공업체 키 대신 Cloudflare가 관리하는 자격 증명을 쓰면 크레딧 구매에 5퍼센트의 수수료가 붙습니다. Cloudflare 자신의 예시는 100달러어치 크레딧 구매가 105달러로 청구되는 경우입니다. 추론은 마진 없이 그대로 통과됩니다. 자기 키를 가져오면 통합 청구는 적용되지 않는데, 제공업체 인증 정보나 저장된 키를 실은 요청은 그 경로를 건너뛰기 때문입니다.

비용 통제를 제대로 하는 법

게이트웨이가 확실하게 강제하는 것은 세 가지입니다. 요청 속도, 동적 경로 안의 예산 한도, 그리고 요청을 캐시에서 돌려줄지 여부입니다. 그 밖에 하는 일은 전부 측정입니다. 이 두 부류를 혼동하는 것이, 게이트웨이를 깔고 모든 항목에 체크를 하고도 여전히 청구서에 놀라는 이유입니다.

단단한 예산 상한은 설정이기 이전에 사업상의 결정입니다. 상한에 닿았을 때 무언가는 일어나야 하고, 선택지마다 저마다의 방식으로 나쁩니다. 요청을 실패시키면 마지막에 물어본 사람에게 제품이 나빠지고, 그것은 버그처럼 보입니다. 더 싼 모델로 내려가면 품질이 조용히 떨어집니다. 큐에 넣으면 비용 문제가 지연 문제로 바뀝니다. 그중 무엇을 고를지가 진짜 일입니다.

청구서까지 도달하는 절감은 대개 강제가 아니라 관측 가능성에서 옵니다. 지출이 기능별로 묶이고 나면 비싼 것은 거의 언제나 모델을 바꾸지 않고도 고칠 수 있습니다. 매 턴 보내는 지나치게 큰 시스템 프롬프트, 요약을 굴리면 될 자리에 매번 다시 보내는 대화 전체 기록, 애초에 성공할 리 없던 실패를 향해 계속 쏘는 재시도 루프. 로그는 그 전부를 찾아냅니다. 요청 수 제한기는 하나도 찾지 못합니다.

당신이 더하고 있는 지연

홉이 하나 늘어나는 것은 공짜가 아니고, 아닌 척하는 것이 좋은 결정을 나쁜 이유로 내리게 되는 경로입니다. 이제 요청은 Cloudflare 데이터 센터에서 한 번 끝나고 거기서 처리된 뒤 제공업체로 전달되므로, 전에는 내지 않던 TLS 핸드셰이크와 네트워크 구간 하나가 더해집니다.

보통의 경우 그것은 감싸고 있는 대상에 비하면 작습니다. 채팅 완성은 수백 밀리초에서 몇 초까지 걸리고 대부분은 생성 시간이며, 게이트웨이는 Cloudflare의 엣지 네트워크 위에 있으므로 첫 구간은 호출자 근처에서 끝납니다. 2초짜리 완성에 대해 이 추가분은 잡음입니다.

잡음이 아니게 되는 곳은 짧고 싸고 양이 많은 호출입니다. 0.1초를 크게 밑돌며 돌아오는 임베딩 요청은, 고정 비용이 눈에 보이는 비율이 되는 사례입니다. 다른 하나는 스트리밍인데, 사용자가 체감하는 숫자는 첫 토큰까지의 시간이고 그 토큰이 도착하기 전에 더한 것은 전부 가장 중요한 지표에 얹히기 때문입니다. 게이트웨이가 기록하는 소요 시간을 같은 호출을 직접 했을 때와 맞대어 재십시오.

다중 제공업체 전략과 벗어나지 못하는 종속

홍보 문구는 게이트웨이가 제공업체를 서로 바꿔 낄 수 있게 해 준다는 것이고, 전송 계층에 한정하면 그것은 사실입니다. OpenAI 호환 엔드포인트는 요청 모양을 하나로 만들어 주고, 동적 라우팅은 배포 없는 장애 조치를 주며, 모델 이름을 바꾸는 일은 코드가 아니라 설정이 됩니다.

비쌌던 부분은 애초에 전송 계층이 아니었습니다. 모델을 갈아타는 일이 비싼 것은 모델마다 행동이 다르기 때문입니다. 한 모델을 상대로 몇 달에 걸쳐 다듬은 시스템 프롬프트는 다른 모델에서 다른 출력을 냅니다. 도구 호출 형식과 그 신뢰도가 다릅니다. 거부 동작이 달라서 전에는 통과하던 내용이 거절됩니다. 요청한 JSON 모양을 얼마나 지키는지가 다르고, 한 모델의 습관에 맞춰 쓴 파서는 다른 모델에서 깨집니다. 컨텍스트 창의 크기도 다릅니다.

실제로 사는 것은, 갈아타기가 배관 공사 스프린트가 아니라 평가에 쓰는 반나절이 된다는 점과, 장애로 인한 자동 전환이 직접 만들지 않아도 존재한다는 점입니다. 가질 만한 가치는 있지만 이식성은 아닙니다. 이름을 붙여 둘 만한 이차적 의존이 하나 있습니다. 게이트웨이는 이제 모든 모델 호출의 경로에 앉으므로, 그 가용성이 곧 우리의 가용성이 됩니다. 이는 Cloudflare Workers와 AWS Lambda를 비교하며 살펴본 것과 같은 거래입니다.

프롬프트를 기록한다는 것은 개인정보를 처리한다는 뜻이다

이 절은 건너뛰기 쉬운 절이자 법적 노출이 달려 있는 절입니다. 로깅은 게이트웨이마다 기본으로 켜져 있고, 항목 하나에는 사용자 프롬프트와 모델 응답이 통째로 담깁니다. 사용자가 자기 자신에 관해 무언가를 입력하거나, 문서를 붙여 넣거나, 의료나 금전 상황을 어시스턴트에게 설명한다면, 그 내용은 제3자 로그 저장소에 놓인 개인정보이며 영국 GDPR 아래에서 당신은 여전히 그 관리자입니다.

애플리케이션을 떠나기 전에 가려라

무언가를 지울 수 있는 확실한 자리는 보내기 전뿐입니다. 게이트웨이는 메타데이터는 남기고 본문은 버리는 cf-aig-collect-log-payload: false와, 아무것도 기록하지 않는 cf-aig-collect-log: false를 제공합니다. 다만 데이터 최소화란 애초에 필요 이상으로 모으지 않는다는 이야기이므로, 오래가는 해결책은 상류에 있습니다. 계좌번호, 식별자, 그리고 모델이 필요로 하지 않는 자유 서술 항목은 요청이 프로세스를 떠나기 전에 걷어 내십시오.

보관 기간은 스스로 정해야 하는 결정이다

보관 제한에 관한 ICO의 지침은 고정된 기간을 정하지 않습니다. 요구하는 것은 필요한 기간보다 오래 개인정보를 보관하지 말 것, 선택한 기간을 정당화할 수 있을 것, 표준 기간을 정한 방침을 갖출 것, 그리고 검토한 뒤 더 필요하지 않은 것을 삭제하거나 익명화할 것입니다. 요금제 상한이 걸린 로그 저장소는 보관 방침이 아닙니다. 상한은 정당화된 기간이 아니라 저장 용량의 한계이기 때문입니다.

대안을 공정하게 늘어놓기

진짜 대안은 셋이고, 선택은 대체로 누가 그것을 운영하느냐의 문제입니다.

직접 띄우는 오픈소스 LLM 프록시는 같은 요청 경로를 주면서 로그를 우리가 통제하는 인프라에 둡니다. 프롬프트의 민감함 자체가 문제일 때는 이것이 정답입니다. 대가는 모든 모델 호출의 임계 경로 위에 있는 구성 요소를 운영해야 한다는 점입니다.

LLM 관측 가능성을 전문으로 하는 벤더는 평가, 프롬프트 버전 관리, 트레이스 검사에서 더 깊이 들어갑니다. 문제가 비용이 불투명한 것이 아니라 출력이 틀린 것이라면 그쪽이 더 잘 맞고, 둘은 서로 배타적이지도 않습니다.

직접 만드는 것도 필요가 좁을 때는 변호할 만합니다. 요청, 응답, 토큰 수, 기능 라벨을 기존 관측 스택에 기록하는 래퍼는 아마 이틀 정도의 작업이고 비용 배분 질문에는 답합니다. 싸게 얻을 수 없는 것은 올바른 키를 가진 캐싱과 제공업체를 넘나드는 폴백입니다.

원칙은 이렇습니다. 지출이 어디로 가는지 아무도 모른다면 게이트웨이가 가장 빠른 처방이고 무료 구간이 그 점을 증명해 줍니다. 프롬프트가 우리 인프라를 벗어나면 안 된다면 직접 띄우십시오. 출력이 틀렸다면 어떤 게이트웨이도 돕지 못하고 필요한 것은 평가 도구입니다.

구축에 드는 것과 돌아오는 것

이미 제공업체 하나를 호출하고 있는 단일 서비스라면 반나절입니다. 게이트웨이를 만들고, 설정의 베이스 URL을 바꾸고, 되돌리기가 릴리스가 아니라 환경 변수가 되도록 플래그 뒤에 배포하고, 로그가 쌓이는 것을 지켜보고, 스트리밍이 여전히 잘 동작하는지 확인합니다.

진짜 제품이라면 엔지니어 3일에서 5일을 잡으십시오. 그리고 그중 대부분은 게이트웨이 작업이 아닙니다. 실제로 던질 질문에 비용 배분이 답하도록 메타데이터 스키마를 정하는 일, 예약 작업과 일 년 동안 아무도 열어 보지 않은 코드까지 포함해 모든 호출 지점을 감사하는 일, 어느 엔드포인트를 안전하게 캐시할 수 있는지 가려내는 일, 그리고 마스킹 단계를 작성하는 일입니다. 폴백 라우팅에는 하루를 더하십시오. 폴백 모델이 받아들일 만한 출력을 낸다는 것을 시험해 본 뒤에야 폴백은 가질 가치가 생기기 때문입니다.

돌아오는 것은 화려하지 않습니다. 청구서에 더 이상 놀라지 않게 되고, 대부분의 팀에게는 그것이 절감의 절대액보다 낫습니다. 제공업체 장애는 사고가 아니라 품질이 떨어진 응답이 됩니다. 가장 크게 이득을 보는 쪽은 에이전트 워크플로를 만드는 팀입니다. 사용자의 동작 하나가 수십 번의 모델 호출로 퍼지는 자리가 바로 추정치가 현실에서 벌어지는 곳이기 때문이고, 이는 AI 에이전트의 비용과 실패 방식에서 다룬 양상이기도 합니다.

운영을 깨뜨리지 않고 도입하기

잘 통하는 순서는 일부러 지루합니다. 로깅만 켜고 나머지는 아무것도 켜지 않은 채 게이트웨이를 경로에 넣으십시오. 일주일 치 데이터를 모으십시오. 비용 배분을 읽으십시오. 그런 다음 데이터가 정당화하는 기능만 켜고, 캐싱은 마지막에, 반복된 답이 왜 옳은 답인지 말로 설명할 수 있는 엔드포인트에만 켜십시오.

Mecanik은 이 계층의 구축과 운영을 AI 통합 업무의 일부로 맡고 있으며, OpenAI API 연동 서비스가 제공업체 쪽을 담당합니다. 프로젝트는 거의 언제나 같은 방식으로 시작합니다. 일주일 동안 로깅만 하고 다른 것은 바꾸지 않습니다. 비용 배분 데이터가 대개 우선순위 목록을 다시 정렬해 놓기 때문입니다.



자주 묻는 질문

Cloudflare AI Gateway는 무료인가요? 핵심 기능은 모든 요금제에서 무료이고, Cloudflare의 요금 페이지는 그 범위를 대시보드 분석과 캐싱과 요청 수 제한으로 설명합니다. 데이터 유출 방지 검사도 무료입니다. 요금은 가장자리에서 발생합니다. Logpush는 유료 요금제 기능이고, Guardrails는 Workers AI의 토큰 기반 추론으로 과금되며, 로그 저장은 건당 가격이 아니라 요금제별 상한으로 묶입니다.

AI 게이트웨이는 모델 호출에 지연을 더하나요? 더합니다. TLS 핸드셰이크와 네트워크 구간 하나가 늘어납니다. 수백 밀리초에서 몇 초가 걸리는 채팅 완성에 비하면 그 추가분은 대개 무시할 만합니다. 눈에 띄는 것은 임베딩이나 작은 분류처럼 짧고 양이 많은 호출, 그리고 사용자가 체감하는 지표가 전체 소요 시간이 아니라 첫 토큰까지의 시간인 스트리밍 응답입니다.

LLM 응답을 캐시하면 안 되는 때는 언제인가요? 제품의 가치가 응답 사이의 편차에 달려 있을 때, 그리고 요청 본문이 사용자를 서로 구별하지 못할 때입니다. Cloudflare는 캐시 키를 제공업체, 엔드포인트, 모델, 인증 헤더, 요청 본문 전체로 만들기 때문에 적중은 바이트 단위로 동일한 요청을 뜻합니다. 캐싱은 분류와 추출과 임베딩에 맞고, 사용자마다 달라야 하는 대화형 응답에는 맞지 않습니다.

게이트웨이가 있으면 모델 제공업체를 쉽게 바꿀 수 있나요? 전송 계층에서는 그렇습니다. 요청 모양 하나, 설정 변경 하나, 그리고 배포 없는 장애 조치입니다. 정작 비싼 부분은 그대로 남습니다. 한 모델에 맞춰 다듬은 프롬프트는 다른 모델에서 다르게 동작하고, 도구 호출 형식과 거부 동작이 다르며, JSON 준수 정도가 다르고, 컨텍스트 창의 크기도 다릅니다. 게이트웨이가 없애 주는 것은 배관이지 평가 작업이 아닙니다.

Cloudflare는 2026년 8월에 무엇을 바꿨나요? 2026년 8월 7일 Agents Week 마지막 날에 Cloudflare는 Workers AI와 AI Gateway를 단일 컨트롤 플레인으로 통합했습니다. Workers AI와 외부 제공업체를 모두 다루는 하나의 AI 바인딩, Workers AI에서 기본으로 켜지는 게이트웨이 라우팅, 그리고 하나의 선불 잔액에서 제공업체를 넘나들며 쓰는 크레딧입니다. 모델 우선 라우팅은 출시가 아니라 다음에 올 것으로 예고되었습니다.