Serverless

서버리스 컴퓨팅 가이드와 리소스. 엣지 함수, Cloudflare Workers, AWS Lambda와 아키텍처 패턴을 다룹니다.

Cloudflare AI Gateway: LLM 비용 통제하기

대부분의 팀은 애플리케이션 코드에서 모델 제공업체를 곧바로 호출합니다. API 키는 환경 변수에 들어 있고, SDK 호출은 세 줄이면 끝나며, 처음부터 잘 동작합니다. Cloudflare AI Gateway가 존재하는 이유는 그다음에 벌어지는 일 때문입니다. 청구서가 도착했는데 어떤 기능이 그 금액을 만들었는지 아무도 말하지 못합니다. 제공업체가 하루 오후를 망치면 제품도 함께 끌려 내려갑니다. 시스템 프롬프트를 고쳤는데, 예전 프롬프트가 무엇을 돌려주었는지에 대한 기록이 남아 있지 않습니다. 게이트웨이는 애플리케이션과 제공업체 사이에 놓이는 프록시입니다. 모든 요청...

Cloudflare Queues: 엣지의 백그라운드 작업

Cloudflare Queues는 모든 서버리스 애플리케이션이 언젠가는 마주치는 문제를 해결합니다. 사용자가 기다릴 이유가 없는 작업을 유발하는 요청이 들어온다는 문제입니다. 확인 메일 발송, 업로드된 이미지 리사이즈, 레코드를 외부 서비스로 동기화하는 처리 같은 것들입니다. 전통적인 서버라면 그 일을 백그라운드 워커 프로세스에 넘기면 됩니다. 그런데 Workers에는 넘길 프로세스 자체가 없습니다. 흔히 쓰이는 우회책들은 보기보다 나쁩니다. 요청 안에서 그대로 처리하면 사용자가 메일 발송 업체의 응답을 기다리게 됩니다. 다른 Worker로 요청만 던지고 기다리지 않...

Cloudflare Hyperdrive: 엣지에서 쓰는 Postgres

Cloudflare Hyperdrive는 아주 구체적이고 전혀 화려하지 않은 문제 때문에 존재합니다. 200개 도시에서 실행되는 Worker가 한 도시에 있는 단일 Postgres 데이터베이스와 대화하면, 그 데이터베이스 바로 옆에 놓인 서버 한 대에서 같은 쿼리를 던질 때보다 느립니다. 조금 느린 정도가 아닙니다. 흔히 몇 배씩 느리며, 그 이유는 쿼리를 어떻게 작성했는지와는 아무 상관이 없습니다. 서버리스 애플리케이션이 굼뜨게 느껴질 때 나오는 반사적인 반응은 쿼리 플래너를 탓하거나 인덱스를 하나 더 추가하는 것입니다....

속도 향상을 위한 Cloudflare CDN 캐싱 전략 최적화

견고한 Cloudflare CDN 캐싱 정책을 구성하는 것은 2026년 엔터프라이즈 웹사이트의 속도를 최적화하기 위한 가장 영향력 있는 엔지니어링 작업 중 하나입니다. 많은 웹 플랫폼은 모든 사용자 요청이 페이지를 렌더링하기 위해 오리진 데이터베이스 서버까지 이동해야 하기 때문에 높은 지연 시간에 시달립니다. 이러한 오리진 의존성은 First Contentful Paint(FCP)와 Largest Contentful Paint(LCP) 속도 지표를 지연시키는 반면, 정적 페이지 레이아웃과 자산 구성 요소를 전 세계 엣지 위치에 저장하면 가장 가까운 엣지 위치에서 빠르...

AI 도입 비용: 2026년 기업 예산 수립 가이드

실제 AI 도입 비용을 파악하는 것은 2026년에 대규모 언어 모델(LLM)을 배포하려는 영국(UK) 기업에 중요한 재정적 단계입니다. 소프트웨어 애플리케이션에 AI를 통합하면 고객 서비스 파이프라인을 자동화하고 생산성을 높이며 대화 데이터에서 인사이트를 도출할 수 있습니다. 그러나 이러한 도입 예산을 수립하려면 단순히 개발자 시간당 단가를 파악하는 것 이상이 필요합니다. 구체적으로 기업은 정기적인 토큰 비용, 벡터 데이터베이스 호스팅 비용 및 프롬프트 검증 미들웨어 비용을 계산해야 합니다. 이 가이드에서는 맞춤형 AI 도입과 관련된 가격 구조, API...

LLM 지연 시간을 줄이는 방법: 캐싱과 에지 전략

LLM 지연 시간을 줄이는 일은 반응성 높은 AI 애플리케이션을 만드는 엔지니어에게 가장 중요한 과제 중 하나입니다. 대규모 언어 모델(LLM)의 성능은 계속 발전하고 있지만, 토큰을 하나씩 생성하는 방식은 최종 사용자에게 답답한 병목을 만들 수 있으며, 긴 대기 시간은 곧바로 참여도 저하와 애플리케이션 이탈로 이어집니다. 따라서 추론 파이프라인의 속도를 최적화하는 것은 개발자의 핵심 요구사항입니다. 이 가이드는 프롬프트 캐싱을 구성하고, 응답 스트리밍을 구현하며, 에지 네트워크 라우팅을 설계하고, 서버리스 구성을 활용해 처리 지연을 줄이는 방법을 설명합니다. 성능 ...

음성 에이전트 구축: OpenAI Realtime API 가이드

새로운 OpenAI Realtime API를 사용하여 초저지연 오디오 파이프라인을 구축하면 개발자는 실제 사람과 대화하는 듯한 자연스러운 인터랙션을 제공하는 음성 에이전트를 프로덕션 환경에 배포할 수 있습니다. 기존에는 음성 인터페이스를 구축하기 위해 자동 음성 인식(ASR), 텍스트 기반 LLM 로직 레이어, 텍스트 음성 변환(TTS) 합성이라는 세 가지 독립된 모델 레이어를 체인 방식으로 엮어야 했습니다. 이러한 다단계 파이프라인은 심각한 네트워크 왕복 지연을 유발하여 자연스러운 실시간 대화를 방해했습니다. 지속적인 WebSocket 연결을 통한 네이티브 오디오 ...

Claude Opus 4.8 vs. OpenAI GPT-5: 어떤 API가 최고인가?

Claude Opus 4.8과 OpenAI GPT-5 개발자 API 중 무엇을 선택할지는 2026년 기업용 AI 애플리케이션을 구축하는 팀에게 매우 중요한 의사결정입니다. 대규모 언어 모델(LLM)을 상용 운영 코드베이스에 통합할 때 선택한 모델 공급업체에 따라 플랫폼의 기능적 한계, 지연 시간 허용 범위 및 장기적인 호스팅 유지 관리 비용이 결정됩니다. Anthropic의 Opus 4.8은 심층적인 다단계 추론과 거대한 컨텍스트 메모리에 초점을 맞추는 반면, OpenAI의 GPT-5는 스트리밍 응답 지연 시간 단축, JSON 스키마 적용 자동화, 그리고 도구 호...

Claude Fable 5 하이브리드 추론: 사고 모드 vs. 속도 모드

Anthropic의 새로운 Claude Fable 5 추론 엔진은 모든 요청에 대해 심층 사고 기능을 항상 켠 상태로 유지하며, 대신 개발자가 추론의 깊이를 높이거나 낮출 수 있도록 합니다. 과거 대규모 언어 모델(LLM)은 질문의 복잡성에 관계없이 균일한 속도로 토큰을 생성하는 고정된 연산 매개변수로 작동했습니다. 단순한 인사말도 고도의 수학적 증명과 동일한 연산 에너지를 소모했습니다. Fable 5와 함께 Anthropic은 사고 기능이 항상 활성화되어 있으며 단일 effort 설정을 통해 모델이 얼마나 깊이 연산할지를 제어하는 하이브리드 추론 프레임워크를 선보였...

Cloudflare Pages에서 정적 웹 앱 호스팅하기: 2026 가이드

Cloudflare Pages 호스팅을 사용하면 프런트엔드 팀은 빠르고 안전하며 서버 관리가 필요 없는 코드를 배포할 수 있습니다. Cloudflare Pages를 사용하면 개발자는 정적 웹 애플리케이션, 싱글 페이지 앱(SPA), 서버 사이드 렌더링(SSR) 프레임워크를 배포할 수 있는 고성능 에지 네이티브 플랫폼을 확보하게 됩니다. Git 저장소에 직접 연결함으로써 Cloudflare는 빌드 파이프라인을 자동화하고, 프리뷰 배포를 생성하며, 에셋을 전 세계에 호스팅합니다. 이 가이드에서는 Git을 연결하고, 빌드 설정을 구성하고, 사용자 지정 도메인을 설정하고, ...