Cloudflare Workers

关于Cloudflare Workers的指南、教程和示例,这是一个在网络边缘部署快速、可扩展且安全应用的无服务器平台。

Cloudflare AI Gateway:控制你的 LLM 成本

多数团队都是从应用代码里直接调用模型提供商。API 密钥放在环境变量里,SDK 调用只有三行,第一次就跑通了。Cloudflare AI Gateway 之所以存在,是因为接下来会发生的事。账单来了,却没有人说得清是哪个功能花掉的。提供商度过了糟糕的一个下午,顺带把你的产品也拖了下去。系统提示词被改过一次,而旧的那一版返回过什么,没有任何记录。 网关就是放在应用与提供商之间的一个代理。所有请求都经过它,所以所有请求都可以被计数、记录、缓存、限流,并且在提供商出故障时改到别处重试。对于三个原本只会被拖到很晚、再用手工方式解决的问题来说,它是最便宜的结构性修法。 下面要讲的是它做什么,它除了观测之外还能强制什么,它在金钱和毫秒上分别要你...

Cloudflare Queues:在边缘处理后台任务

Cloudflare Queues 解决的是每个无服务器应用迟早都会撞上的那个问题:一个请求到达,触发了一段用户本不该等待的工作。发送确认邮件、给上传的图片改尺寸、把记录同步到第三方服务。这些活儿的共同点是:它们必须发生,但并不需要在用户按下按钮的那一刻发生。在传统服务器上,你把这类活儿交给一个后台工作进程就行了。可是在 Workers 上,请求处理完就结束,根本没有可以交出去的常驻进程。 常见的几种绕开办法,比看上去更糟。把工作放在请求里同步做完,等于让用户去等一个邮件服务商的响应。向另一个 Worker 发出请求却不等待它,只要发起方的调用先结束,这个任务就丢了。这两种做法都扛不住服务商的一次故障。 队列真正给你的是什么: 是持...

Cloudflare Hyperdrive:从边缘访问 Postgres

Cloudflare Hyperdrive 的存在,是为了解决一个非常具体、也毫不光鲜的问题:一个在 200 座城市里运行的 Worker,去和一座城市里的那一个 Postgres 数据库对话,会比同一条查询从紧挨着这台数据库的服务器发出更慢。不是慢一点点,而往往是慢上好几倍,而且这些原因和查询本身怎么写完全没有关系。 当一个无服务器应用显得迟钝时,人们的第一反应通常是怪查询规划器,或者再加一个索引。但在与某个区域数据库通信的 Workers 上,查询本身通常没有毛病。真正出问题的是连接。 Hyperdrive 真正修好的东西: 建立一次数据库连接的代价,而且这笔代价要在每一个请求上重新付一遍。一条 Postgres 连接在第一行数...

Image Resizing 现已更名为 Image Transformations

如果你照着 2026 年之前写的 Cloudflare 教程操作过,装过名字里带 “resizing” 的插件,或者接手过一个重写图片 URL 的 Worker,你多半已经撞上了一件让人困惑的事:Cloudflare 控制台里再也没有叫 Image Resizing 的功能,文档里也不提它了。你的配置并没有坏掉,只是你要找的那个名字悄悄消失了。 这个功能现在叫 Image Transformations。它做的是同一件事,走同一套 URL 结构,用同一批参数。变的是名字、它在控制台里的位置,以及计费方式。最后一点值得仔细读,因为计费模型和大多数旧教程描述的确实不一样。 一句话概括: 你现有的 URL 和 Worker 照常工...

如何降低 LLM 延迟:缓存与边缘策略

降低 LLM 延迟是构建响应迅速的 AI 应用的工程师面临的最关键挑战之一。虽然大型语言模型(LLM)的能力持续增强,但它们逐 token 的生成方式会给最终用户带来令人沮丧的瓶颈,而漫长的等待时间会直接导致参与度下降和应用流失。因此,优化推理管线的速度是开发者的一项核心要求。本指南概述了如何配置提示词缓存、实现响应流式传输、构建边缘网络路由,以及使用无服务器配置来削减处理延迟。 性能指标提示: 在测量 API 延迟时,请将首个 Token 时间(TTFT)与整体生成速度区分开来。较低的 TTFT 会让应用对用户产生即时的感觉,即便整个输出生成需要数秒,因为文本会立即开始渲染。 要点总结: 提示词缓存: 复用静态前缀头以绕过解析状...

构建语音智能体:OpenAI Realtime API指南

使用全新的 OpenAI Realtime API 构建低延迟音频管道,使开发人员能够在生产环境中推出类似人类的对话式语音智能体。传统上,构建语音界面意味着将三个独立的模型层链接在一起:自动语音识别(ASR)、基于文本的 LLM 逻辑层,以及文本转语音(TTS)合成。该多步骤管道引入了显著的往返网络延迟,使得自然对话变得不可能。通过持久的 WebSocket 连接进行原生音频处理改变了这一现状,将网络延迟降低到 300 毫秒以下。本指南阐述了如何建立连接状态、流式传输原始音频缓冲区以及优化会话配置。 API 安全警告:切勿在客户端浏览器脚本中直接公开您的 OpenAI API 密钥。始终通过安全的边缘中间件(如 Cloudflare...

基于Cloudflare Workers和LangChain构建AI智能体

构建 Cloudflare Workers AI 智能体是从简单的 AI 提示词过渡到自适应工作流的下一步。这些被称为 AI 智能体(AI Agent)的系统使用大语言模型(LLM)来调用外部工具、做出决策并自主执行任务。虽然传统的智能体运行需要沉重的服务器,但本教程将向您展示如何使用 Cloudflare Workers 和 LangChain.js 构建并托管无服务器的 AI 智能体。 TL;DR 了解 AI 智能体:智能体使用 LLM 做出决策并调用外部 API(工具/tools)来自主解决用户查询。 在边缘(edge)端使用 LangChain.js:LangChain.js 与 Cloudflare Workers 轻量级...

使用 Cloudflare Workers AI 在边缘部署 Llama 3

本 Cloudflare Workers AI 教程将向您展示如何直接在 Cloudflare 的全球边缘网络上部署和运行机器学习模型。借助 Cloudflare Workers AI,您可以在靠近用户的地方执行大型语言模型(LLMs)、文本翻译、图像生成和语音转文字,而无需管理复杂的 GPU 服务器。以下步骤涵盖了如何配置 Wrangler、编写 fetch 处理程序、运行 Llama 模型以及优化边缘 API 成本。 TL;DR 无服务器运行 AI 模型;Cloudflare Workers AI 管理底层 GPU 基础设施,仅按活跃计算量计费。 在 wrangler.toml 中配置绑定(bindings);...

Cloudflare Workers vs AWS Lambda 2026

Cloudflare Workers 与 AWS Lambda 都是无服务器计算平台,但它们的起点不同。Lambda 是庞大 AWS 生态系统中确立的无服务器标准;Workers 则是边缘原生的,为低延迟和全球分发而生。2026 年,两者都很出色,正确的选择取决于你的工作负载和现有技术栈。本指南从真正重要的维度对比 Cloudflare Workers vs AWS Lambda。 要点速览(TL;DR) Workers 在轻量的 V8 isolates 上于 edge 运行,cold start 几乎为零,并默认全球分发 Lambda 在 AWS 区域中以 microVM 模型运行,支持众多语言运行时,并与 AWS 生态系统深度集...

构建 Cloudflare Workers API:无服务器指南 2026

Cloudflare Workers 让你无需管理服务器,就能在靠近用户的边缘运行后端代码。对 API 而言,近乎为零的冷启动、全球分发与紧密集成的存储三者结合,使 Workers 在 2026 年成为极具吸引力的平台。本指南讲解 Cloudflare Workers API 的结构,以及它与传统后端有何不同。 要点速览 Cloudflare Workers 在边缘的 Cloudflare 全球网络上运行你的代码,因此请求可在靠近用户处以近乎为零的冷启动被处理 Worker 通过 fetch 处理器处理传入请求;你按方法与路径进行路由,并返回标准的 Response 对象 Workers 直接绑定到存储:D1(SQLite)、KV(...