多数团队都是从应用代码里直接调用模型提供商。API 密钥放在环境变量里,SDK 调用只有三行,第一次就跑通了。Cloudflare AI Gateway 之所以存在,是因为接下来会发生的事。账单来了,却没有人说得清是哪个功能花掉的。提供商度过了糟糕的一个下午,顺带把你的产品也拖了下去。系统提示词被改过一次,而旧的那一版返回过什么,没有任何记录。 网关就是放在应用与提供商之间的一个代理。所有请求都经过它,所以所有请求都可以被计数、记录、缓存、限流,并且在提供商出故障时改到别处重试。对于三个原本只会被拖到很晚、再用手工方式解决的问题来说,它是最便宜的结构性修法。 下面要讲的是它做什么,它除了观测之外还能强制什么,它在金钱和毫秒上分别要你...
基础设施教程
实用的 IT 基础设施指南,涵盖云平台、网络、容器与 Kubernetes、DevOps、监控、安全与性能。
“Drupal 很慢”这个名声,绝大部分来自主机托管,而它几乎总是一个采购决定,而不是软件问题。站点被认真地做了出来,然后上线在一个按“几个 PHP 文件的宣传册站点”定价的套餐上。结果就是:一套带着正经渲染管线的内容管理系统,跑在一个自己改不了的内存上限里,跑在一个自己控制不了的操作码缓存上,还没有一个能运行自身工具的命令行。 人们心里拿来对比的是 WordPress,而这个对比是错的。WordPress 几乎在任何环境下都能凑合跑,是因为它的市场份额逼着主机商把它做成几乎在任何环境下都能凑合跑。Drupal 的前提不同:它假定你有较新的 PHP、较新的数据库、真正的缓存后端、一个命令行,以及一套把代码库当成构建产物而不是当成“可...
可用性 SLA 看上去像一句承诺,实际运作起来却更像一份退款政策。供应商很清楚这一点。客户往往并不清楚,于是在签署服务级别协议时以为自己买到了可用性,而真正买到的,只是万一没拿到时的一点折扣。 这不一定是笔糟糕的交易。它只是与大多数人以为自己在签的那笔交易不同,而这个差别恰恰在系统宕机、有人追问合同究竟怎么写的那一刻显现出来。 三个九听上去接近完美,却允许每月 43 分钟的停机。 四个九允许四分钟。如果你的业务能吸收工作日下午 43 分钟的中断,99.9% 就足够了,不必为更高的数字付费。如果吸收不了,再多的九也帮不上忙,因为协议给你的是一笔积分,而不是阻止这次中断。 可用性 SLA 用分钟兑现的承诺百分比把一个非常大的区间压缩成看...
在小团队里,灾难恢复通常只剩下一份从来没人打开过的文档里的一行字:备份已经开启。这句话本身没错,却算不上任何问题的答案,因为它既没有说明真正出事时找回来的数据会有多旧,也没有说明恢复一次要花多长时间,更没有说明到今天为止究竟有没有人完整地做过一次恢复。 拥有备份和真的能恢复之间存在一段明显的距离,大多数故障正是在这段距离里升级成事故。一份存在、内容也够新、却从来没有被还原过的备份,本质上仍然只是一个假设;而你第一次去验证这个假设的时刻,恰好是发现它其实是错的最糟糕的时刻。 两个数字能把意见变成计划。 你能承受丢多少数据,又能承受停多久?这就是你的恢复点目标和恢复时间目标。只要业务一侧没有人把这两个数字说出口,关于备份频率的一切技术争...
自托管 Kimi K3 在 2026 年 7 月 27 日成为技术上可行的选项,那天 Moonshot AI 连同生产级推理支持一起公开了这个 2.8 万亿参数模型的权重。许多机构读到这条消息后得出结论:现在可以在自家硬件上运行前沿级推理,不必再按 token 付费了。 这个结论通常是错的,但原因并非人们预想的那样。工程上是可以做到的。真正击垮多数项目的是那笔账,而且它往往在预算批下来好几个月后才悄无声息地发作。 简短回答: 在 MXFP4 精度下,2.8 万亿参数在计入键值缓存之前就已占用约 1.4TB。一个八卡 H100 节点只有 640GB,因此根本无法服务这个模型。现实的部署要从约 1.7TB 显存起步,...
配置一套稳健的 Cloudflare CDN 缓存策略,是 2026 年为企业级网站进行速度优化时影响最大的工程任务之一。许多 Web 平台之所以延迟很高,是因为每一个用户请求都必须访问源站数据库服务器才能渲染页面。这种对源站的依赖会拖慢 First Contentful Paint(FCP)和 Largest Contentful Paint(LCP)等速度指标,而将静态页面布局与资源组件存储在全球各地的边缘节点,则能从最近的边缘节点提供快速、低延迟的响应。本指南将详细拆解缓存机制、Edge Cache TTL 规则以及动态 cookie 绕过配置。 缓存优化提示: 避免缓存包含已登录用户信息的 HTML 页面。...
迁移到 Cloudflare Zero Trust 是企业在 2026 年替换过时企业 VPN 的关键现代化步骤。传统的 VPN 网络在用户通过初始登录墙后,会向其授予对整个企业子网的广泛访问权限,因此单个被盗的员工凭据就会让攻击者能够直接转向敏感的数据库服务器。相比之下,Zero Trust 架构会评估每个应用请求的授权检查,默认阻止未经验证的流量。本指南介绍了用于构建 Zero Trust 环境的配置阶段、安全隧道设置和策略定义。 VPN 安全风险警示: 传统的 VPN 设置会使您的内部网络暴露于横向移动攻击。升级到边缘验证的访问路径可确保您的数据库保持隔离,即使员工的本地笔记本电脑被入侵也是如此。 核心要点:...
Cloudflare Pages 托管让前端团队能够发布快速、安全且无需服务器管理的代码。通过使用 Cloudflare Pages,开发者获得了一个高性能的边缘原生平台,用于部署静态 Web 应用、单页应用(SPA)和服务端渲染(SSR)框架。通过直接连接到你的 Git 仓库,Cloudflare 自动化构建流水线、生成预览部署,并在全球范围内托管资源。本指南将说明如何连接 Git、配置构建设置、设置自定义域名以及配置重定向。 要点速览(TL;DR) 部署边缘原生前端应用;Cloudflare Pages 从 Cloudflare 网络在全球范围内提供资源,确保亚秒级加载时间。 自动化 Git 集成;关联你的仓库以触发自动构建,并...
本 Cloudflare Workers AI 教程将向您展示如何直接在 Cloudflare 的全球边缘网络上部署和运行机器学习模型。借助 Cloudflare Workers AI,您可以在靠近用户的地方执行大型语言模型(LLMs)、文本翻译、图像生成和语音转文字,而无需管理复杂的 GPU 服务器。以下步骤涵盖了如何配置 Wrangler、编写 fetch 处理程序、运行 Llama 模型以及优化边缘 API 成本。 TL;DR 无服务器运行 AI 模型;Cloudflare Workers AI 管理底层 GPU 基础设施,仅按活跃计算量计费。 在 wrangler.toml 中配置绑定(bindings);...
Cloudflare Workers 与 AWS Lambda 都是无服务器计算平台,但它们的起点不同。Lambda 是庞大 AWS 生态系统中确立的无服务器标准;Workers 则是边缘原生的,为低延迟和全球分发而生。2026 年,两者都很出色,正确的选择取决于你的工作负载和现有技术栈。本指南从真正重要的维度对比 Cloudflare Workers vs AWS Lambda。 要点速览(TL;DR) Workers 在轻量的 V8 isolates 上于 edge 运行,cold start 几乎为零,并默认全球分发 Lambda 在 AWS 区域中以 microVM 模型运行,支持众多语言运行时,并与 AWS 生态系统深度集...