Cloudflare 在一个控制平面下将 Workers AI 和 AI Gateway 合并

One API 和预付余额现在涵盖托管模型和第三方模型;模型优先故障切换和基于提示的路由仍在测试中。

By · Published

Primary source: X

Why it matters

Cloudflare is positioning AI models as replaceable infrastructure behind one API, bill and policy layer. The shipped billing changes increase its control today; automated model selection remains a promise.

Cloudflare merges Workers AI and AI Gateway behind one control plane — One API and prepaid balance now cover hosted and third-party models; model-first failover and prompt-based routing remain in testing.

Cloudflare 在 8 月 7 日将 Workers AI 和 AI Gateway 统一,为开发者提供了一个通用接口、计费余额和一套针对由 Cloudflare 或外部提供商托管模型的流量控制。 Cloudflare Developers account (@CloudflareDev) 在发布此变更的同时,刊登了 Cloudflare 的 Michelle Chen 和首席产品经理 Ming Lu 的技术文章

此次发布将 Cloudflare 为推理堆栈不同部分构建的两款产品整合到一起。Workers AI 在 Cloudflare 管理的 GPU 上运行模型。AI Gateway 位于模型提供商之前,处理日志记录、缓存、速率限制、重试、安全控制和成本跟踪。开发者现在可以通过 env.AI.run() 绑定或使用 Cloudflare 身份验证的共享 /ai/ REST 端点访问两者。

对于 Matthew Prince (@eastdakota),Cloudflare 的联合创始人兼 CEO 来说,这一产品动作遵循了塑造 Cloudflare 的基础设施剧本。Prince 在 2009 年与 Michelle Zatlyn 和 Lee Holloway 一起创立 Cloudflare 之前,共同创建了 Project Honey Pot。随后,Cloudflare 将其内部的无服务器架构公开为 Workers,把为自身网络开发的基础设施变成了供外部开发者使用的产品。

一个 API,一个钱包

最具体的新增是计费。开发者现在可以使用预付 AI Gateway 积分来为 Workers AI 推理以及受支持的第三方服务(包括 OpenAI、Anthropic 和 Google AI Studio)付费。请求可以回退到 Cloudflare 管理的提供商凭据,从而无需为每个提供商保留单独的 API 密钥和账户余额。

这种便利是有代价的。Cloudflare 在客户购买统一计费积分时收取 5% 的费用。根据 Cloudflare 的文档,提供商的推理价格按原价转嫁,不另加代币溢价。购买 100 美元积分的客户将被收取 105 美元。

Cloudflare 正在利用速率限制将开发者推向共享钱包。三款 Workers AI frontier 模型 —— Kimi K2.6、Kimi K2.7 Code 和 GLM-5.2 —— 在通过 AI Gateway 积分付费时,按每个账户和每个模型每分钟 50 次请求的限制计费,而在标准 Workers AI 计费下为 20 次。更高的限制适用于这三款模型,而不是整个 Workers AI catalog

统一路径还使 AI Gateway 的可观测性对 Workers AI 调用可用。开发者可以将 default 指定为网关 ID,Cloudflare 会在首次经过身份验证的请求时创建该网关。生成的仪表板会跟踪延迟、错误、代币使用和成本。

Cloudflare 默认在网关日志中存储完整的提示和响应。处理敏感输入的开发者可以禁用有效载荷存储,同时保留诸如模型、提供商、代币计数、状态、成本和持续时间等元数据。

路由是更大的押注

Cloudflare 的下一步是以模型为先的路由。开发者不再选择特定的托管提供商,而是请求某个模型,由 AI Gateway 决定在哪里运行它。Cloudflare 以 Kimi K2.7 Code 为例:一次请求可以在 Workers AI、Moonshot AI 的自有服务或另一个经审核、提供相同权重的主机上运行。如果某个提供商耗尽容量或发生故障,Cloudflare 计划在不要求应用中写入回退代码的情况下移动请求。

Cloudflare 表示希望在未来几个月试点以模型为先的路由。该功能不属于 8 月 7 日的发布内容。

智能路由仍然进展较慢。Cloudflare 正在测试一个分类器,该分类器会检查提示、识别任务及其复杂性,然后从策划的模型池中选择模型。Cloudflare 表示内部测试正在进行,并描述了未来几周的发布工作,但未给出具体上线日期。

这一区别很重要,因为统一模型网关已经是一个争夺激烈的基础设施层。Vercel AI Gateway 提供统一 API、预付积分、可观测性和提供商回退,其默认路由可以根据最近的正常运行时间和延迟选择提供商。Amazon Bedrock 在同一家族支持的模型之间提供智能提示路由。

Cloudflare 的优势在于拥有请求的两端:控制流量的网关和可以提供部分服务的 GPU 网络。统一计费使得即便推理在别处运行,Cloudflare 仍与开发者建立了商业关系。以模型为先的路由可以通过让 Cloudflare 决定每个请求发送给哪个提供商来加深这一地位。计费层现在已经可用;而那套会使控制平面在战略上更难被替代的路由系统仍在建设中。

Reader comments

Conversation for this story loads after sign-in.