Cloudflare integra Workers AI y AI Gateway bajo un único plano de control

Una API y un saldo prepago ahora cubren modelos alojados y de terceros; la conmutación por error orientada al modelo y el enrutamiento basado en indicaciones siguen en pruebas.

By · Published

Primary source: X

Why it matters

Cloudflare is positioning AI models as replaceable infrastructure behind one API, bill and policy layer. The shipped billing changes increase its control today; automated model selection remains a promise.

Cloudflare merges Workers AI and AI Gateway behind one control plane — One API and prepaid balance now cover hosted and third-party models; model-first failover and prompt-based routing remain in testing.

Cloudflare unificó Workers AI y AI Gateway el 7 de agosto, proporcionando a los desarrolladores una interfaz común, un saldo de facturación y un conjunto de controles de tráfico para modelos alojados por Cloudflare o por proveedores externos. La cuenta Cloudflare Developers (@CloudflareDev) anunció el cambio junto con una publicación técnica de Michelle Chen y del principal gerente de producto Ming Lu, de Cloudflare.

El lanzamiento reúne dos productos que Cloudflare construyó para distintas partes de la pila de inferencia. Workers AI ejecuta modelos en GPUs administradas por Cloudflare. AI Gateway se sitúa frente a los proveedores de modelos y maneja el registro, el cacheo, los límites de tasa, los reintentos, los controles de seguridad y el seguimiento de costos. Los desarrolladores ahora pueden acceder a ambos a través del enlace env.AI.run() o de los endpoints REST compartidos /ai/ usando la autenticación de Cloudflare.

Para Matthew Prince (@eastdakota), cofundador y CEO de Cloudflare, el movimiento de producto sigue el manual de infraestructura que dio forma a Cloudflare. Prince co-creó Project Honey Pot antes de fundar Cloudflare en 2009 junto con Michelle Zatlyn y Lee Holloway. Más tarde, Cloudflare expuso su arquitectura serverless interna como Workers, convirtiendo infraestructura desarrollada para su propia red en un producto para desarrolladores externos.

Una API, una billetera

La incorporación más concreta es la facturación. Los desarrolladores ahora pueden usar créditos prepagados de AI Gateway para inferencia en Workers AI así como para servicios de terceros compatibles, incluyendo OpenAI, Anthropic y Google AI Studio. Las solicitudes pueden recurrir a credenciales de proveedor administradas por Cloudflare, eliminando la necesidad de mantener una clave API separada y un saldo de cuenta para cada proveedor.

Esa conveniencia tiene un costo. Cloudflare aplica una tarifa del 5% cuando los clientes compran créditos de facturación unificada. Los precios de inferencia del proveedor se transmiten sin un recargo adicional por token, según la documentación de Cloudflare. Un cliente que compre $100 en créditos paga $105.

Cloudflare está usando límites de tasa para empujar a los desarrolladores hacia la billetera compartida. Tres modelos frontier de Workers AI — Kimi K2.6, Kimi K2.7 Code y GLM-5.2 — reciben un límite de 50 solicitudes por minuto por cuenta y por modelo cuando se pagan con créditos de AI Gateway, frente a 20 bajo la facturación estándar de Workers AI. El límite más alto se aplica a esos tres modelos en particular y no al catálogo de Workers AI en su totalidad.

La ruta unificada también pone la observabilidad de AI Gateway a disposición de las llamadas de Workers AI. Un desarrollador puede especificar default como el ID del gateway, y Cloudflare creará el gateway en la primera solicitud autenticada. El panel resultante rastrea latencia, errores, uso de tokens y costo.

Por defecto, Cloudflare almacena prompts completos y respuestas en los registros del gateway. Los desarrolladores que manejan entradas sensibles pueden desactivar el almacenamiento de payloads mientras conservan metadatos como modelo, proveedor, conteo de tokens, estado, costo y duración.

El enrutamiento es la apuesta mayor

El siguiente paso de Cloudflare es el enrutamiento centrado en el modelo. En lugar de seleccionar un proveedor de hosting específico, un desarrollador solicitaría un modelo y dejaría que AI Gateway eligiera dónde ejecutarlo. Cloudflare usó Kimi K2.7 Code como ejemplo: una solicitud podría ejecutarse en Workers AI, en el servicio propio de Moonshot AI u otro host evaluado que ofrezca los mismos pesos. Si un proveedor se queda sin capacidad o falla, Cloudflare planea mover la solicitud sin requerir código de respaldo en la aplicación.

Cloudflare dijo que espera pilotar el enrutamiento centrado en el modelo en los próximos meses. La función no forma parte del lanzamiento del 7 de agosto.

El enrutamiento inteligente sigue más rezagado. Cloudflare está probando un clasificador que inspeccionaría un prompt, identificaría la tarea y su complejidad, y luego elegiría un modelo de una piscina curada. Cloudflare dijo que las pruebas internas están en marcha y describió trabajo de liberación para las próximas semanas, sin dar una fecha de lanzamiento.

La distinción importa porque las gateways de modelo unificadas ya son una capa de infraestructura disputada. Vercel AI Gateway ofrece una API, créditos prepagados, observabilidad y fallback a proveedores, mientras que su enrutamiento por defecto puede seleccionar proveedores usando la disponibilidad y latencia recientes. Amazon Bedrock ofrece enrutamiento inteligente de prompts entre modelos compatibles de la misma familia.

La ventaja de Cloudflare reposa en poseer ambos lados de la solicitud: la gateway que controla el tráfico y la red de GPUs que puede atender parte de él. La facturación unificada le da a Cloudflare una relación comercial con los desarrolladores incluso cuando la inferencia se ejecuta en otro lugar. El enrutamiento centrado en el modelo podría profundizar esa posición al permitir que Cloudflare decida qué proveedor recibe cada solicitud. La capa de facturación está disponible ahora; el sistema de enrutamiento que haría que el plano de control sea estratégicamente más difícil de reemplazar aún está en construcción.

Reader comments

Conversation for this story loads after sign-in.