Cloudflare Workers AI ejecuta modelos abiertos en GPUs distribuidas por la red de Cloudflare y entrega el resultado por llamada de API o por binding dentro de un Worker. No hay aprovisionamiento de GPU: el uso se mide en Neurons, la unidad de cobro de la plataforma, y el catálogo incluye modelos de texto, imagen, audio y embeddings.
Para qué sirve
- Ejecutar inferencia cerca del usuario, en la misma red que ya sirve el sitio o la aplicación
- Llamar modelos por REST o por binding, sin servidor intermedio
- Aplicar ajuste fino por LoRA y procesar lotes en modelos seleccionados
Cómo funciona
- La cuenta de Cloudflare habilita la API y el binding de Workers AI en el mismo panel
- El catálogo lo aloja y opera Cloudflare, con modelos abiertos de varios proveedores
- El consumo se mide en Neurons, con franquicia diaria y cobro por unidad en el plan de pago
- Funciones como el lote asíncrono y los adaptadores están en etapas distintas de madurez
Puntos fuertes
- Sin alquiler de GPU ni cola de aprovisionamiento
- Cobro por uso, con franquicia diaria incluida en los planes
- Integración directa con Workers, Pages y el resto de la plataforma de borde
Puntos de atención
- El catálogo cambia con frecuencia y tiene descontinuaciones programadas de modelos
- Es distinto de Cloudflare AI Gateway, que solo enruta hacia proveedores externos
- Los modelos de frontera exigen un medio de pago activo incluso fuera del consumo incluido

