O Cloudflare Workers AI executa modelos abertos em GPUs distribuídas pela rede da Cloudflare e entrega o resultado por chamada de API ou por binding dentro de um Worker. Não há provisionamento de GPU: o uso é medido em Neurons, a unidade de cobrança da plataforma, e o catálogo inclui modelos de texto, imagem, áudio e embeddings.
Para que serve
- Executar inferência perto do usuário, na mesma rede que já serve o site ou a aplicação
- Chamar modelos por REST ou por binding, sem servidor intermediário
- Aplicar ajuste fino por LoRA e processar lotes em modelos selecionados
Como funciona
- A conta da Cloudflare habilita a API e o binding de Workers AI no mesmo painel
- O catálogo é hospedado e operado pela Cloudflare, com modelos abertos de vários fornecedores
- O consumo é medido em Neurons, com franquia diária e cobrança por unidade no plano pago
- Recursos como lote assíncrono e adaptadores estão em estágios diferentes de maturidade
Pontos fortes
- Sem aluguel de GPU nem fila de provisionamento
- Cobrança por uso, com franquia diária incluída nos planos
- Integração direta com Workers, Pages e o restante da plataforma de borda
Pontos de atenção
- O catálogo muda com frequência e tem descontinuações programadas de modelos
- É diferente do Cloudflare AI Gateway, que apenas roteia para provedores externos
- Modelos de fronteira exigem meio de pagamento ativo mesmo fora do consumo incluído

