O CoreWeave (Estados Unidos) é uma nuvem de IA que passou a oferecer uma camada própria de serving de modelos, o CoreWeave Inference, disponível em três formatos: endpoints serverless cobrados por token, deployments dedicados com pesos próprios e inferência autogerenciada sobre o Kubernetes da plataforma.
Para que serve
- Chamar modelos por um endpoint compatível com a API da OpenAI, sem provisionar GPU
- Publicar modelos próprios ou ajustados em deployments dedicados, com vLLM ou SGLang
- Rodar inferência no mesmo ambiente em que o time já treina e ajusta modelos
Como funciona
- O modo serverless é acessado com uma chave do W&B Inference e cobrado por token consumido
- Deployments dedicados reservam capacidade de GPU e aceitam pesos próprios
- Quem quer controle total pode operar o serving dentro do Kubernetes gerenciado da CoreWeave
- A plataforma cuida de escalonamento, réplicas e endpoints compatíveis nos três formatos
Pontos fortes
- Treino e serving na mesma infraestrutura, sem transferir pesos entre nuvens
- Endpoints compatíveis com OpenAI reduzem o trabalho de integração
- Catálogo serverless com modelos abertos de vários fornecedores
Pontos de atenção
- A cobrança por token vale para o modo serverless; capacidade dedicada e instâncias seguem preço por GPU-hora
- O núcleo do negócio ainda é infraestrutura de GPU, então a ficha cobre a camada de serving
- Parte do catálogo e dos recursos corporativos passa por contato comercial

