Perfil da ferramenta

CoreWeave

PorCoreWeaveUS

Nuvem de IA com serving gerenciado: endpoints serverless por token, deployments dedicados com pesos próprios e inferência sobre Kubernetes gerenciado.

Marca CoreWeave em branco sobre fundo escuro com gradiente suave, composição centralizada e minimalista
País
US
Disponibilidade
Proprietário

O CoreWeave (Estados Unidos) é uma nuvem de IA que passou a oferecer uma camada própria de serving de modelos, o CoreWeave Inference, disponível em três formatos: endpoints serverless cobrados por token, deployments dedicados com pesos próprios e inferência autogerenciada sobre o Kubernetes da plataforma.

Para que serve

  • Chamar modelos por um endpoint compatível com a API da OpenAI, sem provisionar GPU
  • Publicar modelos próprios ou ajustados em deployments dedicados, com vLLM ou SGLang
  • Rodar inferência no mesmo ambiente em que o time já treina e ajusta modelos

Como funciona

  • O modo serverless é acessado com uma chave do W&B Inference e cobrado por token consumido
  • Deployments dedicados reservam capacidade de GPU e aceitam pesos próprios
  • Quem quer controle total pode operar o serving dentro do Kubernetes gerenciado da CoreWeave
  • A plataforma cuida de escalonamento, réplicas e endpoints compatíveis nos três formatos

Pontos fortes

  • Treino e serving na mesma infraestrutura, sem transferir pesos entre nuvens
  • Endpoints compatíveis com OpenAI reduzem o trabalho de integração
  • Catálogo serverless com modelos abertos de vários fornecedores

Pontos de atenção

  • A cobrança por token vale para o modo serverless; capacidade dedicada e instâncias seguem preço por GPU-hora
  • O núcleo do negócio ainda é infraestrutura de GPU, então a ficha cobre a camada de serving
  • Parte do catálogo e dos recursos corporativos passa por contato comercial