O Baseten (EUA) é uma plataforma de serving de modelos para produção. O usuário implanta modelos próprios ou checkpoints ajustados e recebe endpoints de inferência com escalonamento automático de GPU. A plataforma cuida do empacotamento, do runtime e da capacidade, permitindo publicar modelos sem montar a infraestrutura por conta própria.
Para que serve
- Implantar modelos próprios e checkpoints ajustados em produção
- Servir inferência por API com escalonamento de GPU
- Rodar modelos abertos publicados na biblioteca
- Encadear etapas de inferência em fluxos de trabalho
Como funciona
- O modelo é empacotado com o runtime e as dependências
- A plataforma publica um endpoint e ajusta as réplicas conforme a carga
- Implantações dedicadas isolam capacidade para cargas previsíveis
- Modelos podem ser ajustados e versionados dentro do ambiente
Modelos e infraestrutura
- Modelos abertos da biblioteca e modelos próprios do cliente
- GPUs dedicadas, com opção de implantação exclusiva
- Cobrança por minuto de GPU e por token nos modelos de API
- Ambientes separados para desenvolvimento e produção
Preços públicos
- Cobrança por minuto de GPU em implantações dedicadas
- Exemplos públicos: L4 a US$ 0,01414/min, H100 a US$ 0,10833/min e B200 a US$ 0,16633/min
- Modelos de API cobrados por token, com preço publicado por modelo
- Plano de startup com preço por uso e sem taxa de plataforma
Pontos fortes
- Foco em produção, com escalonamento e implantações dedicadas
- Aceita modelos próprios, não apenas catálogo pronto
- Fluxo de implantação reproduzível
Pontos de atenção
- Requer conhecimento de empacotamento e runtime do modelo
- Custos dependem do tipo e do tempo de GPU
- Recursos variam conforme o plano contratado

