Perfil da ferramenta

Baseten

PorBasetenUS

Serving de modelos em produção: implante modelos próprios ou ajustados e receba endpoints de inferência com escalonamento de GPU.

Marca Baseten em branco sobre fundo escuro com gradiente suave, composição centralizada e minimalista
País
US
Disponibilidade
Proprietário

O Baseten (EUA) é uma plataforma de serving de modelos para produção. O usuário implanta modelos próprios ou checkpoints ajustados e recebe endpoints de inferência com escalonamento automático de GPU. A plataforma cuida do empacotamento, do runtime e da capacidade, permitindo publicar modelos sem montar a infraestrutura por conta própria.

Para que serve

  • Implantar modelos próprios e checkpoints ajustados em produção
  • Servir inferência por API com escalonamento de GPU
  • Rodar modelos abertos publicados na biblioteca
  • Encadear etapas de inferência em fluxos de trabalho

Como funciona

  • O modelo é empacotado com o runtime e as dependências
  • A plataforma publica um endpoint e ajusta as réplicas conforme a carga
  • Implantações dedicadas isolam capacidade para cargas previsíveis
  • Modelos podem ser ajustados e versionados dentro do ambiente

Modelos e infraestrutura

  • Modelos abertos da biblioteca e modelos próprios do cliente
  • GPUs dedicadas, com opção de implantação exclusiva
  • Cobrança por minuto de GPU e por token nos modelos de API
  • Ambientes separados para desenvolvimento e produção

Preços públicos

  • Cobrança por minuto de GPU em implantações dedicadas
  • Exemplos públicos: L4 a US$ 0,01414/min, H100 a US$ 0,10833/min e B200 a US$ 0,16633/min
  • Modelos de API cobrados por token, com preço publicado por modelo
  • Plano de startup com preço por uso e sem taxa de plataforma

Pontos fortes

  • Foco em produção, com escalonamento e implantações dedicadas
  • Aceita modelos próprios, não apenas catálogo pronto
  • Fluxo de implantação reproduzível

Pontos de atenção

  • Requer conhecimento de empacotamento e runtime do modelo
  • Custos dependem do tipo e do tempo de GPU
  • Recursos variam conforme o plano contratado