Perfil de herramienta

Baseten

PorBasetenUS

Serving de modelos en producción: despliega modelos propios o ajustados y recibe endpoints de inferencia con escalado de GPU.

Marca Baseten en blanco sobre fondo oscuro con degradado suave, composición centrada y minimalista
País
US
Disponibilidad
Propietario

Baseten (EE. UU.) es una plataforma de serving de modelos para producción. El usuario despliega modelos propios o checkpoints ajustados y recibe endpoints de inferencia con escalado automático de GPU. La plataforma se encarga del empaquetado, el runtime y la capacidad, lo que permite publicar modelos sin montar la infraestructura por cuenta propia.

Para qué sirve

  • Desplegar modelos propios y checkpoints ajustados en producción
  • Servir inferencia por API con escalado de GPU
  • Ejecutar modelos abiertos publicados en la biblioteca
  • Encadenar etapas de inferencia en flujos de trabajo

Cómo funciona

  • El modelo se empaqueta con el runtime y las dependencias
  • La plataforma publica un endpoint y ajusta las réplicas según la carga
  • Los despliegues dedicados aíslan capacidad para cargas previsibles
  • Los modelos se pueden ajustar y versionar dentro del entorno

Modelos e infraestructura

  • Modelos abiertos de la biblioteca y modelos propios del cliente
  • GPUs dedicadas, con opción de despliegue exclusivo
  • Cobro por minuto de GPU y por token en los modelos de API
  • Entornos separados para desarrollo y producción

Precios públicos

  • Cobro por minuto de GPU en despliegues dedicados
  • Ejemplos públicos: L4 a US$ 0,01414/min, H100 a US$ 0,10833/min y B200 a US$ 0,16633/min
  • Modelos de API cobrados por token, con precio publicado por modelo
  • Plan de startup con precio por uso y sin cuota de plataforma

Puntos fuertes

  • Enfoque en producción, con escalado y despliegues dedicados
  • Acepta modelos propios, no solo catálogo listo
  • Flujo de despliegue reproducible

Puntos de atención

  • Requiere conocimiento de empaquetado y runtime del modelo
  • Los costos dependen del tipo y del tiempo de GPU
  • Las funciones varían según el plan contratado