Baseten (EE. UU.) es una plataforma de serving de modelos para producción. El usuario despliega modelos propios o checkpoints ajustados y recibe endpoints de inferencia con escalado automático de GPU. La plataforma se encarga del empaquetado, el runtime y la capacidad, lo que permite publicar modelos sin montar la infraestructura por cuenta propia.
Para qué sirve
- Desplegar modelos propios y checkpoints ajustados en producción
- Servir inferencia por API con escalado de GPU
- Ejecutar modelos abiertos publicados en la biblioteca
- Encadenar etapas de inferencia en flujos de trabajo
Cómo funciona
- El modelo se empaqueta con el runtime y las dependencias
- La plataforma publica un endpoint y ajusta las réplicas según la carga
- Los despliegues dedicados aíslan capacidad para cargas previsibles
- Los modelos se pueden ajustar y versionar dentro del entorno
Modelos e infraestructura
- Modelos abiertos de la biblioteca y modelos propios del cliente
- GPUs dedicadas, con opción de despliegue exclusivo
- Cobro por minuto de GPU y por token en los modelos de API
- Entornos separados para desarrollo y producción
Precios públicos
- Cobro por minuto de GPU en despliegues dedicados
- Ejemplos públicos: L4 a US$ 0,01414/min, H100 a US$ 0,10833/min y B200 a US$ 0,16633/min
- Modelos de API cobrados por token, con precio publicado por modelo
- Plan de startup con precio por uso y sin cuota de plataforma
Puntos fuertes
- Enfoque en producción, con escalado y despliegues dedicados
- Acepta modelos propios, no solo catálogo listo
- Flujo de despliegue reproducible
Puntos de atención
- Requiere conocimiento de empaquetado y runtime del modelo
- Los costos dependen del tipo y del tiempo de GPU
- Las funciones varían según el plan contratado

