Modal (EE. UU.) es una plataforma de cómputo serverless orientada a cargas de IA. El desarrollador define funciones en Python, adjunta CPU, memoria y GPU, y la plataforma ejecuta el código bajo demanda, exponiendo endpoints HTTP para las aplicaciones. El objetivo es servir modelos y tareas de inferencia sin mantener servidores encendidos.
Para qué sirve
- Ejecutar funciones Python con GPU bajo demanda
- Servir modelos de IA por endpoints HTTP
- Ejecutar jobs de procesamiento por lotes y tareas programadas
- Escalar la inferencia según el volumen de peticiones
Cómo funciona
- El código se empaqueta con las dependencias declaradas
- Cada función recibe CPU, memoria y GPU definidas en el propio código
- Los endpoints compartidos cobran por token; los dedicados cobran por la computación
- La plataforma levanta y apaga contenedores según la demanda
- Endpoints, colas y volúmenes persistentes forman parte del runtime
Modelos e infraestructura
- Ejecuta modelos abiertos y modelos propios aportados por el usuario
- GPUs NVIDIA B300, B200, H200, H100, A100, RTX PRO 6000 y L40S
- Cobro por segundo de CPU, memoria y GPU utilizados
- Cómputo mensual incluido en los planes Starter y Team
Precios públicos
- Plan Starter sin cuota mensual, con US$ 30/mes de cómputo incluido
- Plan Team desde US$ 250/mes, con US$ 100/mes de cómputo incluido
- Cobro por segundo; H100 SXM5 alrededor de US$ 0,001097 por segundo
- Enterprise con descuentos por volumen, SSO, auditoría y HIPAA
Puntos fuertes
- No cobra por recursos inactivos: se paga el tiempo de ejecución
- Flujo en Python sin configurar servidores ni Kubernetes
- Escalado automático para picos de tráfico
Puntos de atención
- Exige escribir código en la plataforma o adaptar la aplicación
- Los precios varían por región y por ejecución no preemptible
- Las funciones de seguridad corporativa quedan en el plan Enterprise
