O Modal (EUA) é uma plataforma de computação serverless voltada a cargas de IA. O desenvolvedor define funções em Python, anexa CPU, memória e GPU, e a plataforma executa o código sob demanda, expondo endpoints HTTP para as aplicações. O foco é servir modelos e tarefas de inferência sem manter servidores ligados.
Para que serve
- Executar funções Python com GPU sob demanda
- Servir modelos de IA por endpoints HTTP
- Rodar jobs de processamento em lote e tarefas agendadas
- Escalar inferência conforme o volume de requisições
Como funciona
- O código é empacotado com as dependências declaradas
- Cada função recebe CPU, memória e GPU definidas no próprio código
- Endpoints compartilhados cobram por token; endpoints dedicados cobram pela computação
- A plataforma sobe e desce contêineres conforme a demanda
- Endpoints, filas e volumes persistentes fazem parte do runtime
Modelos e infraestrutura
- Executa modelos abertos e modelos próprios trazidos pelo usuário
- GPUs NVIDIA B300, B200, H200, H100, A100, RTX PRO 6000 e L40S
- Cobrança por segundo de CPU, memória e GPU usados
- Computação mensal incluída nos planos Starter e Team
Preços públicos
- Plano Starter sem mensalidade, com US$ 30/mês de computação incluída
- Plano Team a partir de US$ 250/mês, com US$ 100/mês de computação incluída
- Cobrança por segundo; H100 SXM5 em torno de US$ 0,001097 por segundo
- Enterprise com descontos por volume, SSO, auditoria e HIPAA
Pontos fortes
- Não cobra por recurso ocioso: paga-se o tempo de execução
- Fluxo em Python sem configurar servidores ou Kubernetes
- Escala automática para picos de tráfego
Pontos de atenção
- Exige escrever código na plataforma ou adaptar a aplicação
- Preços variam por região e por execução não preemptível
- Recursos de segurança corporativa ficam no plano Enterprise
