A DeepInfra (EUA) é uma plataforma de inferência que serve modelos abertos por API. Oferece endpoints para texto, embeddings, reranking, imagem, vídeo e áudio, além de implantação de modelos privados e aluguel de instâncias de GPU. O foco é preço por token e compatibilidade com o formato OpenAI.
Para que serve
- Chamar modelos abertos por API compatível com o formato OpenAI
- Rodar embeddings, reranking, geração de imagem, vídeo e voz
- Implantar modelos privados com pesos próprios ou adaptadores LoRA
- Alugar instâncias de GPU para cargas dedicadas
Como funciona
- O usuário escolhe o modelo e recebe um endpoint HTTP
- A cobrança é por token processado, sem contrato mínimo
- Modelos privados ficam em endpoints exclusivos do cliente
- Adaptadores LoRA permitem ajustes sem duplicar o modelo base
Modelos e infraestrutura
- Mais de 200 modelos abertos de texto, visão, imagem, vídeo e áudio
- Implantação de modelos privados e adaptadores LoRA
- Instâncias de GPU e ambientes isolados para execução
- API compatível com SDKs do ecossistema OpenAI
Preços públicos
- Preço por token, publicado por modelo, sem taxa de plataforma
- Cobrança por imagem, segundo de áudio ou segundo de vídeo
- Instâncias de GPU cobradas por hora de uso
- Programa de créditos para startups qualificadas, sem camada gratuita permanente
Pontos fortes
- Catálogo amplo de modelos abertos com preço por token
- Aceita modelos privados e adaptadores
- Integra-se a ferramentas que usam o formato OpenAI
Pontos de atenção
- Modelos proprietários de fronteira não fazem parte da proposta
- Qualidade e latência variam por modelo e por região
- Cargas muito específicas podem exigir GPU dedicada

