DeepInfra (EE. UU.) es una plataforma de inferencia que sirve modelos abiertos por API. Ofrece endpoints para texto, embeddings, reranking, imagen, vídeo y audio, además de despliegue de modelos privados y alquiler de instancias de GPU. El enfoque es el precio por token y la compatibilidad con el formato OpenAI.
Para qué sirve
- Llamar modelos abiertos por API compatible con el formato OpenAI
- Ejecutar embeddings, reranking, generación de imagen, vídeo y voz
- Desplegar modelos privados con pesos propios o adaptadores LoRA
- Alquilar instancias de GPU para cargas dedicadas
Cómo funciona
- El usuario elige el modelo y recibe un endpoint HTTP
- El cobro es por token procesado, sin contrato mínimo
- Los modelos privados quedan en endpoints exclusivos del cliente
- Los adaptadores LoRA permiten ajustes sin duplicar el modelo base
Modelos e infraestructura
- Más de 200 modelos abiertos de texto, visión, imagen, vídeo y audio
- Despliegue de modelos privados y adaptadores LoRA
- Instancias de GPU y entornos aislados para ejecución
- API compatible con SDKs del ecosistema OpenAI
Precios públicos
- Precio por token, publicado por modelo, sin cuota de plataforma
- Cobro por imagen, segundo de audio o segundo de vídeo
- Instancias de GPU cobradas por hora de uso
- Programa de créditos para startups calificadas, sin capa gratuita permanente
Puntos fuertes
- Catálogo amplio de modelos abiertos con precio por token
- Acepta modelos privados y adaptadores
- Se integra con herramientas que usan el formato OpenAI
Puntos de atención
- Los modelos propietarios de frontera no forman parte de la propuesta
- La calidad y la latencia varían por modelo y por región
- Cargas muy específicas pueden exigir GPU dedicada

