Perfil de herramienta

DeepInfra

PorDeepInfraUS

API de inferencia para modelos abiertos, con texto, embeddings, imagen, vídeo y audio, además de modelos privados e instancias de GPU.

Marca DeepInfra en blanco sobre fondo oscuro con degradado suave, composición centrada y minimalista
País
US
Disponibilidad
Propietario

DeepInfra (EE. UU.) es una plataforma de inferencia que sirve modelos abiertos por API. Ofrece endpoints para texto, embeddings, reranking, imagen, vídeo y audio, además de despliegue de modelos privados y alquiler de instancias de GPU. El enfoque es el precio por token y la compatibilidad con el formato OpenAI.

Para qué sirve

  • Llamar modelos abiertos por API compatible con el formato OpenAI
  • Ejecutar embeddings, reranking, generación de imagen, vídeo y voz
  • Desplegar modelos privados con pesos propios o adaptadores LoRA
  • Alquilar instancias de GPU para cargas dedicadas

Cómo funciona

  • El usuario elige el modelo y recibe un endpoint HTTP
  • El cobro es por token procesado, sin contrato mínimo
  • Los modelos privados quedan en endpoints exclusivos del cliente
  • Los adaptadores LoRA permiten ajustes sin duplicar el modelo base

Modelos e infraestructura

  • Más de 200 modelos abiertos de texto, visión, imagen, vídeo y audio
  • Despliegue de modelos privados y adaptadores LoRA
  • Instancias de GPU y entornos aislados para ejecución
  • API compatible con SDKs del ecosistema OpenAI

Precios públicos

  • Precio por token, publicado por modelo, sin cuota de plataforma
  • Cobro por imagen, segundo de audio o segundo de vídeo
  • Instancias de GPU cobradas por hora de uso
  • Programa de créditos para startups calificadas, sin capa gratuita permanente

Puntos fuertes

  • Catálogo amplio de modelos abiertos con precio por token
  • Acepta modelos privados y adaptadores
  • Se integra con herramientas que usan el formato OpenAI

Puntos de atención

  • Los modelos propietarios de frontera no forman parte de la propuesta
  • La calidad y la latencia varían por modelo y por región
  • Cargas muy específicas pueden exigir GPU dedicada