Cerebras (EE. UU.) opera una nube de inferencia sobre hardware propio, el wafer-scale engine. La plataforma sirve modelos de texto por API compatible con el formato OpenAI, con foco en baja latencia para cargas interactivas y agentes. Hay capa gratuita, plan por token y oferta enterprise con pesos personalizados.
Para qué sirve
- Llamar modelos de texto por API compatible con OpenAI
- Ejecutar cargas interactivas y agentes que dependen de baja latencia
- Probar modelos con créditos gratuitos
- Contratar capacidad dedicada para volúmenes mayores
Cómo funciona
- El usuario crea una cuenta y obtiene una clave de API
- La llamada sigue el formato de chat completions del mercado
- La inferencia corre en hardware propio de la empresa, no en GPUs de terceros
- Los planes enterprise incluyen pesos personalizados y prioridad de cola
Modelos e infraestructura
- Capa pública con gpt-oss-120b y qwen-3.8-27b, ambos abiertos
- Modelos adicionales y pesos propios en endpoints dedicados
- Hardware wafer-scale, con foco declarado en latencia
- Capa gratuita, plan por token y oferta enterprise
Precios públicos
- Prueba gratuita con crédito inicial, según las reglas de la cuenta
- gpt-oss-120b a US$ 0,35 por millón de tokens de entrada y US$ 0,75 de salida
- qwen-3.8-27b a US$ 0,99 por millón de entrada y US$ 1,49 de salida
- Enterprise con capacidad dedicada, pesos propios y soporte
Puntos fuertes
- Infraestructura propia, con foco en baja latencia
- API compatible con el formato OpenAI
- Capa gratuita para pruebas
Puntos de atención
- El catálogo es menor que el de plataformas generalistas
- Los pesos personalizados quedan en la oferta enterprise
- La disponibilidad depende de la capacidad de la empresa

