Nebius (Países Bajos) opera Token Factory, servicio de inferencia para modelos abiertos dentro de Nebius AI Cloud. El acceso se hace por API compatible con OpenAI, con endpoints públicos serverless y endpoints dedicados para quien necesita región fija y capacidad reservada.
Para qué sirve
- Ejecutar inferencia de modelos abiertos por API gestionada
- Crear endpoints dedicados con GPU reservada para cargas previsibles
- Ajustar modelos con fine-tuning y publicar pesos propios
- Seguir uso, latencia y consumo por proyecto
Cómo funciona
- La cuenta se crea en el consola de Nebius y genera una clave de API
- El cliente apunta a la URL base de Token Factory y elige el modelo
- Los endpoints públicos corren en infraestructura compartida y muestran región global
- Los endpoints dedicados reservan GPU y mantienen la región elegida
- El consumo se mide por tokens en los endpoints públicos y por tiempo de GPU en los dedicados
Modelos e infraestructura
- Catálogo de modelos abiertos de texto y de imagen
- GPUs NVIDIA de generaciones recientes en la infraestructura de la propia Nebius
- Fine-tuning supervisado, merge de adaptadores LoRA y sandboxes de ejecución
- Observabilidad integrada por API
Puntos fuertes
- Combina serverless y endpoint dedicado en el mismo servicio
- Empresa europea, con región y residencia de datos bajo control del cliente en los endpoints dedicados
- API compatible con OpenAI simplifica la integración
Puntos de atención
- Los endpoints públicos no garantizan una región fija de procesamiento
- Nebius también vende GPU en la nube; esta ficha cubre el servicio de inferencia, no la nube de GPU
- El post-entrenamiento y los endpoints dedicados dependen de configuración y cobro propios
