O Nebius (Países Baixos) opera o Token Factory, serviço de inferência para modelos abertos dentro da Nebius AI Cloud. O acesso é feito por API compatível com OpenAI, com endpoints públicos serverless e endpoints dedicados para quem precisa de região fixa e capacidade reservada.
Para que serve
- Executar inferência de modelos abertos por API gerenciada
- Criar endpoints dedicados com GPU reservada para cargas previsíveis
- Ajustar modelos com fine-tuning e publicar pesos próprios
- Acompanhar uso, latência e consumo por projeto
Como funciona
- A conta é criada no console da Nebius e gera uma chave de API
- O cliente aponta para a URL base do Token Factory e escolhe o modelo
- Endpoints públicos rodam em infraestrutura compartilhada e exibem região global
- Endpoints dedicados reservam GPU e mantêm a região escolhida
- O consumo é medido por tokens nos endpoints públicos e por tempo de GPU nos dedicados
Modelos e infraestrutura
- Catálogo de modelos abertos de texto e de imagem
- GPUs NVIDIA de gerações recentes na infraestrutura da própria Nebius
- Fine-tuning supervisionado, merge de adaptadores LoRA e sandboxes de execução
- Observabilidade integrada por API
Pontos fortes
- Combina serverless e endpoint dedicado no mesmo serviço
- Empresa europeia, com região e residência de dados sob controle do cliente nos endpoints dedicados
- API compatível com OpenAI simplifica a integração
Pontos de atenção
- Os endpoints públicos não garantem região fixa de processamento
- A Nebius também vende GPU em nuvem; esta ficha cobre o serviço de inferência, não a nuvem de GPU
- Pós-treinamento e endpoints dedicados dependem de configuração e cobrança próprias
