A Cerebras (EUA) opera uma nuvem de inferência sobre hardware próprio, o wafer-scale engine. A plataforma serve modelos de texto por API compatível com o formato OpenAI, com foco em baixa latência para cargas interativas e agentes. Há camada gratuita, plano por token e oferta enterprise com pesos personalizados.
Para que serve
- Chamar modelos de texto por API compatível com OpenAI
- Rodar cargas interativas e agentes que dependem de baixa latência
- Testar modelos com créditos gratuitos
- Contratar capacidade dedicada para volumes maiores
Como funciona
- O usuário cria uma conta e obtém uma chave de API
- A chamada segue o formato de chat completions do mercado
- A inferência roda em hardware próprio da empresa, não em GPUs de terceiros
- Planos enterprise incluem pesos personalizados e prioridade de fila
Modelos e infraestrutura
- Camada pública com gpt-oss-120b e qwen-3.8-27b, ambos abertos
- Modelos adicionais e pesos próprios em endpoints dedicados
- Hardware wafer-scale, com foco declarado em latência
- Camada gratuita, plano por token e oferta enterprise
Preços públicos
- Teste gratuito com crédito inicial, conforme as regras da conta
- gpt-oss-120b a US$ 0,35 por milhão de tokens de entrada e US$ 0,75 de saída
- qwen-3.8-27b a US$ 0,99 por milhão de entrada e US$ 1,49 de saída
- Enterprise com capacidade dedicada, pesos próprios e suporte
Pontos fortes
- Infraestrutura própria, com foco em baixa latência
- API compatível com o formato OpenAI
- Camada gratuita para testes
Pontos de atenção
- O catálogo é menor que o de plataformas generalistas
- Pesos personalizados ficam na oferta enterprise
- A disponibilidade depende da capacidade da empresa

