A Nvidia colocou em produção o Groq 3 LPX, acelerador dedicado à inferência de inteligência artificial, após o sistema alcançar 3.400 tokens por segundo em um teste independente. A companhia anunciou a nova etapa do hardware na segunda-feira (24), durante a Hot Chips 2026.

O Groq 3 LPX integra a plataforma Vera Rubin e foi desenvolvido para acelerar a geração de tokens em aplicações de IA agêntica, nas quais modelos executam várias etapas de raciocínio, usam ferramentas e processam grandes volumes de contexto.

No benchmark conduzido pela Artificial Analysis, o sistema rodou o modelo aberto Gemma 4 31B com uma janela de contexto de 100 mil tokens e atingiu 3.400 tokens por segundo. Segundo a Nvidia, foi o desempenho mais rápido já registrado para esse modelo.

A empresa afirma que o resultado representa uma capacidade de resposta quatro vezes maior que a plataforma concorrente mais próxima. Dados analisados pelo The Register apontam a Cerebras como essa rival, com cerca de 882 tokens por segundo no mesmo cenário.

Comparação depende da quantidade de chips

A diferença de desempenho não representa, porém, uma comparação direta entre quantidades equivalentes de hardware. Cada Groq 3 LPU possui 500 MB de memória SRAM, o que exige distribuir modelos maiores entre vários aceleradores.

O The Register calculou que o Gemma 4 31B, executado em FP8, precisa de pelo menos 64 LPUs para armazenar seus parâmetros. Já o mesmo modelo poderia ser acomodado em um ou dois aceleradores CS-3 da Cerebras. A Nvidia não detalhou como os chips foram distribuídos durante o benchmark.

A arquitetura também pode enfrentar desafios maiores com modelos do tipo mixture of experts (MoE), que distribuem o processamento entre diferentes grupos de parâmetros. Segundo a análise, um modelo como o DeepSeek V3 poderia exigir 1.342 aceleradores Groq 3, equivalentes a pouco mais de cinco racks.

A comparação da Nvidia também considera a geração atual da Cerebras usada nos testes e não o CS-4, apresentado recentemente pela concorrente com aumentos de capacidade de computação, largura de banda e interconexão.

A estratégia da Nvidia é combinar GPUs e LPUs em diferentes etapas da inferência. As GPUs ficam responsáveis pelo processamento inicial dos prompts, enquanto os Groq 3 LPX concentram a fase de geração de tokens, mais dependente de largura de banda de memória.

A Nebius será a primeira provedora de nuvem a adotar o Groq 3 LPX, com planos de disponibilizá-lo por meio da plataforma Token Factory. A Groq também está entre as primeiras empresas previstas para usar a tecnologia.

Continue no Radar