La Nvidia colocó en producción el Groq 3 LPX, acelerador dedicado a la inferencia de inteligencia artificial, después de que el sistema alcanzara 3.400 tokens por segundo en una prueba independiente. anunció la nueva etapa del hardware el lunes (24), durante la Hot Chips 2026.
El Groq 3 LPX integra la plataforma Vera Rubin y fue desarrollado para acelerar la generación de tokens en aplicaciones de IA agéntica, en las cuales los modelos ejecutan varias etapas de razonamiento, usan herramientas y procesan grandes volúmenes de contexto.
En el benchmark realizado por Artificial Analysis, el sistema ejecutó el modelo abierto Gemma 4 31B con una ventana de contexto de 100 mil tokens y alcanzó 3.400 tokens por segundo. Según Nvidia, fue el rendimiento más rápido jamás registrado para ese modelo.
La empresa afirma que el resultado representa una capacidad de respuesta cuatro veces mayor que la plataforma competidora más cercana. Datos analizados por The Register señalan a Cerebras como esa rival, con cerca de 882 tokens por segundo en el mismo escenario.
La comparación depende de la cantidad de chips
La diferencia de rendimiento no representa, sin embargo, una comparación directa entre cantidades equivalentes de hardware. Cada Groq 3 LPU posee 500 MB de memoria SRAM, lo que exige distribuir modelos más grandes entre varios aceleradores.
The Register calculó que el Gemma 4 31B, ejecutado en FP8, necesita al menos 64 LPUs para almacenar sus parámetros. En cambio, el mismo modelo podría ser acomodado en uno o dos aceleradores CS-3 de Cerebras. Nvidia no detalló cómo se distribuyeron los chips durante el benchmark.
La arquitectura también puede enfrentar desafíos mayores con modelos del tipo mixture of experts (MoE), que distribuyen el procesamiento entre diferentes grupos de parámetros. Según el análisis, un modelo como DeepSeek V3 podría exigir 1.342 aceleradores Groq 3, equivalentes a poco más de cinco racks.
La comparación de Nvidia también considera la generación actual de Cerebras utilizada en las pruebas y no el CS-4, presentado recientemente por la competidora con aumentos de capacidad de cómputo, ancho de banda e interconexión.
La estrategia de Nvidia es combinar GPUs y LPUs en diferentes etapas de la inferencia. Las GPUs son responsables del procesamiento inicial de los prompts, mientras que los Groq 3 LPX concentran la fase de generación de tokens, más dependiente del ancho de banda de memoria.
La Nebius será el primer proveedor de nube en adoptar el Groq 3 LPX, con planes de ponerlo a disposición a través de la plataforma Token Factory. Groq también se encuentra entre las primeras empresas previstas para usar la tecnología.



