Nvidia lanzó el Nemotron 3.5 Lightning, un modelo de lenguaje de pesos abiertos que alcanza casi 670 tokens por segundo, el mayor throughput medido entre los modelos comparados, y marca 24 puntos en el Intelligence Index, según la plataforma independiente Artificial Analysis. El rendimiento es el mismo que el de OpenAI gpt-oss-120b.

El modelo es el primero de la línea Nemotron 3.5 y sucede al Nemotron 3 Nano 30B A3B, manteniendo la arquitectura híbrida Mamba-Transformer. Tiene 31,6 mil millones de parámetros totales, con 3,6 mil millones activados por etapa.

Rendimiento

Según Artificial Analysis, el rendimiento en el Intelligence Index subió nueve puntos en comparación con su predecesor, que tenía 15. Con 24 puntos, el Lightning empata con el gpt-oss-120b y queda por detrás del Nemotron 3 Super (26), un modelo aproximadamente cuatro veces más grande. Entre los competidores de tamaño similar, Qwen3.6 35B A3B (32) y Meta Muse Glimmer (35) lideran.

En cuanto a velocidad, el Lightning completa una tarea del índice en aproximadamente 0,5 minutos, mientras que Qwen3.6 35B A3B tarda 3,5 minutos y Gemma 4 31B, 5,8 minutos. El throughput de casi 670 tokens por segundo es casi el doble que el del Gemini 3.5 Flash-Lite de Google, que registra 386 tokens por segundo. Los modelos propietarios aún dominan la frontera de eficiencia: el Gemini 3.5 Flash-Lite marca 37 puntos con un tiempo similar, y el GPT-5.6 Luna (max) alcanza 52 puntos en menos de dos minutos.

Benchmarks de agentes

Los mayores avances aparecen en benchmarks de agentes. En GDPval-AA v2, el Lightning alcanzó Elo 824, 334 puntos por encima del Nemotron 3 Nano, superando a gpt-oss-120b (800) y Nemotron 3 Super (698). En Terminal-Bench v2.1, el rendimiento subió de 7% a 24,3%, cerca del 26,2% de gpt-oss-120b.

Disponibilidad

El modelo se distribuye bajo la licencia permisiva OpenMDW-1.1, con pesos en las versiones BF16 y NVFP4. La versión NVFP4 también marca 24 puntos en el Intelligence Index, con una pérdida mínima de calidad, según Artificial Analysis. El Lightning procesa solo texto y tiene un contexto de 1 millón de tokens. Los pesos ya están disponibles; la inferencia serverless es ofrecida por DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius y Crusoe.

Nvidia trabajó con CodeRabbit y Harvey en el post-entrenamiento para mejorar el rendimiento en dominios específicos.

La apuesta por la eficiencia en lugar del tamaño no es nueva. En un artículo publicado el año pasado, investigadores de Nvidia argumentaron que los modelos con menos de 10 mil millones de parámetros pueden manejar la mayoría de las tareas de agentes tan bien como modelos de 70 a 175 mil millones, con un costo de diez a treinta veces menor. El Lightning, con 31,6 mil millones de parámetros totales y 3,6 mil millones activos, se posiciona en esa clase ligera.

Sigue en Radar