A Nvidia lançou o Nemotron 3.5 Lightning, modelo de linguagem de pesos abertos que atinge quase 670 tokens por segundo, maior throughput medido entre os modelos comparados, e marca 24 pontos no Intelligence Index, segundo a plataforma independente Artificial Analysis. O desempenho é o mesmo do OpenAI gpt-oss-120b.

O modelo é o primeiro da linha Nemotron 3.5 e sucede o Nemotron 3 Nano 30B A3B, mantendo a arquitetura híbrida Mamba-Transformer. São 31,6 bilhões de parâmetros totais, com 3,6 bilhões ativados por etapa.

Desempenho

De acordo com a Artificial Analysis, o desempenho no Intelligence Index subiu nove pontos em relação ao antecessor, que tinha 15. Com 24 pontos, o Lightning empata com o gpt-oss-120b e fica atrás do Nemotron 3 Super (26), modelo cerca de quatro vezes maior. Entre os concorrentes de tamanho semelhante, Qwen3.6 35B A3B (32) e Meta Muse Glimmer (35) lideram.

Na velocidade, o Lightning conclui uma tarefa do índice em cerca de 0,5 minuto, enquanto Qwen3.6 35B A3B leva 3,5 minutos e Gemma 4 31B, 5,8 minutos. O throughput de quase 670 tokens por segundo é quase o dobro do Gemini 3.5 Flash-Lite, da Google, que registra 386 tokens por segundo. Modelos proprietários ainda dominam a fronteira de eficiência: o Gemini 3.5 Flash-Lite marca 37 pontos com tempo similar, e o GPT-5.6 Luna (max) chega a 52 pontos em menos de dois minutos.

Benchmarks agentivos

Os maiores ganhos aparecem em benchmarks agentivos. No GDPval-AA v2, o Lightning atingiu Elo 824, 334 pontos acima do Nemotron 3 Nano, superando gpt-oss-120b (800) e Nemotron 3 Super (698). No Terminal-Bench v2.1, o desempenho subiu de 7% para 24,3%, próximo dos 26,2% do gpt-oss-120b.

Disponibilidade

O modelo é distribuído sob a licença permissiva OpenMDW-1.1, com pesos nas versões BF16 e NVFP4. A versão NVFP4 também marca 24 pontos no Intelligence Index, com perda mínima de qualidade, segundo a Artificial Analysis. O Lightning processa apenas texto e tem contexto de 1 milhão de tokens. Os pesos já estão disponíveis; a inferência serverless é oferecida por DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius e Crusoe.

A Nvidia trabalhou com CodeRabbit e Harvey no pós-treinamento para melhorar o desempenho em domínios específicos.

A aposta em eficiência em vez de tamanho não é nova. Em artigo divulgado no ano passado, pesquisadores da Nvidia argumentaram que modelos com menos de 10 bilhões de parâmetros podem lidar com a maioria das tarefas de agentes tão bem quanto modelos de 70 a 175 bilhões, com custo dez a trinta vezes menor. O Lightning, com 31,6 bilhões de parâmetros totais e 3,6 bilhões ativos, se posiciona nessa classe leve.

Continue no Radar