A webAI lançou em 30 de setembro o TwIL-LM3-Pro, modelo de linguagem com 3,66 bilhões de parâmetros especializado em raciocínio formal. Nos testes publicados pela desenvolvedora, o sistema alcançou desempenho equivalente ao Qwen3 8B em sua principal métrica de lógica, apesar de ter menos da metade dos parâmetros.
Na métrica agregada de lógica formal usada pela webAI, o TwIL-LM3-Pro marcou 0,5539, ante 0,5336 do Qwen3 8B. A diferença, porém, ficou dentro do ruído amostral dos testes, e a própria empresa afirma que o resultado deve ser interpretado como paridade, não como uma vitória sobre o modelo maior.
O avanço é mais claro na comparação com o IBM Granite 4.2 3B, modelo que serviu como base para o desenvolvimento. A pontuação passou de 0,4313 para 0,5539, uma melhora relativa de cerca de 28%. O TwIL-LM3-Pro também ficou à frente da versão pública do VibeThinker-3B nas seis tarefas de lógica formal comparadas pela empresa.
Em benchmarks mais amplos, o modelo alcançou 95,4% na parcela de lógica do BIG-Bench Hard e 95% no SVAMP, voltado a problemas matemáticos escritos. No GSM8K, registrou 94,3%, próximo dos 95,7% obtidos pelo Qwen3 8B.
Os resultados, no entanto, não indicam que o modelo menor tenha alcançado o Qwen3 8B em capacidade geral. Na média de dez benchmarks fora de seu domínio especializado, o TwIL-LM3-Pro marcou 0,7901, enquanto o Qwen3 8B chegou a 0,8493. A vantagem competitiva aparece principalmente nas tarefas de lógica para as quais o modelo foi treinado.
Versão de 2,09 GiB pode rodar localmente
O TwIL-LM3-Pro foi desenvolvido com uma sequência de pós-treinamento que inclui ajuste supervisionado, combinação de checkpoints, interpolação de pesos e aprendizado por reforço. A especialização abrange tarefas como inferência lógica, tradução de linguagem natural para lógica formal e análise de provas.
Além dos pesos completos em BF16, que ocupam 6,82 GiB, a webAI disponibilizou versões quantizadas. O arquivo Q4_K_M ocupa 2,09 GiB e, segundo a documentação, pode ser executado em CPU ou com 4 GB de VRAM, reduzindo a necessidade de infraestrutura de nuvem para determinados usos.
Há uma ressalva importante: os benchmarks divulgados foram executados com os pesos em BF16. A webAI ainda não mediu quanto a quantização afeta a precisão da versão Q4, portanto os resultados publicados não podem ser diretamente atribuídos ao arquivo menor.
O modelo foi lançado sob a webAI Non-Commercial License v1.0, que restringe seu uso comercial. Os pesos completos e as versões GGUF estão disponíveis publicamente para execução local e testes.



