La webAI lanzó el 30 de septiembre el TwIL-LM3-Pro, un modelo de lenguaje con 3,66 mil millones de parámetros especializado en razonamiento formal. En las pruebas publicadas por la desarrolladora, el sistema alcanzó un rendimiento equivalente al Qwen3 8B en su principal métrica de lógica, a pesar de tener menos de la mitad de los parámetros.

En la métrica agregada de lógica formal usada por webAI, el TwIL-LM3-Pro marcó 0,5539, frente a 0,5336 de Qwen3 8B. La diferencia, sin embargo, quedó dentro del ruido muestral de las pruebas, y la propia empresa afirma que el resultado debe interpretarse como paridad, no como una victoria sobre el modelo más grande.

El avance es más claro en la comparación con IBM Granite 4.2 3B, modelo que sirvió como base para el desarrollo. La puntuación pasó de 0,4313 a 0,5539, una mejora relativa de alrededor de 28%. El TwIL-LM3-Pro también quedó por delante de la versión pública de VibeThinker-3B en las seis tareas de lógica formal comparadas por la empresa.

En benchmarks más amplios, el modelo alcanzó 95,4% en la parte de lógica de BIG-Bench Hard y 95% en SVAMP, orientado a problemas matemáticos escritos. En GSM8K, registró 94,3%, cercano a los 95,7% obtenidos por Qwen3 8B.

Los resultados, no obstante, no indican que el modelo más pequeño haya alcanzado a Qwen3 8B en capacidad general. En el promedio de diez benchmarks fuera de su dominio especializado, el TwIL-LM3-Pro marcó 0,7901, mientras que Qwen3 8B llegó a 0,8493. La ventaja competitiva aparece principalmente en las tareas de lógica para las que el modelo fue entrenado.

La versión de 2,09 GiB puede ejecutarse localmente

El TwIL-LM3-Pro fue desarrollado con una secuencia de post-entrenamiento que incluye ajuste supervisado, combinación de checkpoints, interpolación de pesos y aprendizaje por refuerzo. La especialización abarca tareas como inferencia lógica, traducción de lenguaje natural a lógica formal y análisis de demostraciones.

Además de los pesos completos en BF16, que ocupan 6,82 GiB, webAI puso a disposición versiones cuantizadas. El archivo Q4_K_M ocupa 2,09 GiB y, según la documentación, puede ejecutarse en CPU o con 4 GB de VRAM, reduciendo la necesidad de infraestructura en la nube para determinados usos.

Hay una salvedad importante: los benchmarks divulgados fueron ejecutados con los pesos en BF16. La webAI aún no ha medido cuánto afecta la cuantización a la precisión de la versión Q4, por lo que los resultados publicados no pueden atribuirse directamente al archivo más pequeño.

El modelo fue lanzado bajo la webAI Non-Commercial License v1.0, que restringe su uso comercial. Los pesos completos y las versiones GGUF están disponibles públicamente para ejecución local y pruebas.

Sigue en Radar