El harness correcto lo es todo: la prueba que reordenó el ranking de modelos abiertos
▶ Ver en YouTubeSentdex descubrió que el software de inferencia cambia el marcador de los modelos locales más que el propio modelo: 20 puntos de diferencia solo cambiando el harness.
Destacados
- Sentdex descubrió que el software de inferencia cambia la puntuación de los modelos locales más que el propio modelo: 20 puntos de diferencia solo cambiando el harness
- El mismo hardware y el mismo peso, pero puntuaciones diferentes: el harness OM reordenó el ranking del Terminal Bench
- El mejor modelo local sigue siendo el GLM-5.2 cuantizado, pero el DeepSeek V4 Flash gana en velocidad (130+ tokens/s)
- Hardware: la topología Gen 5 con switch de 100 lanes elimina el cuello de botella de banda en el rack de RTX Pro 6000
Lo que iba a ser un benchmark se convirtió en un experimento revelador: sentdex (Harrison Kinsley) descubrió que el software de inferencia — el harness — cambia la puntuación más que el propio modelo.

El experimento que expuso el peso del harness
Sentdex no lograba validar los números publicados por los proveedores. Cambió el stack de inferencia — de vLLM al harness OM — y los resultados subieron drásticamente.
Veinte tareas de diferencia — 20 puntos porcentuales — obtenidas solo cambiando el software que sirve el modelo. El mismo hardware, el mismo peso, puntuaciones diferentes.

El ranking: GLM-5.2 sigue al frente — por poco
En la puntuación final, el mejor modelo local hasta ahora es el GLM-5.2 cuantizado a 3,25 bits. El DeepSeek V4 Flash y el Laguna S 2.1 quedan cerca, pero el harness cambia quién lidera.
En velocidad, la historia se invierte: el GLM-5.2 decodifica a ~75 tokens por segundo, mientras que el V4 Flash supera los 130. Depende de lo que priorices.

Hardware: el cuello de botella invisible
La segunda mitad es una lección de infraestructura. Sentdex cuenta la saga para hacer que cuatro RTX Pro 6000 hablen entre sí sin cuello de botella de ancho de banda.
La topología final: máquina host → retimer → dos cables MCIO → switch Gen 5 de 100 lanes → GPUs. El switch elimina el cuello de botella que limitaba el rendimiento.

El costo de iterar más
Nada de esto es gratis. Con el OM, el tiempo por solución se duplica y el consumo de tokens se dispara. Ejecutar modelos locales de frontera exige hardware caro y paciencia.

Por qué seguirlo
El video es un retrato fiel de la carrera local de frontera: cuantizaciones cada vez más agresivas, harness que cambia puntuaciones y hardware que se vuelve el factor decisivo.
Para quien evalúa IA local, la lección es clara: el modelo es la mitad de la historia. El software que lo sirve puede valer 20 puntos de benchmark.