YouTubeEn las redes

El harness correcto lo es todo: la prueba que reordenó el ranking de modelos abiertos

El harness correcto lo es todo: la prueba que reordenó el ranking de modelos abiertos▶ Ver en YouTube

Sentdex descubrió que el software de inferencia cambia el marcador de los modelos locales más que el propio modelo: 20 puntos de diferencia solo cambiando el harness.

·Vídeo: ·Publicado: ·Actualizado:

Destacados

  • Sentdex descubrió que el software de inferencia cambia la puntuación de los modelos locales más que el propio modelo: 20 puntos de diferencia solo cambiando el harness
  • El mismo hardware y el mismo peso, pero puntuaciones diferentes: el harness OM reordenó el ranking del Terminal Bench
  • El mejor modelo local sigue siendo el GLM-5.2 cuantizado, pero el DeepSeek V4 Flash gana en velocidad (130+ tokens/s)
  • Hardware: la topología Gen 5 con switch de 100 lanes elimina el cuello de botella de banda en el rack de RTX Pro 6000

Lo que iba a ser un benchmark se convirtió en un experimento revelador: sentdex (Harrison Kinsley) descubrió que el software de inferencia — el harness — cambia la puntuación más que el propio modelo.

Setup de sentdex con múltiples GPUs y terminal de ejecución local
El rack con cuatro RTX Pro 6000 que ejecuta los modelos locales

El experimento que expuso el peso del harness

Sentdex no lograba validar los números publicados por los proveedores. Cambió el stack de inferencia — de vLLM al harness OM — y los resultados subieron drásticamente.

Veinte tareas de diferencia — 20 puntos porcentuales — obtenidas solo cambiando el software que sirve el modelo. El mismo hardware, el mismo peso, puntuaciones diferentes.

Anuncio del modelo Laguna S 2.1 de Poolside en X
Laguna S 2.1, de Poolside: 118B de parámetros con solo 8B activos

El ranking: GLM-5.2 sigue al frente — por poco

En la puntuación final, el mejor modelo local hasta ahora es el GLM-5.2 cuantizado a 3,25 bits. El DeepSeek V4 Flash y el Laguna S 2.1 quedan cerca, pero el harness cambia quién lidera.

En velocidad, la historia se invierte: el GLM-5.2 decodifica a ~75 tokens por segundo, mientras que el V4 Flash supera los 130. Depende de lo que priorices.

Gráfico de benchmark comparando costo normalizado entre configuraciones
Los números del Terminal Bench: el harness OM cambia la puntuación

Hardware: el cuello de botella invisible

La segunda mitad es una lección de infraestructura. Sentdex cuenta la saga para hacer que cuatro RTX Pro 6000 hablen entre sí sin cuello de botella de ancho de banda.

La topología final: máquina host → retimer → dos cables MCIO → switch Gen 5 de 100 lanes → GPUs. El switch elimina el cuello de botella que limitaba el rendimiento.

Vista física del rack de GPUs con switch PCIe y cableado MCIO
La topología Gen 5: switch de 100 lanes distribuye el ancho de banda total

El costo de iterar más

Nada de esto es gratis. Con el OM, el tiempo por solución se duplica y el consumo de tokens se dispara. Ejecutar modelos locales de frontera exige hardware caro y paciencia.

Nueva estación de trabajo Dell T2 junto al rack
El próximo capítulo: el Dell T2 Tower como estación principal

Por qué seguirlo

El video es un retrato fiel de la carrera local de frontera: cuantizaciones cada vez más agresivas, harness que cambia puntuaciones y hardware que se vuelve el factor decisivo.

Para quien evalúa IA local, la lección es clara: el modelo es la mitad de la historia. El software que lo sirve puede valer 20 puntos de benchmark.