Cactus Compute anunció el lanzamiento de Needle 2, un modelo abierto de 45 millones de parámetros para llamada de herramientas, uso de dispositivos y extracción estructurada. El modelo se distribuye en un único binario de 14 MB y ejecuta una sesión completa con aproximadamente 28 MB de RAM, sin necesidad de runtime ni descargas durante la inferencia.

Según la empresa, los pesos se entrenan e implantan en precisión CQ2-bit, desarrollada por la propia compañía, y el modelo opera en un motor C++ cerrado. Cactus Compute afirma que la elección de 45 millones de parámetros se basa en la premisa de que mapear una frase a una firma de función tipada no exige conocimiento del mundo ni generación de texto abierto. El modelo fue diseñado para hardware sin GPU y sin NPU, con una tasa de decodificación reportada de 500 tokens por segundo en una Raspberry Pi 5.

Rendimiento en benchmarks

En evaluaciones públicas de llamada de función, Needle 2 obtuvo 32,6 en Seal-Tools in-domain y 28,7 en OOD, superando a los modelos LFM2.5 230M y FunctionGemma 270M. En Mobile Actions, marcó 63,7 de exactitud general y 98,3 de precisión en los nombres de las funciones. En BFCL v4 single-turn, el modelo registró 42,6, por debajo de los competidores; Cactus Compute atribuye el resultado a la especialización de la base de entrenamiento en acciones de dispositivos de consumo, y no en APIs generales o empresariales.

Arquitectura e implementación

El modelo utiliza una arquitectura llamada Simple Attention Network, que sustituye la red feed-forward por un Hadamard MLP, mantiene atención GQA y añade memoria engram basada en tablas de n-gramas con hash. La red tiene 27 capas y ancho 512. Durante la inferencia, la atención utiliza una ventana deslizante de 256 tokens, y las declaraciones de herramientas permanecen fijas, lo que mantiene el uso de RAM en aproximadamente 28 MB independientemente del tamaño de la conversación.

Needle 2 se distribuye como binarios precompilados y biblioteca estática para macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS y WebAssembly. Cactus Compute afirma que el dispositivo Pebble ya utiliza el modelo en la aplicación Index 01 para comandos de voz sin conexión. Cada respuesta del modelo incluye un valor de confianza; las solicitudes fuera del alcance devuelven la llamada vacía [].

Sigue en Radar