A Cactus Compute anunciou o lançamento do Needle 2, um modelo aberto de 45 milhões de parâmetros para chamada de ferramentas, uso de dispositivos e extração estruturada. O modelo é distribuído em um único binário de 14 MB e executa uma sessão completa com cerca de 28 MB de RAM, sem necessidade de runtime ou download durante a inferência.

Segundo a empresa, os pesos são treinados e implantados em precisão CQ2-bit, desenvolvida pela própria companhia, e o modelo opera em um motor C++ fechado. A Cactus Compute afirma que a escolha de 45 milhões de parâmetros se baseia na premissa de que mapear uma frase para uma assinatura de função tipada não exige conhecimento de mundo nem geração de texto aberto. O modelo foi projetado para hardware sem GPU e sem NPU, com taxa de decodificação relatada de 500 tokens por segundo em um Raspberry Pi 5.

Desempenho em benchmarks

Em avaliações públicas de chamada de função, o Needle 2 obteve 32,6 no Seal-Tools in-domain e 28,7 no OOD, superando os modelos LFM2.5 230M e FunctionGemma 270M. No Mobile Actions, marcou 63,7 de acurácia geral e 98,3 de precisão nos nomes das funções. No BFCL v4 single-turn, o modelo registrou 42,6, abaixo dos concorrentes; a Cactus Compute atribui o resultado à especialização da base de treinamento em ações de dispositivos de consumo, e não em APIs gerais ou empresariais.

Arquitetura e implantação

O modelo usa uma arquitetura chamada Simple Attention Network, que substitui a rede feed-forward por um Hadamard MLP, mantém atenção GQA e adiciona memória engram baseada em tabelas de n-gramas com hash. A rede tem 27 camadas e largura 512. Durante a inferência, a atenção usa uma janela deslizante de 256 tokens, e as declarações de ferramentas ficam fixas, o que mantém o uso de RAM em cerca de 28 MB independentemente do tamanho da conversa.

O Needle 2 é distribuído como binários pré-compilados e biblioteca estática para macOS, Linux (x86-64, ARM64, ARMv7, RISC-V, MIPS32el), Windows, Android, iOS/watchOS/tvOS e WebAssembly. A Cactus Compute afirma que o dispositivo Pebble já utiliza o modelo no aplicativo Index 01 para comandos de voz offline. Cada resposta do modelo traz um valor de confiança; solicitações fora do escopo retornam a chamada vazia [].

Continue no Radar