A Liquid AI divulgou o LFM2.5-VL-3B, modelo de visão e linguagem com 3,1 bilhões de parâmetros direcionado a dispositivos de borda. A empresa afirma que o lançamento amplia recursos de compreensão de telas e interfaces, grounding, entrada com múltiplas imagens e chamada de funções.
Treinamento
O modelo combina o codificador visual SigLIP2 de 400 milhões de parâmetros com a base pré-treinada do LFM2.5-2.6B. Segundo a empresa, foram usados cerca de 34 trilhões de tokens no pré-treinamento, com quatro vezes mais dados de visão do que nas versões anteriores, incluindo conjuntos de legendas, OCR, grounding e instruções.
O tokenizador foi estendido para dobrar o vocabulário para 128 mil tokens, com o objetivo de melhorar o suporte a alfabetos não latinos, sem retreinar o modelo do zero. No pós-treinamento, a companhia combinou fine-tuning supervisionado com destilação de conhecimento, treinamento Antidoom e aprendizado por reforço com múltiplas recompensas.
Desempenho
Nos benchmarks de visão, o LFM2.5-VL-3B atingiu média de 69,4 pontos, ante 57,2 da versão anterior. A Liquid AI diz que o modelo lidera sua classe em tarefas com imagens reais e se destaca em leitura de documentos, gráficos e elementos de interface.
Nos testes apenas de texto, a companhia relatou melhora no uso de ferramentas, com desempenho equivalente ao Gemma-4-E2B e ao Qwen3.5-2B em chamada de funções.
Velocidade de inferência
A empresa informou que o modelo roda inteiramente no dispositivo com 228 tokens por segundo em um M5 Max, 116 tokens por segundo em um Ryzen AI Max+ 395 e 20 tokens por segundo em um Galaxy S26 Ultra, ocupando cerca de 3 GB de memória.
Em GPUs, o LFM2.5-VL-3B alcança aproximadamente 11 mil tokens por segundo em cenários de alta concorrência, cerca do dobro de modelos da classe de 4B, e pode gerar quase 1 bilhão de tokens por dia em um H100. O modelo tem compatibilidade no lançamento com llama.cpp, MLX, vLLM, SGLang e ONNX.
Disponibilidade
O LFM2.5-VL-3B pode ser carregado com a biblioteca Transformers, versão 5.10.1 ou superior, a partir do identificador LiquidAI/LFM2.5-VL-3B. A Liquid AI também disponibilizou uma demonstração no navegador que permite enviar imagens e testar grounding, OCR e uso de ferramentas.



