Liquid AI presentó el LFM2.5-VL-3B, un modelo de visión y lenguaje con 3,1 mil millones de parámetros dirigido a dispositivos de borde. La empresa afirma que el lanzamiento amplía las capacidades de comprensión de pantallas e interfaces, grounding, entrada con múltiples imágenes y llamada de funciones.

Entrenamiento

El modelo combina el codificador visual SigLIP2 de 400 millones de parámetros con la base preentrenada del LFM2.5-2.6B. Según la empresa, se usaron cerca de 34 billones de tokens en el preentrenamiento, con cuatro veces más datos de visión que en las versiones anteriores, incluidos conjuntos de leyendas, OCR, grounding e instrucciones.

El tokenizador se extendió para duplicar el vocabulario hasta 128 mil tokens, con el objetivo de mejorar la compatibilidad con alfabetos no latinos, sin reentrenar el modelo desde cero. En el postentrenamiento, la compañía combinó el ajuste fino supervisado con destilación de conocimiento, entrenamiento Antidoom y aprendizaje por refuerzo con múltiples recompensas.

Rendimiento

En los benchmarks de visión, el LFM2.5-VL-3B alcanzó un promedio de 69,4 puntos, frente a los 57,2 de la versión anterior. Liquid AI afirma que el modelo lidera su clase en tareas con imágenes reales y se destaca en la lectura de documentos, gráficos y elementos de interfaz.

En las pruebas solo de texto, la compañía informó una mejora en el uso de herramientas, con un rendimiento equivalente al Gemma-4-E2B y al Qwen3.5-2B en llamada de funciones.

Velocidad de inferencia

La empresa informó que el modelo se ejecuta íntegramente en el dispositivo con 228 tokens por segundo en un M5 Max, 116 tokens por segundo en un Ryzen AI Max+ 395 y 20 tokens por segundo en un Galaxy S26 Ultra, ocupando alrededor de 3 GB de memoria.

En GPUs, el LFM2.5-VL-3B alcanza aproximadamente 11 mil tokens por segundo en escenarios de alta concurrencia, cerca del doble de modelos de la clase de 4B, y puede generar casi 1 mil millones de tokens por día en un H100. El modelo tiene compatibilidad en el lanzamiento con llama.cpp, MLX, vLLM, SGLang y ONNX.

Disponibilidad

El LFM2.5-VL-3B se puede cargar con la biblioteca Transformers, versión 5.10.1 o superior, a partir del identificador LiquidAI/LFM2.5-VL-3B. Liquid AI también habilitó una demostración en el navegador que permite enviar imágenes y probar grounding, OCR y uso de herramientas.

Sigue en Radar