DeepSeek lanzó el V4-Flash-Vision-Exp, un modelo experimental de inteligencia artificial que añade capacidad de interpretar imágenes al V4-Flash. Según pruebas divulgadas por la propia empresa, la nueva versión se acerca al Claude Opus 4.8, de Anthropic, en tareas que exigen que agentes de IA analicen contenido visual y ejecuten acciones a partir de esa información.
El modelo fue puesto a disposición en la API de DeepSeek el viernes (21) y mantiene, según la compañía, el rendimiento del V4-Flash en texto, incluido el razonamiento, el conocimiento general y las tareas ejecutadas por agentes.
El principal cambio está en la capacidad de combinar texto e imágenes dentro del mismo flujo de trabajo. En la práctica, un agente equipado con el nuevo modelo puede analizar capturas de pantalla, interpretar gráficos y diagramas, reconocer información visual y usar esa información para decidir qué acciones ejecutar.
DeepSeek apunta a agentes capaces de "ver"
La apuesta de DeepSeek va más allá de permitir que los usuarios hagan preguntas sobre fotografías. El V4-Flash-Vision-Exp fue desarrollado principalmente para agentes de IA que necesitan interpretar interfaces, documentos y otros elementos visuales antes de usar herramientas o realizar una tarea.
Esto puede aplicarse, por ejemplo, a un agente que recibe una captura de pantalla de un software, identifica los elementos mostrados y determina la próxima acción, o a sistemas capaces de analizar documentos, gráficos e interfaces durante procesos automatizados.
El modelo puede trabajar con diferentes frameworks de agentes y ya es compatible con el DeepSeek Harness 0.1.1, estructura puesta a disposición por la compañía para la ejecución de este tipo de sistema.
El modelo se acerca al Opus 4.8 en pruebas multimodales
En los benchmarks publicados por DeepSeek, el nuevo modelo presentó resultados cercanos a los del Opus 4.8 en diferentes evaluaciones que combinan visión y actuación autónoma.

En Chartography, por ejemplo, el V4-Flash-Vision-Exp obtuvo 64,3 puntos, frente a 65 del Opus 4.8. En ApexBench, fueron 36,5 puntos para el modelo de DeepSeek y 39,4 para el competidor de Anthropic.
En otras dos pruebas, la solución china quedó por delante. En Agents' Last Exam, alcanzó 27,3 puntos, frente a 25,7 del Opus 4.8. En ZeroBench, registró 35 puntos, contra 34 del modelo de Anthropic.
Los resultados, sin embargo, deben interpretarse con cautela. Los benchmarks fueron divulgados por la propia DeepSeek y no representan una evaluación independiente. Además, el rendimiento varía según la tarea: en algunas pruebas basadas solo en texto, el Opus 4.8 aún mantiene una ventaja significativa.
Hasta 600 imágenes en una sola solicitud
DeepSeek también intentó hacer que el uso de imágenes fuera relativamente barato dentro de la API.
Cada imagen consume como máximo 384 tokens, independientemente de su resolución original, y sigue la misma tabla de precios del V4-Flash. Antes del procesamiento, el sistema ajusta automáticamente el tamaño de las imágenes para reducir el consumo de recursos.
Una sola solicitud puede incluir hasta 600 imágenes, lo que abre espacio para aplicaciones que necesitan analizar grandes conjuntos de capturas de pantalla, páginas de documentos o secuencias visuales.
Los desarrolladores pueden enviar archivos directamente codificados en la solicitud, utilizar imágenes disponibles por URL o recurrir a la nueva Files API de DeepSeek.
Esta última alternativa permite enviar un archivo una vez y reutilizarlo posteriormente mediante un identificador, sin necesidad de transferir la misma imagen nuevamente en cada solicitud. DeepSeek afirma que el servicio de almacenamiento y referencia de archivos no tiene cargo adicional.
El modelo experimental amplía la disputa por agentes de IA
El V4-Flash-Vision-Exp también funciona con interfaces compatibles con Chat Completions y Responses, de OpenAI, y Messages, de Anthropic, lo que facilita su integración en herramientas construidas originalmente para otros proveedores.
Más que añadir reconocimiento de imágenes al portafolio de DeepSeek, el lanzamiento muestra el esfuerzo de la compañía por avanzar en una de las áreas más disputadas actualmente en la inteligencia artificial: agentes capaces de observar entornos, interpretar información y ejecutar tareas usando diferentes herramientas.
El modelo aún lleva la designación "Exp", lo que indica su carácter experimental. Aun así, los primeros resultados presentados por DeepSeek sugieren que la empresa pretende usar el V4-Flash como una alternativa de menor costo también para aplicaciones multimodales, ampliando la competencia con modelos avanzados de empresas como Anthropic y OpenAI.



