A DeepSeek lançou o V4-Flash-Vision-Exp, modelo experimental de inteligência artificial que adiciona capacidade de interpretar imagens ao V4-Flash. Segundo testes divulgados pela própria empresa, a nova versão se aproxima do Claude Opus 4.8, da Anthropic, em tarefas que exigem que agentes de IA analisem conteúdo visual e executem ações a partir dessas informações.

O modelo foi disponibilizado na API da DeepSeek na sexta-feira (21) e mantém, segundo a companhia, o desempenho do V4-Flash em texto, incluindo raciocínio, conhecimento geral e tarefas executadas por agentes.

A principal mudança está na capacidade de combinar texto e imagens dentro do mesmo fluxo de trabalho. Na prática, um agente equipado com o novo modelo pode analisar capturas de tela, interpretar gráficos e diagramas, reconhecer informações visuais e usar essas informações para decidir quais ações executar.

DeepSeek mira agentes capazes de "enxergar"

A aposta da DeepSeek vai além de permitir que usuários façam perguntas sobre fotografias. O V4-Flash-Vision-Exp foi desenvolvido principalmente para agentes de IA que precisam interpretar interfaces, documentos e outros elementos visuais antes de usar ferramentas ou realizar uma tarefa.

Isso pode ser aplicado, por exemplo, a um agente que recebe uma captura de tela de um software, identifica os elementos exibidos e determina a próxima ação, ou a sistemas capazes de analisar documentos, gráficos e interfaces durante processos automatizados.

O modelo pode trabalhar com diferentes frameworks de agentes e já é compatível com o DeepSeek Harness 0.1.1, estrutura disponibilizada pela companhia para a execução desse tipo de sistema.

Modelo chega perto do Opus 4.8 em testes multimodais

Nos benchmarks publicados pela DeepSeek, o novo modelo apresentou resultados próximos aos do Opus 4.8 em diferentes avaliações que combinam visão e atuação autônoma.

Tabela compara o desempenho do DeepSeek V4-Flash-Vision-Exp, DeepSeek V4-Flash-0731 e Claude Opus 4.8 em benchmarks de agentes baseados em texto e tarefas multimodais.
Tabela compara o desempenho do DeepSeek V4-Flash-Vision-Exp, DeepSeek V4-Flash-0731 e Claude Opus 4.8 em benchmarks de agentes baseados em texto e tarefas multimodais.

No Chartography, por exemplo, o V4-Flash-Vision-Exp marcou 64,3 pontos, contra 65 do Opus 4.8. No ApexBench, foram 36,5 pontos para o modelo da DeepSeek e 39,4 para o concorrente da Anthropic.

Em outros dois testes, a solução chinesa ficou à frente. No Agents' Last Exam, alcançou 27,3 pontos, ante 25,7 do Opus 4.8. No ZeroBench, registrou 35 pontos, contra 34 do modelo da Anthropic.

Os resultados, porém, devem ser interpretados com cautela. Os benchmarks foram divulgados pela própria DeepSeek e não representam uma avaliação independente. Além disso, o desempenho varia de acordo com a tarefa: em alguns testes baseados apenas em texto, o Opus 4.8 ainda mantém vantagem significativa.

Até 600 imagens em uma única solicitação

A DeepSeek também tentou tornar o uso de imagens relativamente barato dentro da API.

Cada imagem consome no máximo 384 tokens, independentemente de sua resolução original, e segue a mesma tabela de preços do V4-Flash. Antes do processamento, o sistema ajusta automaticamente o tamanho das imagens para reduzir o consumo de recursos.

Uma única solicitação pode incluir até 600 imagens, o que abre espaço para aplicações que precisam analisar grandes conjuntos de capturas de tela, páginas de documentos ou sequências visuais.

Os desenvolvedores podem enviar arquivos diretamente codificados na solicitação, utilizar imagens disponíveis por URL ou recorrer à nova Files API da DeepSeek.

Essa última alternativa permite enviar um arquivo uma vez e reutilizá-lo posteriormente por meio de um identificador, sem precisar transferir a mesma imagem novamente a cada requisição. A DeepSeek afirma que o serviço de armazenamento e referência de arquivos não tem cobrança adicional.

Modelo experimental amplia disputa por agentes de IA

O V4-Flash-Vision-Exp também funciona com interfaces compatíveis com Chat Completions e Responses, da OpenAI, e Messages, da Anthropic, facilitando sua integração em ferramentas construídas originalmente para outros provedores.

Mais do que adicionar reconhecimento de imagens ao portfólio da DeepSeek, o lançamento mostra o esforço da companhia para avançar em uma das áreas mais disputadas atualmente na inteligência artificial: agentes capazes de observar ambientes, interpretar informações e executar tarefas usando diferentes ferramentas.

O modelo ainda carrega a designação "Exp", indicando seu caráter experimental. Mesmo assim, os primeiros resultados apresentados pela DeepSeek sugerem que a empresa pretende usar o V4-Flash como uma alternativa de menor custo também para aplicações multimodais, ampliando a concorrência com modelos avançados de empresas como Anthropic e OpenAI.

Continue no Radar