stamatios
← Voltar ao feed
Robô de IA analisa foto, screenshot e diagrama em um labirinto, representando o modelo multimodal DeepSeek
IA & Modelos · Agentes

DeepSeek lança modelo multimodal que rivaliza com o Opus 4.8

resumo de ~3 min

O lançamento

A empresa chinesa DeepSeek lançou o V4-Flash-Vision-Exp, um modelo multimodal experimental que acrescenta compreensão de imagens às capacidades de texto do DeepSeek-V4-Flash. Segundo a própria empresa, a variante visual preserva o desempenho do modelo-base em raciocínio e conhecimento de mundo e obteve resultados próximos aos do Opus 4.8 em seus benchmarks internos de agentes. Em algumas avaliações, a DeepSeek afirma que o modelo se aproxima ou supera o concorrente, mas os resultados apresentados são da própria empresa e não de uma avaliação independente.

Uso em agentes visuais

O modelo é voltado a fluxos de trabalho baseados em agentes, combinando compreensão visual e uso de ferramentas em diferentes estruturas de agentes. Entre as tarefas descritas estão explicar imagens, extrair texto de capturas de tela e analisar diagramas. A documentação da API informa compatibilidade com imagens nos formatos JPEG, PNG, GIF e WebP. O sistema identifica o formato a partir do conteúdo real do arquivo, e não apenas do nome ou do tipo MIME declarado.

O V4-Flash-Vision-Exp pode ser usado com as APIs Chat Completions e Responses, da OpenAI, e com o endpoint Messages, da Anthropic. A DeepSeek também lançou a versão 0.1.1 do framework Harness, que oferece suporte ao novo modelo desde o início.

Envio de imagens e limites

Os desenvolvedores têm três opções para enviar imagens: incorporá-las diretamente com codificação Base64, indicar URLs públicas ou usar a nova Files API gratuita. URLs podem apontar para arquivos de até 32 MiB. Pela Files API, um arquivo pode ser carregado uma vez e referenciado por um identificador em várias solicitações, com limite de 64 MiB.

Um campo opcional chamado “detail” reduz a imagem para 512 por 512 pixels quando detalhes visuais finos não são necessários, o que economiza tokens. Mesmo sem essa opção, o modelo normaliza automaticamente as imagens para aproximadamente 800 por 800 pixels, dependendo da proporção. Cada imagem custa no máximo 384 tokens, independentemente da resolução original, e o preço segue as tarifas do V4-Flash.

Uma única solicitação pode conter até 600 imagens. O comprimento máximo de uma borda é de 8.192 pixels por lado, mas cai para 4.096 pixels quando a solicitação inclui 15 imagens ou mais. As imagens só podem ser incluídas em mensagens do usuário.

Assim, o lançamento combina uma capacidade visual experimental com integração a APIs e estruturas de agentes já existentes. A principal evidência de competitividade é, por enquanto, o desempenho em benchmarks multimodais internos da própria DeepSeek, enquanto os limites de imagens e o teto de 384 tokens por imagem definem as condições práticas de uso.