Produto · 22 de agosto de 2026
Também publicado em Español
DeepSeek lança modelo multimodal V4-Flash-Vision-Exp com suporte a imagens e texto
A empresa chinesa DeepSeek anunciou, na sexta-feira (21), o lançamento do modelo experimental multimodal DeepSeek-V4-Flash-Vision-Exp para sua plataforma de API. O novo modelo permite que agentes de inteligência artificial interpretem e descrevam imagens, reconheçam textos em capturas de tela e analisem gráficos, além de processar textos. Segundo a DeepSeek, o V4-Flash-Vision-Exp oferece capacidade de adaptação multimodal em diversos frameworks de agentes, possibilitando a realização de tarefas práticas em ambientes de trabalho. O modelo suporta os formatos de imagem JPEG, PNG, GIF e WebP. Em benchmarks de agentes que exigem compreensão visual, o novo modelo apresentou melhora significativa em relação ao DeepSeek-V4-Flash, aproximando-se do desempenho do Opus-4.8. No entanto, em tarefas puramente textuais, como raciocínio e conhecimento geral, o V4-Flash-Vision-Exp mantém o mesmo nível do DeepSeek-V4-Flash em sua versão estável. A empresa não divulgou valores de custo ou preços para o uso da API do novo modelo.
Informado por GeekPark.