DeepSeek atualiza sua IA de visão com mais capacidade e menor custo por token

Renê Fraga
11 min de leitura

Principais destaques

  • A DeepSeek aposentou o V4-Flash-Vision-Exp em 10 de setembro e passou a direcionar as chamadas para o novo V4.1-Flash, que tem compreensão visual nativa.
  • O novo modelo consegue processar até 2,7 vezes mais dados de uma mesma imagem, ampliando o espaço para análises visuais mais detalhadas.
  • O preço do token de entrada caiu de US$ 0,44 para US$ 0,30 por milhão de tokens no período de pico, uma redução de aproximadamente 32%, enquanto os nomes antigos continuam aceitos pela API.

A DeepSeek mudou novamente sua estratégia para processamento de imagens. A empresa aposentou o DeepSeek-V4-Flash-Vision-Exp, um modelo experimental de visão que havia chegado à API poucas semanas antes, e colocou o V4.1-Flash como substituto.

A troca aconteceu em 10 de setembro, mesma data em que a empresa anunciou oficialmente o novo modelo. O movimento é mais significativo do que uma simples atualização de versão porque a visão deixou de ser tratada como uma variante experimental e passou a fazer parte da arquitetura principal do novo Flash.

O modelo anterior tinha chamado atenção pelo custo extremamente baixo. Considerando a forma como as imagens eram convertidas em tokens para cobrança, uma imagem podia representar um custo na casa de frações de centavo, chegando a aproximadamente US$ 0,00008 em determinados cenários de uso.

Agora, a DeepSeek tenta combinar essa proposta de baixo custo com uma capacidade visual maior. O resultado é um modelo que não apenas substitui o antigo sistema de visão, mas também muda a maneira como a empresa apresenta esse recurso aos desenvolvedores.

A visão deixa de ser um experimento separado

O DeepSeek-V4-Flash-Vision-Exp foi lançado em 21 de agosto como um modelo experimental de compreensão visual. Na época, a empresa destacou que ele mantinha desempenho semelhante ao V4-Flash em tarefas exclusivamente de texto, mas apresentava um salto importante em avaliações que exigiam interpretação de imagens.

A proposta permitia usar imagens junto com comandos de texto para tarefas como descrever fotografias, interpretar capturas de tela, ler informações e analisar gráficos. A própria documentação da DeepSeek também listava formatos como JPEG, PNG, GIF e WebP.

A experiência, porém, durou pouco. Menos de três semanas depois, a empresa anunciou a aposentadoria do Vision-Exp junto com o V4-Flash anterior.

O novo V4.1-Flash passa a incorporar compreensão visual de forma nativa. Isso significa que o desenvolvedor não precisa mais pensar na visão como uma capacidade adicional ligada a uma versão experimental específica do modelo.

O ponto central da mudança: a DeepSeek está transformando a análise de imagens em uma função integrada ao seu modelo principal de baixo custo.

Essa diferença pode parecer apenas técnica, mas tem impacto direto na forma como aplicações de inteligência artificial são construídas. Um único modelo capaz de lidar com texto e imagens facilita projetos que alternam entre documentos, telas, fotografias, gráficos e instruções escritas.

Mais dados da mesma imagem entram na conta

Um dos ganhos mais importantes está na quantidade de informação visual que o novo sistema consegue aproveitar. O V4.1-Flash pode processar até 2,7 vezes mais dados de uma mesma imagem em comparação com a geração anterior.

Na prática, isso pode ser especialmente relevante para imagens em que pequenos detalhes fazem diferença. Uma captura de tela cheia de elementos, um gráfico com muitas informações ou um documento fotografado podem exigir uma leitura visual mais cuidadosa do que uma imagem simples.

Quanto mais informação visual chega ao modelo, maior é o espaço disponível para que ele identifique relações entre diferentes elementos. Isso não significa que toda imagem automaticamente produzirá uma resposta melhor, mas aumenta a quantidade de conteúdo que pode ser considerada durante a análise.

A mudança também acompanha uma tendência mais ampla dos modelos multimodais. Em vez de simplesmente reconhecer objetos ou produzir uma descrição genérica, os sistemas estão sendo desenvolvidos para trabalhar com imagens como parte de tarefas complexas de raciocínio e automação.

A própria DeepSeek destaca o uso do V4.1-Flash em cenários de compreensão visual e agentes de IA. Na apresentação do novo modelo, a empresa posiciona a arquitetura como uma solução voltada não apenas para respostas convencionais, mas também para maior velocidade, capacidade e escalabilidade.

O que muda para quem usa imagens na API?

RecursoModelo anteriorV4.1-Flash
VisãoVariante experimentalIntegrada nativamente
SituaçãoAposentadoModelo atual
Nome antigo na APIAceitoRedirecionado para o novo modelo
Entrada de imagensSimSim
Preço de entrada no picoUS$ 0,44/1 milhão de tokensUS$ 0,30/1 milhão de tokens
ContextoAté 1 milhão de tokensAté 1 milhão de tokens

Os valores de preço são referentes à tabela de cobrança por tokens. A DeepSeek não estabelece uma tarifa fixa universal por fotografia: a imagem é convertida em tokens e entra no cálculo da utilização da API.

O preço caiu enquanto a capacidade aumentou

A mudança também chama atenção pelo lado financeiro. O preço de entrada do modelo anterior estava em US$ 0,44 por milhão de tokens no período de pico, enquanto o V4.1-Flash passou para US$ 0,30.

A diferença representa uma redução de aproximadamente 32%. Para um usuário casual, a economia pode parecer pequena, mas ela se torna relevante quando uma aplicação analisa milhares ou milhões de imagens ao longo do tempo.

O novo modelo também trabalha com preços diferentes conforme o horário. A DeepSeek informa que as tarifas fora do período de pico podem chegar à metade do preço de pico, criando uma oportunidade adicional para cargas de trabalho que não precisam ser processadas imediatamente.

Essa estrutura é particularmente interessante para aplicações automatizadas. Uma empresa que precise analisar grandes lotes de documentos, imagens ou capturas de tela pode deslocar tarefas menos urgentes para períodos de menor demanda e reduzir ainda mais o custo operacional.

A arquitetura também foi desenhada para diminuir o consumo de memória associado ao cache. Segundo a DeepSeek, o V4.1-Flash utiliza um cache KV que precisa de um quarto da memória HBM e de um oitavo do armazenamento SSD em comparação com a geração anterior.

Para quem desenvolve sistemas de IA em escala, esse tipo de otimização pode ser tão importante quanto uma redução direta no preço por token. Menor consumo de infraestrutura pode ajudar a aumentar o número de usuários atendidos sem que os custos cresçam na mesma proporção.

O nome antigo ainda funciona, mas o modelo já mudou

Apesar da aposentadoria, desenvolvedores que continuam usando os identificadores antigos não ficam imediatamente diante de um erro de API.

A DeepSeek informa que os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp continuam sendo aceitos temporariamente por questões de compatibilidade. Porém, as chamadas não estão mais sendo atendidas pelos modelos originais: elas são encaminhadas para o V4.1-Flash.

Isso reduz o impacto imediato da mudança para aplicações que já estão em produção. Um sistema que ainda não atualizou o nome do modelo pode continuar respondendo, sem necessariamente exigir uma alteração emergencial no código.

Há, porém, uma diferença importante para quem acompanha custos. O fato de o identificador antigo continuar funcionando não significa que o modelo antigo ainda esteja disponível.

Na prática, a API passou a funcionar como uma camada de compatibilidade. O nome permanece, mas o mecanismo por trás dele mudou.

Por que isso importa para desenvolvedores

A estratégia permite que a DeepSeek avance rapidamente sem obrigar todos os usuários a fazer uma migração simultânea. Ao mesmo tempo, sinaliza que projetos novos devem ser construídos considerando o V4.1-Flash como a referência atual.

A mudança também mostra a velocidade com que o mercado de modelos multimodais está evoluindo. O Vision-Exp ficou disponível em agosto e já foi retirado em setembro, sendo absorvido por uma arquitetura mais recente.

Para o usuário final, isso pode parecer apenas uma troca de versão. Para quem mantém uma aplicação de IA, entretanto, mudanças desse tipo podem afetar custo, quantidade de tokens consumidos, desempenho e comportamento das respostas.

A DeepSeek está apostando justamente nessa combinação: mais capacidade visual, arquitetura mais eficiente e preços menores. O V4.1-Flash foi apresentado pela empresa como o menor modelo de uma nova família arquitetural, com 552 bilhões de parâmetros no total e uma quantidade muito menor de parâmetros ativados durante o processamento.

O resultado é uma mudança que vai além da aposentadoria de um modelo experimental. A empresa está tentando fazer com que a compreensão de imagens deixe de ser um recurso especializado e passe a ser parte normal de um modelo de uso geral.

Para quem já utilizava o antigo Vision-Exp, a transição acontece quase sem atrito graças aos nomes legados. Para quem pretende começar agora, porém, o recado é mais direto: o futuro da visão na API da DeepSeek está concentrado no V4.1-Flash, que chega com uma capacidade visual maior e uma conta de entrada menor.

Apoie o Eurisko
Este conteúdo é independente, sem anúncios e feito por pessoas.
A inteligência artificial e as mudanças recentes do Google reduziram significativamente o alcance dos sites independentes. Se este conteúdo foi útil para você, considere apoiar o Eurisko e todo o ecossistema de projetos com qualquer valor.
Quero apoiar
Seguir
Renê Fraga é fundador e editor-chefe do Eurisko, ecossistema editorial independente dedicado à inteligência artificial, código aberto, tecnologia e cultura digital. Atuando com projetos online desde 1996, escreve há mais de 20 anos sobre tecnologia e inovação, acompanhando a evolução da internet e o impacto das novas tecnologias na forma como vivemos, trabalhamos e pensamos.
Nenhum comentário