A DeepSeek voltou a mexer com o mercado de modelos de linguagem. A 31 de julho de 2026, a empresa chinesa tirou o DeepSeek V4-Flash 0731 da fase de pré-visualização e colocou-o à venda a $0,14 por milhão de tokens de entrada e $0,28 por milhão de saída. Uma semana depois, o modelo já liderava o ranking semanal de uso da OpenRouter por volume de tokens, à frente de qualquer produto da OpenAI, Google ou Anthropic. Não é um acontecimento isolado: é o mais recente capítulo de uma tendência que já dura 15 semanas consecutivas, com modelos chineses a somar cerca de metade de todos os tokens processados na plataforma.
Para quem acompanha o setor de inteligência artificial, o lançamento confirma um padrão que se repete desde o choque inicial do DeepSeek R1 em 2025: a empresa sediada em Hangzhou continua a apertar o cerco aos laboratórios ocidentais pelo lado do preço, sem abdicar de desempenho competitivo em tarefas de agente e raciocínio. Este artigo analisa os números por trás do lançamento, o impacto no mercado e o que esperar nos próximos meses.
O que é o DeepSeek V4-Flash 0731
O DeepSeek V4-Flash 0731 é a variante “rápida” da família V4-Flash, otimizada para tarefas de agente e execução de comandos em ambiente de terminal. O nome “0731” refere-se à data de lançamento, 31 de julho de 2026, seguindo a convenção que a DeepSeek já usa noutros modelos. Depois de semanas em pré-visualização, o modelo saiu oficialmente dessa fase e passou a ter preço de produção estável.
Segundo dados recolhidos por avaliadores independentes, o modelo atingiu 82,7% no Terminal-Bench, um benchmark que testa a capacidade de um modelo para executar tarefas reais numa linha de comandos, encadear ações e corrigir erros sem intervenção humana. Esse resultado supera o do próprio modelo DeepSeek de 1,6 biliões de parâmetros da linha Pro, o que é significativo: normalmente, um modelo “flash” (mais pequeno e rápido) fica atrás do modelo principal da mesma família em benchmarks de raciocínio complexo. Aqui aconteceu o inverso, pelo menos numa tarefa especializada em agentes.
No índice de inteligência da Artificial Analysis, o V4-Flash 0731 subiu de 40 para 50 pontos face à versão anterior em pré-visualização, ficando a apenas um ponto do GPT-5.6 Luna, atualmente um dos modelos fechados mais fortes do mercado. A diferença de preço entre os dois, porém, é o que torna a notícia relevante para empresas: o relatório da Artificial Analysis estima que o modelo da DeepSeek custa cerca de 60% menos por tarefa do que o modelo com que foi comparado.
Os números da OpenRouter: 15 semanas de domínio chinês
A OpenRouter, plataforma que agrega chamadas de API para dezenas de modelos de linguagem e é usada como termómetro informal da adoção real (não apenas do hype), publicou o ranking semanal de 3 a 9 de agosto de 2026. O DeepSeek-V4-Flash apareceu no topo por volume de tokens processados, superando concorrentes ocidentais e outros modelos chineses no mesmo período.
O dado mais relevante não é o pico isolado, mas a série: modelos chineses mantêm a liderança nesse ranking há 15 semanas seguidas, e representam aproximadamente metade de todos os tokens processados na plataforma. Isto acontece num mercado onde, até há um ano, a conversa dominante era sobre a disputa entre OpenAI, Google e Anthropic. A DeepSeek, a Moonshot (criadora do Kimi K3) e outros laboratórios chineses mudaram essa narrativa ao competir agressivamente em preço e ao publicar pesos abertos com regularidade.
Vale notar que o volume de tokens na OpenRouter reflete sobretudo uso de programadores e empresas que constroem aplicações via API, não o público em geral que usa apps de consumo como o ChatGPT. É um indicador de adoção técnica, não de base de utilizadores total. Ainda assim, é o proxy mais próximo que existe hoje para medir para onde vai o dinheiro e o tráfego real de produção, longe do ruído dos anúncios de lançamento.
Tabela comparativa: DeepSeek V4-Flash 0731 vs. principais modelos de agosto de 2026
A tabela seguinte resume os dados publicamente disponíveis sobre o DeepSeek V4-Flash 0731 e os modelos com que é mais comparado neste momento.
| Modelo | Preço (entrada/saída por 1M tokens) | Índice Artificial Analysis | Terminal-Bench | Licença |
|---|---|---|---|---|
| DeepSeek V4-Flash 0731 | $0,14 / $0,28 | 50 | 82,7% | Pesos abertos |
| DeepSeek V4-Pro (1,6T) | Superior ao Flash | Não divulgado publicamente | Inferior ao Flash 0731 | Pesos abertos |
| GPT-5.6 Luna | Cerca de 60% mais caro por tarefa | ~51 | Não divulgado | Fechado |
| Kimi K3 (Moonshot) | Não divulgado | Líder entre modelos de pesos abertos | Não divulgado | Pesos abertos |
| Claude Opus 5 | Não comparável (foco em segurança/agentes) | Não divulgado neste relatório | Não divulgado | Fechado |
Os valores de índice e benchmark do GPT-5.6 Luna e do Claude Opus 5 nesta tabela refletem apenas o que foi tornado público até à data de publicação deste artigo; laboratórios fechados divulgam menos detalhes técnicos do que os que operam com pesos abertos, o que dificulta uma comparação totalmente simétrica.
Contexto: o resto do mercado de IA em agosto de 2026
O lançamento do V4-Flash 0731 não aconteceu isolado. Na mesma janela de tempo, várias peças do tabuleiro da IA generativa moveram-se ao mesmo tempo. A Anthropic lançou o Claude Opus 5 no início de agosto, com foco declarado em segurança de agentes: segundo dados de avaliação da própria empresa, a taxa de sucesso de um atacante em 15 tentativas de prompt injection caiu de 5,5% para 2,0% face ao modelo anterior. Com as defesas de navegador ativadas, o modelo bloqueou a totalidade das 1.290 tentativas de ataque testadas em 129 ambientes de avaliação isolados.
A DeepSeek também lançou, a 13 de agosto, o DeepSeek Harness, uma framework de agentes com licença MIT e arquitetura baseada em plugins, alinhada com o V4-Pro e com uma nova estrutura de preços que distingue horário de pico e fora de pico. É um sinal de que a empresa não está apenas a competir em modelos base, mas também na camada de ferramentas à volta deles, terreno onde a OpenAI e a Anthropic tinham vantagem até agora.
Do lado do consumo em massa, tanto o ChatGPT como o Gemini ultrapassaram a marca de mil milhões de utilizadores mensais, segundo relatos do setor. A Meta, por seu turno, lançou o Muse Glimmer como modelo de pesos abertos, reforçando a corrida entre os grandes grupos tecnológicos para não ficar de fora da onda “open weight” que a DeepSeek ajudou a acelerar.
Contexto histórico: da disrupção do R1 ao domínio do V4
Para perceber a dimensão do que aconteceu em agosto de 2026, é preciso recuar até ao lançamento do DeepSeek R1, em janeiro de 2025. Nessa altura, o modelo chocou o mercado ao apresentar desempenho próximo do topo de gama a uma fração do custo de treino divulgado pelos laboratórios ocidentais, provocando uma queda acentuada nas ações de empresas ligadas a infraestrutura de IA nos Estados Unidos, incluindo a Nvidia.
Desde então, a DeepSeek manteve um ritmo de lançamentos rápido: passou pela série V3, consolidou a arquitetura de mistura de especialistas (MoE) como padrão de eficiência e chegou agora à família V4, com variantes Flash e Pro claramente segmentadas por caso de uso. O padrão repete-se a cada ciclo: lançamento com preço agressivo, adoção rápida entre programadores sensíveis a custo, e resposta lenta dos laboratórios fechados, que continuam a competir mais em capacidade máxima do que em preço por tarefa.
A diferença em 2026 é que a DeepSeek deixou de ser vista como um caso isolado. A Moonshot AI, com o Kimi K3, e outros laboratórios chineses seguiram uma lógica semelhante, o que transformou o fenómeno numa tendência estrutural: os 15 registos consecutivos de liderança de modelos chineses na OpenRouter não são o resultado de um único produto, mas de um ecossistema inteiro a competir de forma coordenada em preço e disponibilidade de pesos abertos.
Impacto no mercado: o que muda para empresas e programadores
Para equipas de engenharia que constroem produtos sobre APIs de IA, a matemática do V4-Flash 0731 é difícil de ignorar. A $0,14/$0,28 por milhão de tokens, o custo de rodar milhões de chamadas por mês cai substancialmente face a alternativas fechadas de desempenho comparável. Isso já está a puxar orçamentos de infraestrutura de IA para modelos de pesos abertos, sobretudo em tarefas de agente, automação de fluxo de trabalho e processamento em lote, onde a diferença de preço se multiplica pelo volume.
Isto não significa que os modelos fechados percam relevância de imediato. O GPT-5.6 Luna e o Claude Opus 5 continuam a liderar em áreas onde a confiança regulatória, o suporte empresarial dedicado e as garantias contratuais pesam mais do que o preço por token, como os setores financeiro e de saúde na Europa. Mas a pressão de preço da DeepSeek obriga esses laboratórios a justificar cada vez melhor a diferença de custo, algo que já se nota em ajustes de tabelas de preços ao longo de 2026.
Há também um efeito indireto sobre o hardware. Modelos mais eficientes por token reduzem a pressão sobre GPUs de topo de gama para inferência em grande escala, ainda que o treino desses modelos continue a exigir clusters massivos. Este equilíbrio entre eficiência de inferência e custo de treino é um dos temas centrais da discussão sobre a próxima geração de chips de IA.
Segurança e prompt injection: o outro lado da corrida por agentes
À medida que modelos como o V4-Flash 0731 se tornam mais capazes em tarefas de agente autónomo, cresce também a superfície de ataque. Investigadores de segurança relataram, em agosto de 2026, uma nova classe de ataques de prompt injection que se espalha por sites comerciais sem recorrer a malware, credenciais roubadas ou vulnerabilidades de dia zero. O vetor de ataque explora uma funcionalidade comum a quase todos os assistentes de IA principais: hiperligações profundas pré-preenchidas que o modelo segue automaticamente ao navegar.
É neste contexto que os números de segurança do Claude Opus 5 ganham relevância: uma redução da taxa de sucesso de ataque de 5,5% para 2,0% em 15 tentativas mostra progresso real, mas está longe de eliminar o risco. Para equipas que estão a avaliar modelos de agente, incluindo o V4-Flash 0731, a recomendação do setor continua a ser isolar permissões, limitar o que um agente pode executar sem confirmação humana e tratar qualquer conteúdo externo processado pelo modelo como potencialmente hostil.
Comparação competitiva: pesos abertos vs. modelos fechados em agosto de 2026
| Critério | Modelos de pesos abertos (DeepSeek, Kimi K3, Llama 4) | Modelos fechados (GPT-5.6, Claude Opus 5, Gemini) |
|---|---|---|
| Preço por milhão de tokens | Tipicamente 50-60% mais barato | Preço premium, com suporte empresarial incluído |
| Transparência de benchmarks | Alta, pesos e resultados publicados | Parcial, depende do laboratório |
| Uso medido na OpenRouter (ago. 2026) | ~50% do volume de tokens, 15 semanas no topo | Restante do volume |
| Foco declarado em segurança de agentes | Variável por laboratório | Prioridade alta (ex.: Claude Opus 5) |
| Licenciamento | MIT, Apache 2.0 ou licenças próprias abertas | Acesso apenas via API, sem pesos públicos |
O que a DeepSeek Harness muda na disputa por ferramentas de agente
Lançar um modelo competitivo já não basta para ganhar quota de mercado; é preciso também oferecer a infraestrutura à volta dele. O DeepSeek Harness, lançado a 13 de agosto de 2026 com licença MIT, segue esse raciocínio: uma framework de agentes com arquitetura baseada em plugins, pensada para que programadores construam fluxos de automação sobre os modelos V4 sem depender de ferramentas fechadas de terceiros.
Esta jogada espelha o que a OpenAI e a Anthropic já fazem com os seus próprios kits de ferramentas para agentes, mas com uma diferença relevante: ao abrir a licença, a DeepSeek reduz o atrito para que outras empresas construam produtos comerciais sobre a sua pilha tecnológica sem custos de licenciamento adicionais. É uma estratégia coerente com o resto da abordagem da empresa desde o R1: ganhar por volume e adoção, não por margem em cada chamada de API.
Código de exemplo: chamar o DeepSeek V4-Flash via API compatível com OpenAI
Como muitos provedores de inferência, o DeepSeek V4-Flash 0731 está disponível através de endpoints compatíveis com o formato de API da OpenAI, o que facilita a migração para equipas que já têm integrações existentes. Um exemplo simplificado em Node.js:
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.deepseek.com/v1",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const response = await client.chat.completions.create({
model: "deepseek-v4-flash-0731",
messages: [
{ role: "user", content: "Resume as 3 alterações de preço mais recentes da DeepSeek." }
],
temperature: 0.3,
});
console.log(response.choices[0].message.content);
Note-se que o nome exato do modelo e o endpoint podem variar consoante o provedor de inferência usado (API oficial da DeepSeek, OpenRouter, ou outros agregadores), pelo que vale a pena confirmar sempre a documentação atualizada antes de colocar código em produção.
Previsões: para onde vai o mercado nos próximos meses
Com base na trajetória dos últimos 18 meses e nos dados divulgados em agosto de 2026, há um conjunto de tendências que parecem razoavelmente previsíveis:
- A pressão de preço deve continuar a apertar os modelos fechados. Se o GPT-5.6 Luna e sucessores não reduzirem o custo por tarefa, é provável que percam mais quota em cargas de trabalho sensíveis a custo, como automação em lote e agentes de produção.
- Mais laboratórios chineses devem seguir o modelo de pesos abertos com preços agressivos. O sucesso da DeepSeek e da Moonshot com o Kimi K3 cria um incentivo direto para outros grupos replicarem a estratégia.
- A segurança de agentes vai tornar-se um critério de compra tão importante como o preço. Com ataques de prompt injection a evoluir sem depender de malware tradicional, empresas vão exigir relatórios de segurança comparáveis aos que a Anthropic já publica para o Claude Opus 5.
- Frameworks de agente open source, como o DeepSeek Harness, devem multiplicar-se. A camada de ferramentas à volta dos modelos vai tornar-se um novo campo de batalha competitivo, paralelo à corrida pelos próprios modelos base.
- É provável que a Artificial Analysis e outros avaliadores independentes ganhem mais peso como árbitros neutros num mercado onde cada laboratório divulga os seus próprios números de forma seletiva.
O que isto significa para Portugal e a Europa
Para empresas portuguesas e europeias que avaliam modelos de IA para produção, o momento é particularmente relevante por coincidir com a entrada em vigor da cláusula de transparência do AI Act da União Europeia, a 11 de agosto de 2026. Modelos de pesos abertos como o V4-Flash tendem a facilitar o cumprimento de requisitos de transparência, precisamente por publicarem mais detalhes técnicos do que os concorrentes fechados. Isso pode tornar-se um fator de decisão adicional, para além do preço, em avaliações de fornecedores feitas por equipas de compliance e segurança.
Ao mesmo tempo, o crescimento de projetos nacionais de IA aberta, como o modelo Amália desenvolvido em Portugal, mostra que a lógica de pesos abertos e custo controlado não é exclusiva da Ásia. À medida que mais opções abertas e competitivas surgem, empresas europeias ganham mais alavancagem para negociar preços com os grandes provedores fechados, algo que há um ano parecia impensável.
Perguntas frequentes
O que é o DeepSeek V4-Flash 0731?
É a versão de produção do modelo V4-Flash da DeepSeek, lançada a 31 de julho de 2026 após semanas em pré-visualização. É otimizado para tarefas de agente e execução em terminal, com preço de $0,14 por milhão de tokens de entrada e $0,28 por milhão de saída.
O DeepSeek V4-Flash é mais barato do que o ChatGPT?
Segundo dados da Artificial Analysis, o modelo custa cerca de 60% menos por tarefa do que o GPT-5.6 Luna, mantendo um índice de inteligência apenas um ponto abaixo desse modelo.
O que significa liderar o ranking da OpenRouter?
Significa que, por volume de tokens processados via API na plataforma OpenRouter, o DeepSeek-V4-Flash foi o modelo mais chamado por programadores e empresas na semana de 3 a 9 de agosto de 2026. É um indicador de adoção técnica real, não de utilizadores totais de aplicações de consumo.
O DeepSeek V4-Flash 0731 tem pesos abertos?
Sim, segue o padrão da DeepSeek de disponibilizar pesos abertos para os seus modelos, o que permite a programadores executá-lo localmente ou através de múltiplos provedores de inferência, e não apenas via API oficial da empresa.
O que é o DeepSeek Harness?
É uma framework de agentes com licença MIT, lançada pela DeepSeek a 13 de agosto de 2026, com arquitetura baseada em plugins. Foi lançada junto com ajustes na estrutura de preços do modelo V4-Pro, incluindo tarifas diferenciadas entre horário de pico e fora de pico.
Como se compara o Terminal-Bench de 82,7% do V4-Flash 0731?
Esse resultado supera o do próprio modelo DeepSeek V4-Pro de 1,6 biliões de parâmetros no mesmo benchmark de agente, o que é incomum, já que modelos “flash” costumam ficar atrás dos modelos principais da mesma família em tarefas de raciocínio complexo.
Os modelos chineses vão continuar a dominar o uso via API?
Com 15 semanas consecutivas no topo do ranking da OpenRouter e cerca de metade do volume total de tokens, a tendência parece consolidada a curto prazo, mas depende da resposta em preço dos laboratórios fechados e de eventuais restrições regulatórias em mercados como os EUA e a UE.
É seguro usar o DeepSeek V4-Flash em agentes de produção?
Como qualquer modelo com capacidades de agente, deve ser implementado com permissões limitadas e supervisão humana em ações críticas. A onda recente de ataques de prompt injection via hiperligações pré-preenchidas afeta assistentes de IA de forma geral, não é exclusiva de um modelo específico.
Related Coverage
Leitura relacionada
- Fine-Tuning de LLMs com Hugging Face: 10 Passos [2026]
- Ollama: 178K GitHub Stars, LLMs Locais em 12 Passos [2026]
- Amália: Portugal Cria IA Aberta, 9B Parâmetros, €7M [2026]
- AI Act: Transparência em Vigor na UE, Multas Até 3% [2026]
- API OpenAI em Node.js: Bloqueia Prompt Injection em 10 Passos [2026]
Para mais cobertura sobre modelos de linguagem, benchmarks e o mercado de IA, consulte a secção Inteligência Artificial do shattered.io.




