A Google anunciou, a 30 de setembro de 2026, o Gemini 4 Argon, o primeiro modelo da nova família Gemini 4. O lançamento chega numa altura em que a OpenAI e a Anthropic também renovaram os seus modelos de topo nas últimas semanas: o GPT-6 Astra estreou a 3 de setembro e o Claude Opus 5.5 a 22 de setembro. O Argon soma 77,9% no benchmark DeepSWE v1.1, um recorde na categoria de tarefas longas de engenharia de software, e entra no mercado com um preço inicial de 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de tokens de saída. Koray Kavukcuoglu, vice-presidente sénior da Google DeepMind, apresentou o modelo como uma nova era de inteligência de fronteira da empresa. O acesso, contudo, continua limitado a testadores do programa Fairwind, com a API pública ainda fechada ao público em geral à data desta análise.

O Que Muda Com o Gemini 4 Argon

O Gemini 4 Argon marca a transição da Google da família Gemini 3.x para uma nova geração de modelos. A empresa descreve a capacidade de gerar até 1 milhão de tokens de saída numa única resposta, um valor muito acima do que a maioria dos modelos concorrentes oferece hoje. Essa capacidade destina-se sobretudo a tarefas longas: reescrever bases de código inteiras, gerar relatórios extensos ou processar transcrições de vídeo de longa duração sem cortar o resultado a meio.

Além do DeepSWE v1.1, a Google divulgou resultados noutros três testes: 51,3% no AutomationBench da Zapier, onde reivindica o primeiro lugar, 91,7% no LVBench, um teste de compreensão de vídeo longo, e 68% no CWE-bench v1, que avalia a capacidade de encontrar e corrigir vulnerabilidades de software. A empresa afirma ainda que o Argon lidera, de forma isolada, em 12 dos 18 benchmarks que decidiu publicar. Quem já trabalhou com a Google AI Studio para afinar modelos Gemini vai notar que o fluxo de acesso ao Argon segue, para já, uma lógica fechada e muito diferente da que a Google aplicou a lançamentos anteriores.

Os Números do Lançamento: Preços e Capacidades

O preço é, para já, o argumento mais forte do Argon. A tabela seguinte reúne os valores confirmados para os quatro modelos de fronteira lançados em setembro de 2026.

ModeloEntrada (por milhão de tokens)Saída (por milhão de tokens)Entrada em cacheNota
Gemini 4 Argon$2 (introdução), $4 depois$10 (introdução), $20 depois$0,10 (95% abaixo)Até 1M de tokens de saída
GPT-6 Astra$10$50Não divulgadoJanela de contexto de 1,05M tokens
Claude Opus 5.5$4$20Não divulgado40% mais barato que o Opus 5
Claude Sonnet 5.5$2$10Não divulgadoMesmo preço do Sonnet 5, mais de 30% mais rápido

O valor de lançamento do Argon iguala o preço do Claude Sonnet 5.5, um modelo de camada intermédia, mas com acesso a um modelo que a Google apresenta como de fronteira. Vários analistas citados por fontes do setor já assinalam que esse preço é introdutório e deve subir para 4 e 20 dólares por milhão de tokens numa fase posterior, sem data de transição confirmada. Quem acompanhou o lançamento do GPT-6 Sol e Luna com preços a partir de $0,10 reconhece o padrão: entrar barato, ganhar quota, depois ajustar.

Benchmarks Frente a Frente: Argon, Astra, Opus 5.5 e Sonnet 5.5

Os quatro modelos foram comparados em quatro testes de engenharia de software e automação, segundo dados compilados por páginas especializadas em comparação de modelos. Os valores abaixo vêm de uma única fonte consolidada, para evitar misturar metodologias diferentes.

BenchmarkGemini 4 ArgonGPT-6 AstraClaude Opus 5.5Claude Sonnet 5.5
DeepSWE v1.177,9%74,1%74,2%67,4%
FrontierSWE v255,0%65,5%62,3%56,3%
Terminal-Bench 4.057,4%58,2%66,4%57,9%
Terminal-Bench Science 0.157,6%68,1%63,3%52,6%

Nenhum dos quatro modelos vence em todos os testes. O Argon destaca-se em tarefas de engenharia de software de longa duração, o Astra domina a ciência e a automação de fronteira, e o Opus 5.5 lidera em tarefas de terminal e linha de comandos. Isto contraria a narrativa simplista de “um modelo vence tudo” que costuma acompanhar estes lançamentos.

Onde o Argon Realmente Lidera

No DeepSWE v1.1, o Argon supera o GPT-6 Astra por 3,8 pontos percentuais e o Claude Opus 5.5 por 3,7 pontos. A diferença é pequena, mas suficiente para a Google reivindicar o recorde no teste, que mede desempenho em tarefas reais de engenharia de software com horizonte longo, ou seja, projetos que exigem múltiplos passos encadeados em vez de uma única resposta.

  • AutomationBench (Zapier): 51,3%, primeiro lugar entre os modelos testados
  • LVBench (vídeo longo): 91,7%, novo recorde na categoria
  • CWE-bench v1 (correção de vulnerabilidades): 68%, empatado em primeiro
  • Vals Index (trabalho de conhecimento empresarial, incluindo finanças e direito): resultado competitivo face ao Astra

A Google sublinha que o Argon lidera, isoladamente, em 12 dos 18 benchmarks que escolheu divulgar. Vale notar que esta é uma seleção feita pela própria empresa, não um conjunto de testes independentes e auditados por terceiros.

Onde o Argon Fica Para Trás

No FrontierSWE v2, o GPT-6 Astra vence com folga: 65,5% contra 55,0% do Argon, uma diferença de 10,5 pontos percentuais. No Terminal-Bench 4.0, o Claude Opus 5.5 lidera com 66,4%, quase 9 pontos acima do Argon. E no Terminal-Bench Science 0.1, o Astra volta a liderar com 68,1% contra 57,6% do modelo da Google.

O padrão sugere uma especialização por tipo de tarefa em vez de uma superioridade geral. O Argon ganha em engenharia de software de contexto longo e em automação de fluxos de trabalho. O Astra mantém vantagem em ciência aplicada e em tarefas mais abstratas de resolução de problemas. O Opus 5.5 continua a liderar em interação direta com terminal e linha de comandos, um domínio onde a Anthropic já investia há vários ciclos de modelos.

A Guerra de Preços Entra Numa Nova Fase

Segundo uma estimativa da Artificial Analysis citada por meios asiáticos, o custo por tarefa do Argon, usando preços promocionais, fica em 1,99 dólares, cerca de 40% abaixo do GPT-6 Astra na sua variante Max. Esta cifra depende do tipo de tarefa e do volume de tokens consumidos, por isso deve ser lida como uma estimativa de mercado e não como um valor fixo publicado pela Google.

O efeito prático é claro: a Google entra no segmento de modelos de fronteira com um preço que rivaliza com modelos de camada intermédia da concorrência. Isso pressiona a Anthropic e a OpenAI a justificar os preços mais altos do Opus 5.5 e do Astra, sobretudo junto de clientes empresariais que pagam por milhões de tokens processados todos os dias.

Acesso Fechado: o Que é o Programa Fairwind

À data de 1 de outubro de 2026, o Gemini 4 Argon só está disponível para testadores inscritos no programa Fairwind da Google. A API pública continua fechada, o que significa que programadores fora desse grupo restrito ainda não conseguem integrar o modelo nas suas aplicações.

Este tipo de lançamento faseado tornou-se comum entre os grandes laboratórios de IA em 2026. Permite recolher dados de utilização real antes de abrir a torneira a milhões de utilizadores, mas também cria um período de ambiguidade em que os números de desempenho divulgados pela empresa ainda não foram testados à escala por clientes externos.

Da Gemini 3.8 Flash à Gemini 4: o Percurso da Google

O Argon chega apenas 28 dias depois da Google ter lançado o Gemini 3.8 Flash e o Gemini 3.8 Flash Cyber, a 2 de setembro de 2026. Essa geração focou-se em custo reduzido e em casos de uso de segurança, enquanto o Argon assume agora o papel de modelo de fronteira generalista, destinado a competir diretamente com os produtos mais caros da OpenAI e da Anthropic.

O salto de nome, de Gemini 3.x para Gemini 4, reflete também uma mudança de estratégia de comunicação. Em vez de incrementos graduais dentro da mesma geração, a Google optou por marcar o Argon como o início de uma nova fase, algo que facilita a comparação direta com os números redondos usados pela OpenAI (GPT-6) e pela Anthropic (Claude 5.5).

Setembro: o Mês dos Quatro Modelos de Fronteira

Em apenas 28 dias, os três maiores laboratórios de IA lançaram quatro modelos de topo: o GPT-6 Astra a 3 de setembro, o Claude Opus 5.5 a 22 de setembro, o Claude Sonnet 5.5 a 28 de setembro e agora o Gemini 4 Argon a 30 de setembro. Este ritmo de lançamentos consecutivos tem gerado o que vários meios já descrevem como fadiga no setor, com clientes empresariais a terem cada vez menos tempo para avaliar um modelo antes do próximo chegar.

Para equipas de engenharia, o calendário apertado significa decisões de compra mais rápidas e menos criteriosas, muitas vezes baseadas em benchmarks isolados divulgados pelos próprios fabricantes, em vez de testes internos completos.

Reação dos Mercados e de Wall Street

As ações da Alphabet subiram na sessão seguinte ao anúncio do Argon, segundo relatos do setor, ainda que sem uma percentagem exata confirmada em fontes financeiras independentes. A leitura mais defensável é que o mercado recebeu bem o posicionamento de preço agressivo do Argon, mas é prematuro isolar esse movimento de outros fatores que também influenciam o valor das ações da tecnológica num dado dia.

O que fica claro é que investidores continuam a tratar cada lançamento de modelo de fronteira como um evento relevante para a avaliação das empresas de IA, um padrão que se repetiu com o Astra em setembro e com o Opus 5.5 poucas semanas antes.

Google vs OpenAI vs Anthropic: o Panorama Competitivo

Olhando ao conjunto dos dados, a Google aposta no preço e na capacidade de saída longa para conquistar clientes que processam grandes volumes de código ou de texto. A OpenAI mantém o Astra como o modelo mais caro, mas também o mais forte em ciência e em tarefas abstratas, o que justifica o posicionamento como ferramenta de uso de computador avançado. A Anthropic, por sua vez, consolida o Opus 5.5 como referência em tarefas de terminal, um nicho técnico valioso para equipas de infraestrutura e DevOps.

Nenhuma das três empresas domina todas as frentes, o que deixa espaço para que clientes empresariais combinem modelos diferentes consoante a tarefa, uma estratégia já comum entre equipas que usam ferramentas de encaminhamento multi-modelo para alternar entre fornecedores sem reescrever código.

O Impacto Para Programadores e Equipas de Engenharia

Segundo o Inquérito a Programadores 2025 da Stack Overflow, 84% dos inquiridos já usam ou planeiam usar ferramentas de IA no processo de desenvolvimento, um salto face aos 76% registados em 2024. O mesmo inquérito mostra que 51% dos programadores profissionais usam ferramentas de IA diariamente.

Ao mesmo tempo, a confiança na precisão dessas ferramentas caiu: 46% dos programadores afirmam não confiar na exatidão dos resultados gerados por IA em 2025, contra 31% em 2024, de acordo com dados divulgados pela Stack Overflow. Este aumento de ceticismo surge precisamente quando os fabricantes publicam benchmarks cada vez mais específicos, como o DeepSWE v1.1, para tentar provar ganhos reais de desempenho.

Entre quem já usa agentes de IA no trabalho, 31% dos programadores dizem utilizá-los atualmente, e 69% dos que experimentaram agentes relatam um aumento de produtividade. São números que ajudam a explicar por que motivo benchmarks como o DeepSWE e o AutomationBench, ambos centrados em tarefas longas e em automação, se tornaram a nova linha de frente da disputa entre modelos.

Segurança: o Caso do CWE-bench e a Deteção de Vulnerabilidades

O resultado de 68% do Argon no CWE-bench v1, empatado em primeiro lugar, merece atenção à parte. Este benchmark mede a capacidade de um modelo encontrar e corrigir vulnerabilidades de software catalogadas segundo a taxonomia CWE (Common Weakness Enumeration), uma referência citada em relatórios de segurança que acompanham de perto este tipo de lançamento.

Para equipas de segurança, um modelo capaz de identificar e corrigir falhas de código automaticamente representa tanto uma oportunidade como um risco. A oportunidade está em reduzir o tempo entre a descoberta de uma vulnerabilidade e a correção em produção. O risco está em confiar demasiado cedo num sistema ainda em fase de testes fechados, sem validação independente alargada.

Críticas e Limitações do Lançamento

O lançamento do Argon não escapa a críticas. A primeira prende-se com o desempenho desigual: o modelo lidera em alguns testes, mas fica claramente atrás do Astra e do Opus 5.5 noutros, o que contraria a mensagem de liderança generalizada sugerida pela Google. A segunda crítica é o acesso limitado, já que o modelo só está disponível para testadores do Fairwind, deixando a maioria dos programadores sem forma de validar os números de forma independente.

A terceira limitação é a incerteza sobre o preço final. O valor introdutório de $2 e $10 por milhão de tokens pode subir para $4 e $20 numa fase posterior, sem data de transição anunciada, o que dificulta o planeamento orçamental de equipas que queiram adotar o modelo a longo prazo. Por fim, a Google não especificou com clareza o tamanho total da janela de contexto do Argon, divulgando apenas a capacidade de saída de 1 milhão de tokens, que é uma métrica diferente.

O Que Esperar Nos Próximos Meses

  • Expansão gradual do acesso: é provável que a Google abra a API pública do Argon nas próximas semanas, seguindo o padrão de lançamentos faseados usado em modelos anteriores.
  • Subida de preço confirmada: os relatos de uma transição para $4 e $20 por milhão de tokens devem materializar-se antes do final de 2026, uma vez que o valor introdutório dificilmente é sustentável a longo prazo.
  • Resposta da OpenAI e da Anthropic: com o Astra e o Opus 5.5 já no mercado há várias semanas, é expectável que surjam atualizações menores ou ajustes de preço como resposta direta ao Argon.
  • Benchmarks independentes: organizações terceiras devem publicar as suas próprias avaliações do Argon nos próximos meses, o que pode confirmar ou contrariar os números divulgados pela Google.
  • Consolidação do uso combinado de modelos: mais equipas de engenharia devem adotar estratégias que combinam vários modelos consoante a tarefa, em vez de escolher um único fornecedor fixo.

Perguntas Frequentes

O que é o Gemini 4 Argon?

É o primeiro modelo da nova família Gemini 4 da Google, anunciado a 30 de setembro de 2026 como sucessor da linha Gemini 3.x, com foco em tarefas longas de engenharia de software e automação.

Quando foi lançado o Gemini 4 Argon?

O anúncio oficial aconteceu a 30 de setembro de 2026, através do blog da Google, apresentado pelo vice-presidente sénior da Google DeepMind, Koray Kavukcuoglu.

Quanto custa usar o Gemini 4 Argon?

O preço introdutório é de $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída, com entrada em cache a $0,10. A Google sinalizou que este valor pode subir para $4 e $20 numa fase posterior.

O Gemini 4 Argon é melhor que o GPT-6 Astra?

Depende da tarefa. O Argon vence no DeepSWE v1.1, mas o Astra lidera no FrontierSWE v2 e no Terminal-Bench Science 0.1. Nenhum dos dois modelos domina todos os benchmarks publicados.

Como se compara ao Claude Opus 5.5?

O Opus 5.5 lidera claramente no Terminal-Bench 4.0, com 66,4% contra 57,4% do Argon, mas fica atrás no DeepSWE v1.1, onde o Argon soma 77,9% contra 74,2% do modelo da Anthropic.

Já posso usar o Gemini 4 Argon?

Não de forma aberta. À data de 1 de outubro de 2026, o acesso está limitado a testadores inscritos no programa Fairwind da Google, com a API pública ainda fechada.

O que é o programa Fairwind?

É o grupo restrito de testadores que a Google usa para validar modelos antes de os disponibilizar publicamente através da API e de produtos como o Google AI Studio ou a Vertex AI.

O preço de lançamento do Argon é definitivo?

Não. Vários relatos do setor indicam que o valor introdutório de $2 e $10 por milhão de tokens deve subir para $4 e $20 assim que o modelo sair da fase de testes fechados, embora a Google não tenha confirmado uma data exata para essa alteração.