A Google anunciou, a 30 de setembro de 2026, o Gemini 4 Argon, o primeiro modelo da nova família Gemini 4. O lançamento chega numa altura em que a OpenAI e a Anthropic também renovaram os seus modelos de topo nas últimas semanas: o GPT-6 Astra estreou a 3 de setembro e o Claude Opus 5.5 a 22 de setembro. O Argon soma 77,9% no benchmark DeepSWE v1.1, um recorde na categoria de tarefas longas de engenharia de software, e entra no mercado com um preço inicial de 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de tokens de saída. Koray Kavukcuoglu, vice-presidente sénior da Google DeepMind, apresentou o modelo como uma nova era de inteligência de fronteira da empresa. O acesso, contudo, continua limitado a testadores do programa Fairwind, com a API pública ainda fechada ao público em geral à data desta análise.
O Que Muda Com o Gemini 4 Argon
O Gemini 4 Argon marca a transição da Google da família Gemini 3.x para uma nova geração de modelos. A empresa descreve a capacidade de gerar até 1 milhão de tokens de saída numa única resposta, um valor muito acima do que a maioria dos modelos concorrentes oferece hoje. Essa capacidade destina-se sobretudo a tarefas longas: reescrever bases de código inteiras, gerar relatórios extensos ou processar transcrições de vídeo de longa duração sem cortar o resultado a meio.
Além do DeepSWE v1.1, a Google divulgou resultados noutros três testes: 51,3% no AutomationBench da Zapier, onde reivindica o primeiro lugar, 91,7% no LVBench, um teste de compreensão de vídeo longo, e 68% no CWE-bench v1, que avalia a capacidade de encontrar e corrigir vulnerabilidades de software. A empresa afirma ainda que o Argon lidera, de forma isolada, em 12 dos 18 benchmarks que decidiu publicar. Quem já trabalhou com a Google AI Studio para afinar modelos Gemini vai notar que o fluxo de acesso ao Argon segue, para já, uma lógica fechada e muito diferente da que a Google aplicou a lançamentos anteriores.
Os Números do Lançamento: Preços e Capacidades
O preço é, para já, o argumento mais forte do Argon. A tabela seguinte reúne os valores confirmados para os quatro modelos de fronteira lançados em setembro de 2026.
| Modelo | Entrada (por milhão de tokens) | Saída (por milhão de tokens) | Entrada em cache | Nota |
|---|---|---|---|---|
| Gemini 4 Argon | $2 (introdução), $4 depois | $10 (introdução), $20 depois | $0,10 (95% abaixo) | Até 1M de tokens de saída |
| GPT-6 Astra | $10 | $50 | Não divulgado | Janela de contexto de 1,05M tokens |
| Claude Opus 5.5 | $4 | $20 | Não divulgado | 40% mais barato que o Opus 5 |
| Claude Sonnet 5.5 | $2 | $10 | Não divulgado | Mesmo preço do Sonnet 5, mais de 30% mais rápido |
O valor de lançamento do Argon iguala o preço do Claude Sonnet 5.5, um modelo de camada intermédia, mas com acesso a um modelo que a Google apresenta como de fronteira. Vários analistas citados por fontes do setor já assinalam que esse preço é introdutório e deve subir para 4 e 20 dólares por milhão de tokens numa fase posterior, sem data de transição confirmada. Quem acompanhou o lançamento do GPT-6 Sol e Luna com preços a partir de $0,10 reconhece o padrão: entrar barato, ganhar quota, depois ajustar.
Benchmarks Frente a Frente: Argon, Astra, Opus 5.5 e Sonnet 5.5
Os quatro modelos foram comparados em quatro testes de engenharia de software e automação, segundo dados compilados por páginas especializadas em comparação de modelos. Os valores abaixo vêm de uma única fonte consolidada, para evitar misturar metodologias diferentes.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Sonnet 5.5 |
|---|---|---|---|---|
| DeepSWE v1.1 | 77,9% | 74,1% | 74,2% | 67,4% |
| FrontierSWE v2 | 55,0% | 65,5% | 62,3% | 56,3% |
| Terminal-Bench 4.0 | 57,4% | 58,2% | 66,4% | 57,9% |
| Terminal-Bench Science 0.1 | 57,6% | 68,1% | 63,3% | 52,6% |
Nenhum dos quatro modelos vence em todos os testes. O Argon destaca-se em tarefas de engenharia de software de longa duração, o Astra domina a ciência e a automação de fronteira, e o Opus 5.5 lidera em tarefas de terminal e linha de comandos. Isto contraria a narrativa simplista de “um modelo vence tudo” que costuma acompanhar estes lançamentos.
Onde o Argon Realmente Lidera
No DeepSWE v1.1, o Argon supera o GPT-6 Astra por 3,8 pontos percentuais e o Claude Opus 5.5 por 3,7 pontos. A diferença é pequena, mas suficiente para a Google reivindicar o recorde no teste, que mede desempenho em tarefas reais de engenharia de software com horizonte longo, ou seja, projetos que exigem múltiplos passos encadeados em vez de uma única resposta.
- AutomationBench (Zapier): 51,3%, primeiro lugar entre os modelos testados
- LVBench (vídeo longo): 91,7%, novo recorde na categoria
- CWE-bench v1 (correção de vulnerabilidades): 68%, empatado em primeiro
- Vals Index (trabalho de conhecimento empresarial, incluindo finanças e direito): resultado competitivo face ao Astra
A Google sublinha que o Argon lidera, isoladamente, em 12 dos 18 benchmarks que escolheu divulgar. Vale notar que esta é uma seleção feita pela própria empresa, não um conjunto de testes independentes e auditados por terceiros.
Onde o Argon Fica Para Trás
No FrontierSWE v2, o GPT-6 Astra vence com folga: 65,5% contra 55,0% do Argon, uma diferença de 10,5 pontos percentuais. No Terminal-Bench 4.0, o Claude Opus 5.5 lidera com 66,4%, quase 9 pontos acima do Argon. E no Terminal-Bench Science 0.1, o Astra volta a liderar com 68,1% contra 57,6% do modelo da Google.
O padrão sugere uma especialização por tipo de tarefa em vez de uma superioridade geral. O Argon ganha em engenharia de software de contexto longo e em automação de fluxos de trabalho. O Astra mantém vantagem em ciência aplicada e em tarefas mais abstratas de resolução de problemas. O Opus 5.5 continua a liderar em interação direta com terminal e linha de comandos, um domínio onde a Anthropic já investia há vários ciclos de modelos.
A Guerra de Preços Entra Numa Nova Fase
Segundo uma estimativa da Artificial Analysis citada por meios asiáticos, o custo por tarefa do Argon, usando preços promocionais, fica em 1,99 dólares, cerca de 40% abaixo do GPT-6 Astra na sua variante Max. Esta cifra depende do tipo de tarefa e do volume de tokens consumidos, por isso deve ser lida como uma estimativa de mercado e não como um valor fixo publicado pela Google.
O efeito prático é claro: a Google entra no segmento de modelos de fronteira com um preço que rivaliza com modelos de camada intermédia da concorrência. Isso pressiona a Anthropic e a OpenAI a justificar os preços mais altos do Opus 5.5 e do Astra, sobretudo junto de clientes empresariais que pagam por milhões de tokens processados todos os dias.
Acesso Fechado: o Que é o Programa Fairwind
À data de 1 de outubro de 2026, o Gemini 4 Argon só está disponível para testadores inscritos no programa Fairwind da Google. A API pública continua fechada, o que significa que programadores fora desse grupo restrito ainda não conseguem integrar o modelo nas suas aplicações.
Este tipo de lançamento faseado tornou-se comum entre os grandes laboratórios de IA em 2026. Permite recolher dados de utilização real antes de abrir a torneira a milhões de utilizadores, mas também cria um período de ambiguidade em que os números de desempenho divulgados pela empresa ainda não foram testados à escala por clientes externos.
Da Gemini 3.8 Flash à Gemini 4: o Percurso da Google
O Argon chega apenas 28 dias depois da Google ter lançado o Gemini 3.8 Flash e o Gemini 3.8 Flash Cyber, a 2 de setembro de 2026. Essa geração focou-se em custo reduzido e em casos de uso de segurança, enquanto o Argon assume agora o papel de modelo de fronteira generalista, destinado a competir diretamente com os produtos mais caros da OpenAI e da Anthropic.
O salto de nome, de Gemini 3.x para Gemini 4, reflete também uma mudança de estratégia de comunicação. Em vez de incrementos graduais dentro da mesma geração, a Google optou por marcar o Argon como o início de uma nova fase, algo que facilita a comparação direta com os números redondos usados pela OpenAI (GPT-6) e pela Anthropic (Claude 5.5).
Setembro: o Mês dos Quatro Modelos de Fronteira
Em apenas 28 dias, os três maiores laboratórios de IA lançaram quatro modelos de topo: o GPT-6 Astra a 3 de setembro, o Claude Opus 5.5 a 22 de setembro, o Claude Sonnet 5.5 a 28 de setembro e agora o Gemini 4 Argon a 30 de setembro. Este ritmo de lançamentos consecutivos tem gerado o que vários meios já descrevem como fadiga no setor, com clientes empresariais a terem cada vez menos tempo para avaliar um modelo antes do próximo chegar.
Para equipas de engenharia, o calendário apertado significa decisões de compra mais rápidas e menos criteriosas, muitas vezes baseadas em benchmarks isolados divulgados pelos próprios fabricantes, em vez de testes internos completos.
Reação dos Mercados e de Wall Street
As ações da Alphabet subiram na sessão seguinte ao anúncio do Argon, segundo relatos do setor, ainda que sem uma percentagem exata confirmada em fontes financeiras independentes. A leitura mais defensável é que o mercado recebeu bem o posicionamento de preço agressivo do Argon, mas é prematuro isolar esse movimento de outros fatores que também influenciam o valor das ações da tecnológica num dado dia.
O que fica claro é que investidores continuam a tratar cada lançamento de modelo de fronteira como um evento relevante para a avaliação das empresas de IA, um padrão que se repetiu com o Astra em setembro e com o Opus 5.5 poucas semanas antes.
Google vs OpenAI vs Anthropic: o Panorama Competitivo
Olhando ao conjunto dos dados, a Google aposta no preço e na capacidade de saída longa para conquistar clientes que processam grandes volumes de código ou de texto. A OpenAI mantém o Astra como o modelo mais caro, mas também o mais forte em ciência e em tarefas abstratas, o que justifica o posicionamento como ferramenta de uso de computador avançado. A Anthropic, por sua vez, consolida o Opus 5.5 como referência em tarefas de terminal, um nicho técnico valioso para equipas de infraestrutura e DevOps.
Nenhuma das três empresas domina todas as frentes, o que deixa espaço para que clientes empresariais combinem modelos diferentes consoante a tarefa, uma estratégia já comum entre equipas que usam ferramentas de encaminhamento multi-modelo para alternar entre fornecedores sem reescrever código.
O Impacto Para Programadores e Equipas de Engenharia
Segundo o Inquérito a Programadores 2025 da Stack Overflow, 84% dos inquiridos já usam ou planeiam usar ferramentas de IA no processo de desenvolvimento, um salto face aos 76% registados em 2024. O mesmo inquérito mostra que 51% dos programadores profissionais usam ferramentas de IA diariamente.
Ao mesmo tempo, a confiança na precisão dessas ferramentas caiu: 46% dos programadores afirmam não confiar na exatidão dos resultados gerados por IA em 2025, contra 31% em 2024, de acordo com dados divulgados pela Stack Overflow. Este aumento de ceticismo surge precisamente quando os fabricantes publicam benchmarks cada vez mais específicos, como o DeepSWE v1.1, para tentar provar ganhos reais de desempenho.
Entre quem já usa agentes de IA no trabalho, 31% dos programadores dizem utilizá-los atualmente, e 69% dos que experimentaram agentes relatam um aumento de produtividade. São números que ajudam a explicar por que motivo benchmarks como o DeepSWE e o AutomationBench, ambos centrados em tarefas longas e em automação, se tornaram a nova linha de frente da disputa entre modelos.
Segurança: o Caso do CWE-bench e a Deteção de Vulnerabilidades
O resultado de 68% do Argon no CWE-bench v1, empatado em primeiro lugar, merece atenção à parte. Este benchmark mede a capacidade de um modelo encontrar e corrigir vulnerabilidades de software catalogadas segundo a taxonomia CWE (Common Weakness Enumeration), uma referência citada em relatórios de segurança que acompanham de perto este tipo de lançamento.
Para equipas de segurança, um modelo capaz de identificar e corrigir falhas de código automaticamente representa tanto uma oportunidade como um risco. A oportunidade está em reduzir o tempo entre a descoberta de uma vulnerabilidade e a correção em produção. O risco está em confiar demasiado cedo num sistema ainda em fase de testes fechados, sem validação independente alargada.
Críticas e Limitações do Lançamento
O lançamento do Argon não escapa a críticas. A primeira prende-se com o desempenho desigual: o modelo lidera em alguns testes, mas fica claramente atrás do Astra e do Opus 5.5 noutros, o que contraria a mensagem de liderança generalizada sugerida pela Google. A segunda crítica é o acesso limitado, já que o modelo só está disponível para testadores do Fairwind, deixando a maioria dos programadores sem forma de validar os números de forma independente.
A terceira limitação é a incerteza sobre o preço final. O valor introdutório de $2 e $10 por milhão de tokens pode subir para $4 e $20 numa fase posterior, sem data de transição anunciada, o que dificulta o planeamento orçamental de equipas que queiram adotar o modelo a longo prazo. Por fim, a Google não especificou com clareza o tamanho total da janela de contexto do Argon, divulgando apenas a capacidade de saída de 1 milhão de tokens, que é uma métrica diferente.
O Que Esperar Nos Próximos Meses
- Expansão gradual do acesso: é provável que a Google abra a API pública do Argon nas próximas semanas, seguindo o padrão de lançamentos faseados usado em modelos anteriores.
- Subida de preço confirmada: os relatos de uma transição para $4 e $20 por milhão de tokens devem materializar-se antes do final de 2026, uma vez que o valor introdutório dificilmente é sustentável a longo prazo.
- Resposta da OpenAI e da Anthropic: com o Astra e o Opus 5.5 já no mercado há várias semanas, é expectável que surjam atualizações menores ou ajustes de preço como resposta direta ao Argon.
- Benchmarks independentes: organizações terceiras devem publicar as suas próprias avaliações do Argon nos próximos meses, o que pode confirmar ou contrariar os números divulgados pela Google.
- Consolidação do uso combinado de modelos: mais equipas de engenharia devem adotar estratégias que combinam vários modelos consoante a tarefa, em vez de escolher um único fornecedor fixo.
Perguntas Frequentes
O que é o Gemini 4 Argon?
É o primeiro modelo da nova família Gemini 4 da Google, anunciado a 30 de setembro de 2026 como sucessor da linha Gemini 3.x, com foco em tarefas longas de engenharia de software e automação.
Quando foi lançado o Gemini 4 Argon?
O anúncio oficial aconteceu a 30 de setembro de 2026, através do blog da Google, apresentado pelo vice-presidente sénior da Google DeepMind, Koray Kavukcuoglu.
Quanto custa usar o Gemini 4 Argon?
O preço introdutório é de $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída, com entrada em cache a $0,10. A Google sinalizou que este valor pode subir para $4 e $20 numa fase posterior.
O Gemini 4 Argon é melhor que o GPT-6 Astra?
Depende da tarefa. O Argon vence no DeepSWE v1.1, mas o Astra lidera no FrontierSWE v2 e no Terminal-Bench Science 0.1. Nenhum dos dois modelos domina todos os benchmarks publicados.
Como se compara ao Claude Opus 5.5?
O Opus 5.5 lidera claramente no Terminal-Bench 4.0, com 66,4% contra 57,4% do Argon, mas fica atrás no DeepSWE v1.1, onde o Argon soma 77,9% contra 74,2% do modelo da Anthropic.
Já posso usar o Gemini 4 Argon?
Não de forma aberta. À data de 1 de outubro de 2026, o acesso está limitado a testadores inscritos no programa Fairwind da Google, com a API pública ainda fechada.
O que é o programa Fairwind?
É o grupo restrito de testadores que a Google usa para validar modelos antes de os disponibilizar publicamente através da API e de produtos como o Google AI Studio ou a Vertex AI.
O preço de lançamento do Argon é definitivo?
Não. Vários relatos do setor indicam que o valor introdutório de $2 e $10 por milhão de tokens deve subir para $4 e $20 assim que o modelo sair da fase de testes fechados, embora a Google não tenha confirmado uma data exata para essa alteração.




