A 22 de setembro de 2026, a OpenAI e a Anthropic lançaram, praticamente na mesma semana, três modelos que mudam a forma como o preço da IA generativa está a ser calculado. O GPT-6 Sol e o GPT-6 Luna chegaram como variantes económicas do GPT-6, com o Luna a cobrar apenas $0,10 por milhão de tokens de entrada. Horas depois, a Anthropic respondeu com o Claude Opus 5.5, prometendo o desempenho da linha Fable 5.1 a um custo 40% inferior ao do Opus 5. O resultado é uma guerra de preços que está a redesenhar o mercado de modelos de linguagem em poucas semanas.
Esta não é uma simples atualização de catálogo. É a segunda vez em três semanas que a OpenAI lança modelos novos, depois do GPT-6 Astra ter estreado a 3 de setembro como modelo “computer-use”. Juntando a isso o DeepSeek V4.1 Flash, o Gemini 3.8 Flash e o GLM-5.3 da Z.ai, setembro de 2026 tornou-se o mês com mais lançamentos de modelos frontier num único ciclo desde o início da corrida à IA generativa. Para programadores, empresas e utilizadores em Portugal que pagam por tokens em euros convertidos de dólares, a pergunta já não é qual modelo é mais inteligente, mas qual é o que compensa financeiramente.
O que são o GPT-6 Sol e o GPT-6 Luna
O GPT-6 Sol e o GPT-6 Luna substituem as antigas variantes GPT-5.6 Sol e GPT-5.6 Luna, seguindo a mesma lógica de segmentação que a OpenAI já usava: um modelo intermédio e um modelo de entrada, ambos treinados com métodos semelhantes aos do GPT-6 Astra, mas sem o foco em automação de computador que tornou o Astra mais caro. O GPT-6 Sol está avaliado em cerca de $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída. O GPT-6 Luna desce drasticamente para $0,10 por milhão de tokens de entrada e $0,50 por milhão de saída, tornando-se um dos modelos mais baratos alguma vez lançados pela OpenAI com a etiqueta “GPT-6”.
Ambos os modelos oferecem uma janela de contexto de 1,05 milhões de tokens, o que permite processar documentos extensos, bases de código completas ou históricos de conversa longos sem necessidade de resumir ou fragmentar o conteúdo. É um salto relevante face à geração anterior e coloca os dois modelos ao nível dos concorrentes chineses em capacidade de contexto, ainda que a preços diferentes consoante o volume de utilização.
A decisão da OpenAI de lançar duas variantes económicas em simultâneo, e não apenas uma, sugere uma estratégia de segmentação mais agressiva do que em ciclos anteriores. O Sol fica posicionado para tarefas que exigem alguma capacidade de raciocínio a um custo controlado, enquanto o Luna é claramente pensado para volume: chatbots de apoio ao cliente, classificação de texto em massa ou pipelines onde o custo por chamada pesa mais do que a qualidade máxima de resposta.
Claude Opus 5.5: a resposta da Anthropic em horas
A Anthropic não deixou o anúncio da OpenAI sem resposta. No mesmo dia, 22 de setembro, lançou o Claude Opus 5.5, a mais recente geração da linha Opus, com preços de $4 por milhão de tokens de entrada e $20 por milhão de saída. É mais caro do que o GPT-6 Sol, mas a Anthropic posiciona o Opus 5.5 como um substituto direto do Opus 5, com desempenho equiparável ao da linha Fable 5.1 a um custo 40% inferior ao do modelo anterior.
O Opus 5.5 mantém uma janela de contexto de 1 milhão de tokens, ligeiramente abaixo dos 1,05 milhões do GPT-6 Sol e Luna, mas segue a mesma tendência do setor: contexto quase ilimitado para uso prático, com o preço a tornar-se o fator diferenciador real. A estratégia da Anthropic difere da OpenAI num ponto central: em vez de lançar uma variante barata separada, optou por baixar o custo do próprio topo de gama, mantendo o posicionamento premium da marca Opus mas tornando-a mais acessível.
Esta abordagem tem consequências práticas para quem gere orçamentos de infraestrutura de IA. Uma equipa que já usava o Opus 5 para tarefas de raciocínio complexo pode migrar para o Opus 5.5 sem alterar a arquitetura da aplicação, apenas trocando o identificador do modelo, e reduzir a fatura mensal em cerca de 40% mantendo a qualidade de resposta.
Tabela comparativa de preços dos modelos lançados em setembro
A tabela seguinte junta os modelos frontier lançados nas últimas três semanas, com preços por milhão de tokens e janela de contexto, para facilitar a comparação direta entre a oferta da OpenAI, da Anthropic e dos principais concorrentes.
| Modelo | Empresa | Data de lançamento | Preço entrada (por milhão) | Preço saída (por milhão) | Contexto |
|---|---|---|---|---|---|
| GPT-6 Luna | OpenAI | 22 set. 2026 | $0,10 | $0,50 | 1,05M tokens |
| GPT-6 Sol | OpenAI | 22 set. 2026 | $2,00 | $10,00 | 1,05M tokens |
| Claude Opus 5.5 | Anthropic | 22 set. 2026 | $4,00 | $20,00 | 1M tokens |
| GPT-6 Astra | OpenAI | 3 set. 2026 | Preço premium (computer-use) | Preço premium | 1,05M tokens |
| DeepSeek V4.1 Flash | DeepSeek | 10 set. 2026 | Pesos abertos | Pesos abertos | Contexto alargado |
| GLM-5.3 Flash | Z.ai | 26 ago. 2026 | $0,015 | $0,025 | 1M tokens |
Os valores mostram uma disparidade grande dentro da própria OpenAI: o GPT-6 Luna custa 20 vezes menos por token de entrada do que o GPT-6 Sol. Já o Claude Opus 5.5, apesar de ser o mais caro da lista entre os modelos proprietários analisados, continua a ser mais barato do que o antecessor Opus 5, o que reforça a ideia de que toda a indústria está a empurrar os preços para baixo, mesmo nos modelos de topo.
Contexto histórico: da corrida à inteligência à corrida ao preço
Até há cerca de 18 meses, o principal argumento de venda dos grandes modelos de linguagem era a pontuação em benchmarks como o MMLU ou o SWE-bench. A partir de 2025, com a chegada de modelos abertos competitivos da China, como as várias gerações do DeepSeek e do Qwen, essa lógica começou a mudar. Quando o DeepSeek V4-Pro atingiu 80,6% no SWE-bench Verified, a apenas 0,2 pontos do Claude Opus 4.6, sob licença MIT e gratuita para uso comercial, os laboratórios ocidentais perceberam que já não bastava ser o modelo mais inteligente. Era preciso também ser competitivo em custo.
O ano de 2026 tornou-se, por isso, o ano em que o preço por token passou a ser tão notícia como a pontuação em benchmarks. A OpenAI já tinha testado esta estratégia com o GPT-5.6 Sol e Luna, mas o salto para o GPT-6 acelerou o ritmo: em vez de esperar meses entre gerações, a empresa lançou o Astra a 3 de setembro e, apenas 19 dias depois, já tinha duas variantes económicas prontas. Este ritmo de lançamento, quase semanal em setembro, é inédito mesmo para os padrões acelerados da indústria de IA.
DeepSeek V4.1 Flash: a pressão dos modelos abertos continua
Enquanto a OpenAI e a Anthropic disputam o mercado de modelos fechados, a DeepSeek continua a pressionar pelo lado dos pesos abertos. O DeepSeek V4.1 Flash, lançado a 10 de setembro, tem 552 mil milhões de parâmetros totais, com cerca de 8 mil milhões de parâmetros ativos na entrada e 16 mil milhões na saída, seguindo a arquitetura de mistura de especialistas (MoE) que reduz o custo computacional por consulta. A nova versão inclui também capacidades nativas de visão, algo que a geração anterior, o DeepSeek V4 Flash, não tinha, e que já foi retirada de produção após a chegada da V4.1.
Para uma equipa de programação em Lisboa ou no Porto que já usa o DeepSeek via API própria ou através de fornecedores como o OpenRouter, esta atualização confirma um padrão: os modelos abertos chineses continuam a lançar-se em ciclos mais curtos do que os laboratórios ocidentais, e a manter preços muito abaixo dos concorrentes proprietários, mesmo quando as capacidades técnicas, como a janela de contexto ou o suporte a visão, já rivalizam com o topo de gama da OpenAI e da Anthropic.
Gemini 3.8 Flash e a resposta da Google ao mesmo ciclo
A Google também entrou nesta ronda de lançamentos, ainda que mais cedo no mês. O Gemini 3.8 Flash e a variante Gemini 3.8 Flash Cyber, focada em segurança, chegaram a 2 de setembro. Ao contrário da OpenAI, a Google não lançou uma resposta direta ao GPT-6 Sol e Luna na mesma semana, o que levanta a questão de saber se vai reagir com uma atualização de preços do Gemini nas próximas semanas ou se vai manter a estratégia atual, mais focada em integração com a suite de produtos empresariais da empresa.
Este posicionamento mais lento da Google contrasta com o ritmo da OpenAI e da Anthropic, mas não significa que a empresa esteja a perder terreno. A Google continua a beneficiar da integração profunda com o Google Cloud e com produtos como o Workspace, o que lhe dá uma vantagem de distribuição que os concorrentes ainda não conseguiram replicar por completo, mesmo quando os preços por token da Google não são os mais baixos do mercado.
GLM-5.3 e a estratégia chinesa de código aberto
A Z.ai (antiga Zhipu AI) lançou o GLM-5.3 a 14 de agosto, com 753 mil milhões de parâmetros totais e 40 mil milhões ativos numa arquitetura MoE, janela de contexto de 1 milhão de tokens e uma licença própria. Duas semanas depois, a 26 de agosto, chegou o GLM-5.3 Flash, uma versão mais pequena com 320 mil milhões de parâmetros totais e 18 mil milhões ativos, desta vez sob licença MIT, totalmente aberta para uso comercial. Os preços do GLM-5.3 Flash, cerca de $0,015 por milhão de tokens de entrada e $0,025 por milhão de saída, tornam-no um dos modelos mais baratos entre os analisados neste artigo, mesmo abaixo do GPT-6 Luna.
Segundo dados do levantamento da Gradually AI sobre modelos de código aberto, o GLM-5.3 pontua 49 no Índice de Inteligência da Artificial Analysis, uma métrica que combina vários benchmarks para dar uma classificação única de capacidade. Este valor coloca o modelo chinês num patamar competitivo com modelos proprietários ocidentais de gerações anteriores, a uma fração do custo.
Tabela técnica: parâmetros, licenças e arquitetura
Para além do preço, a arquitetura interna de cada modelo ajuda a explicar porque é que uns são mais baratos do que outros. A tabela seguinte resume os dados disponíveis sobre parâmetros e licenciamento dos modelos abertos lançados em setembro e agosto de 2026.
| Modelo | Parâmetros totais | Parâmetros ativos | Licença | Visão nativa |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | 552 mil milhões | ~8B entrada / 16B saída | Pesos abertos | Sim |
| GLM-5.3 | 753 mil milhões | 40 mil milhões | Licença própria Z.ai | Não confirmado |
| GLM-5.3 Flash | 320 mil milhões | 18 mil milhões | MIT | Não confirmado |
| Qwen3.8-27B | 27,8 mil milhões | Modelo denso | Apache 2.0 | Não |
A diferença entre parâmetros totais e parâmetros ativos é o que torna os modelos MoE (mistura de especialistas) mais baratos de correr do que o número total de parâmetros sugeriria. O DeepSeek V4.1 Flash tem 552 mil milhões de parâmetros no total, mas ativa apenas uma fração desse número por token processado, o que reduz drasticamente o custo computacional face a um modelo denso do mesmo tamanho, como é o caso do Qwen3.8-27B, que ativa todos os seus 27,8 mil milhões de parâmetros em cada inferência.
Impacto direto para programadores e empresas portuguesas
Para uma startup ou uma equipa de engenharia em Portugal, esta descida de preços tem impacto imediato no orçamento mensal de infraestrutura de IA. Uma aplicação que processa, por exemplo, 50 milhões de tokens de entrada por mês pagaria cerca de $100 usando o GPT-6 Sol, mas apenas $5 usando o GPT-6 Luna. A diferença de custo entre variantes do mesmo fabricante já não é marginal, é de uma ordem de grandeza, o que obriga as equipas técnicas a decidir, tarefa a tarefa, qual o modelo que realmente compensa.
Esta pressão de preços também beneficia empresas que ainda não adotaram IA generativa por considerarem o custo elevado. Com o GLM-5.3 Flash a cobrar $0,015 por milhão de tokens de entrada, o custo de experimentar e validar um caso de uso interno tornou-se quase irrelevante, mesmo para pequenas empresas com orçamentos limitados. O risco, para quem escolhe os modelos mais baratos, é a dependência de fornecedores chineses cuja política de dados e de moderação de conteúdo pode não estar alinhada com o Regulamento Geral de Proteção de Dados (RGPD) aplicável na União Europeia.
Comparação competitiva: quem ganha em cada categoria
Nenhum modelo vence em todas as categorias. O GPT-6 Luna é imbatível em preço de entrada dentro do ecossistema OpenAI, mas o GLM-5.3 Flash é ainda mais barato e é totalmente aberto. O Claude Opus 5.5 continua a ser o mais caro dos modelos proprietários analisados, mas a Anthropic argumenta que a redução de 40% face ao Opus 5, mantendo desempenho equiparável à linha Fable 5.1, compensa o preço mais elevado para tarefas que exigem raciocínio complexo e fiabilidade.
O DeepSeek V4.1 Flash junta-se a este grupo como a opção mais equilibrada entre capacidade e custo para quem precisa de correr o modelo em infraestrutura própria, já que os pesos abertos permitem hospedagem local sem depender de uma API externa. Segundo o acompanhamento de lançamentos da LLM Stats, esta foi uma das cinco atualizações de modelos mais significativas registadas só na semana de 22 de setembro, evidenciando a densidade de lançamentos que caracteriza este período.
Porque é que os preços continuam a cair tão depressa
Há três fatores principais por trás desta queda contínua de preços. Primeiro, a concorrência direta dos modelos abertos chineses obriga os laboratórios ocidentais a justificar cada dólar cobrado com desempenho mensurável, já que alternativas gratuitas ou quase gratuitas estão disponíveis para a maioria das tarefas comuns. Segundo, o custo de treino e inferência tem vindo a descer à medida que os chips de IA ficam mais eficientes e as técnicas de destilação de modelos permitem criar variantes mais pequenas sem perder tanta capacidade como seria de esperar.
Terceiro, e talvez o fator mais decisivo, a OpenAI e a Anthropic perceberam que o volume de utilização gerado por preços mais baixos compensa a margem menor por token. Ao lançar o GPT-6 Luna a $0,10 por milhão de tokens, a OpenAI abre a porta a casos de uso que antes não eram economicamente viáveis, como classificação em massa de conteúdo ou moderação automática, capturando assim clientes que de outra forma iriam para concorrentes mais baratos, incluindo os modelos abertos.
Previsões para os próximos meses
- Os preços por milhão de tokens dos modelos de topo (GPT-6 Astra, Claude Opus 5.5) devem continuar a descer nos próximos trimestres, à medida que a pressão dos modelos abertos chineses se mantém.
- É provável que a Google responda com uma atualização de preços do Gemini nas próximas semanas, para não ficar isolada como a única grande empresa sem uma variante económica competitiva lançada em setembro.
- A diferença de preço entre variantes “premium” e “económicas” do mesmo fabricante deverá continuar a alargar-se, com fabricantes a segmentar cada vez mais o mercado por caso de uso em vez de oferecer um único modelo geral.
- Empresas europeias, incluindo portuguesas, deverão acelerar a adoção de modelos abertos hospedados localmente, como o DeepSeek V4.1 Flash ou o GLM-5.3 Flash, para reduzir custos e mitigar preocupações de conformidade com o RGPD.
- O ritmo de lançamentos mensais deverá manter-se elevado pelo menos até ao final de 2026, com a possibilidade real de “fadiga” entre programadores que já não conseguem acompanhar todas as atualizações de modelos com a mesma atenção dada a lançamentos anteriores.
O risco da fadiga de lançamentos no setor
O ritmo acelerado de lançamentos, com pelo menos seis modelos frontier a chegar em pouco mais de três semanas, entre GPT-6 Astra, Gemini 3.8 Flash, DeepSeek V4.1 Flash, GPT-6 Sol, GPT-6 Luna e Claude Opus 5.5, está a criar um problema novo para equipas técnicas: a dificuldade de acompanhar qual o modelo mais adequado para cada tarefa num momento em que a resposta muda praticamente todas as semanas. Segundo o calendário de lançamentos da Tech Times, este é já o período mais denso de lançamentos de modelos frontier desde que este tipo de acompanhamento começou a ser feito de forma sistemática.
Para muitas empresas, a resposta prática tem sido usar gateways ou camadas de abstração que permitem trocar de modelo sem reescrever código, testando automaticamente qual oferece a melhor relação entre custo e qualidade para cada tipo de pedido. Esta abordagem reduz a dependência de um único fornecedor e permite aproveitar quedas de preço como as anunciadas esta semana sem ficar preso a contratos rígidos.
O que muda para quem já usa GPT-6 Astra ou Claude Opus 5
Quem já tinha migrado para o GPT-6 Astra, lançado a 3 de setembro como modelo focado em automação de computador, não precisa de mudar nada: o Sol e o Luna são variantes paralelas, não substitutos diretos. Já quem usava o Claude Opus 5 tem um caminho de atualização direto e vantajoso para o Opus 5.5, já que a Anthropic promete o mesmo nível de desempenho da linha Fable 5.1 a um custo 40% mais baixo, sem necessidade de alterar a integração técnica existente.
Esta continuidade é importante porque reduz o atrito de adoção. Ao contrário de mudanças de arquitetura que obrigam a reescrever prompts inteiros ou a validar novamente todo o comportamento do modelo, uma simples troca de identificador de modelo com preço mais baixo é uma decisão de baixo risco que a maioria das equipas de engenharia pode tomar em poucos dias, depois de correr os testes de regressão habituais.
Perguntas frequentes
Quanto custa o GPT-6 Luna por milhão de tokens?
O GPT-6 Luna custa cerca de $0,10 por milhão de tokens de entrada e $0,50 por milhão de tokens de saída, tornando-o uma das variantes mais baratas alguma vez lançadas pela OpenAI dentro da família GPT-6.
O Claude Opus 5.5 é mais barato do que o Opus 5?
Sim. A Anthropic afirma que o Opus 5.5 oferece desempenho equiparável à linha Fable 5.1 a um custo 40% inferior ao do Opus 5, mantendo o preço em $4 por milhão de tokens de entrada e $20 por milhão de saída.
Qual é a janela de contexto do GPT-6 Sol e Luna?
Ambos os modelos oferecem uma janela de contexto de 1,05 milhões de tokens, ligeiramente superior ao milhão de tokens do Claude Opus 5.5.
O DeepSeek V4.1 Flash é um modelo de pesos abertos?
Sim, o DeepSeek V4.1 Flash foi lançado a 10 de setembro de 2026 com pesos abertos, 552 mil milhões de parâmetros totais numa arquitetura de mistura de especialistas e capacidades nativas de visão, substituindo o DeepSeek V4 Flash.
Qual o modelo mais barato entre todos os analisados?
Entre os modelos com preços publicados, o GLM-5.3 Flash da Z.ai é o mais barato, com cerca de $0,015 por milhão de tokens de entrada e $0,025 por milhão de saída, sob licença MIT totalmente aberta.
A Google lançou algum modelo económico em resposta ao GPT-6 Sol e Luna?
Até à data de publicação, a Google não tinha anunciado uma resposta direta ao GPT-6 Sol e Luna. O Gemini 3.8 Flash e o Gemini 3.8 Flash Cyber foram lançados a 2 de setembro, antes desta ronda de atualizações de preço da OpenAI e da Anthropic.
Vale a pena migrar de modelo proprietário para um modelo aberto por causa do preço?
Depende do caso de uso. Modelos abertos como o DeepSeek V4.1 Flash ou o GLM-5.3 Flash têm custos muito mais baixos, mas exigem infraestrutura própria para hospedagem e levantam questões de conformidade com o RGPD que empresas europeias devem avaliar antes de migrar dados sensíveis.
Quantos modelos frontier foram lançados em setembro de 2026?
Pelo menos seis modelos frontier relevantes foram lançados entre agosto e setembro de 2026: GLM-5.3, GLM-5.3 Flash, GPT-6 Astra, Gemini 3.8 Flash, DeepSeek V4.1 Flash, GPT-6 Sol, GPT-6 Luna e Claude Opus 5.5, um ritmo de lançamentos considerado inédito pela indústria.




