A IBM acaba de mudar as regras do preço na corrida aos modelos de linguagem abertos. A 25 de agosto de 2026, a divisão de investigação da empresa anunciou a família Granite 4.2, com três tamanhos (3, 8 e 30 mil milhões de parâmetros) e capacidades nativas de raciocínio passo a passo. Os modelos chegaram às plataformas de API entre 25 e 31 de agosto, com o Granite 4.2 8B a ficar disponível por apenas $0,06 por milhão de tokens de entrada e $0,25 por milhão de saída, segundo o registo oficial no Hugging Face. É um preço mais baixo do que o de rivais chineses como o Qwen3.8-Flash-Next ou o GLM-5.3-Flash, mas também vem com pontuações mais modestas nos testes de programação. Este artigo desmonta os números, compara o Granite 4.2 com a concorrência aberta e explica o que a jogada da IBM significa para empresas europeias que procuram IA sem depender de gigantes fechados.

O que é o Granite 4.2 e porque a IBM o lança agora

O Granite 4.2 é a quinta geração pública da família de modelos abertos da IBM, pensada para tarefas agênticas: planear, escolher ferramentas, executar código e corrigir os próprios erros a meio do processo. A IBM Research descreve os modelos como capazes de “reasoning” nativo, ou seja, pensam antes de responder, em vez de gerarem texto de forma puramente reativa. Isto distingue-os dos primeiros chatbots baseados em LLM, que apenas reagiam ao pedido do utilizador sem qualquer etapa de planeamento intermédia.

A empresa aposta numa arquitetura densa (ao contrário de outros grandes laboratórios que usam misturas de especialistas) precisamente para garantir compatibilidade ampla com nuvem, infraestrutura on-premise e dispositivos de borda. Isso significa que o mesmo modelo corre num servidor empresarial, num cluster híbrido ou, no caso do tamanho de 3B, num portátil comum. Segundo a IBM, os três tamanhos foram construídos sobre a base dos modelos Granite 4.0, com um regime de treino por reforço em várias fases que reforça matemática, ciência, código, raciocínio e chamada de ferramentas antes de qualquer ajuste específico para tarefas empresariais.

Os modelos ficaram disponíveis de imediato em doze plataformas, incluindo AnythingLLM, Hugging Face, LM Studio, Ollama, OpenRouter, Replicate, CoreWeave, DeepInfra e a própria watsonx da IBM. Essa distribuição simultânea em tantos canais é rara: a maioria dos laboratórios lança primeiro na sua própria API e só depois liberta os pesos para terceiros.

Arquitetura e tamanhos: modelos de 3B, 8B e 30B parâmetros

A família Granite 4.2 chega em três tamanhos claramente segmentados por caso de uso. O modelo de 3 mil milhões de parâmetros destina-se a tarefas de alto volume e baixa latência, o de 8 mil milhões equilibra custo e capacidade para a maioria dos fluxos empresariais, e o de 30 mil milhões fica reservado para raciocínio mais profundo e programação complexa. Todos correm sob licença Apache 2.0, o que permite às organizações descarregar, ajustar e colocar em produção sem pagar royalties nem pedir autorização à IBM.

Um treino em várias fases

O processo de treino começou com ajuste fino supervisionado e avançou por várias fases de aprendizagem por reforço. A primeira, chamada “RL fundacional”, aplicou-se a todos os tamanhos e reforça matemática, ciência, código e chamada de ferramentas, combinando recompensas verificáveis com avaliação baseada em modelos de recompensa. Só os modelos de 8B e 30B avançaram depois para uma fase de “RL agêntica”, centrada em tarefas de engenharia de software, terminal e pesquisa, complementada por aprendizagem por reforço com feedback humano.

Dois detalhes técnicos ajudam a explicar os ganhos em código: os modelos treinaram com 1 bilião de tokens de código sintético gerado pelo pipeline interno CodeAlchemy da IBM, e passaram por uma etapa intermédia de “mid-training” que a equipa diz destravar mais capacidade de raciocínio antes da fase final de ajuste.

Descodificação especulativa para respostas mais rápidas

O Granite 4.2 inclui também uma camada de descodificação especulativa, uma técnica que permite ao modelo prever vários tokens seguintes de uma só vez e depois validá-los, em vez de gerar palavra a palavra. Na prática, isto traduz-se em respostas mais rápidas e custos de inferência mais baixos para quem serve muitos utilizadores em simultâneo, um fator direto na equação de preço por token que detalhamos já a seguir.

Quanto custa usar o Granite 4.2: preços por plataforma

O preço é onde o Granite 4.2 8B mais se destaca. Nos agregadores DeepInfra, Replicate e afins, o modelo custa $0,06 por milhão de tokens de entrada e $0,25 por milhão de saída, com leitura de cache a $0,015 por milhão. Já na rota via CoreWeave dentro do OpenRouter, o preço de tabela sobe para $0,10 de entrada e $0,15 de saída, com leitura de cache a $0,05 por milhão. A diferença reflete custos distintos de infraestrutura entre fornecedores de inferência, não uma alteração no modelo em si. Para quem prefere não depender de terceiros, os pesos podem ser descarregados gratuitamente e corridos em hardware próprio via Ollama, Hugging Face ou vLLM, pagando apenas a eletricidade e o hardware.

PlataformaEntrada (por 1M tokens)Saída (por 1M tokens)Janela de contexto
DeepInfra / Replicate$0,06$0,25128K–131K tokens
OpenRouter (via CoreWeave)$0,10$0,15131K tokens
Cache de leitura (DeepInfra)$0,015
Auto-hospedagem (Ollama, vLLM)Grátis (só compute próprio)Grátis (só compute próprio)Depende do hardware
watsonx (IBM)Incluído em planos empresariaisIncluído em planos empresariais128K tokens

Vale notar que o contexto varia ligeiramente consoante a fonte: a própria IBM refere 128 mil tokens no anúncio original, enquanto vários catálogos de modelos de terceiros listam 131 mil. A diferença é pequena e não muda o posicionamento prático do modelo para leitura de documentos longos ou bases de código inteiras.

Resultados nos testes: como o Granite 4.2 se sai nos benchmarks

Os números divulgados pela IBM mostram uma progressão previsível entre tamanhos, com saltos mais acentuados entre o modelo de 3B e o de 8B do que entre o de 8B e o de 30B. No SWE-Bench Verified, o teste que mede a capacidade de resolver problemas reais de código, o Granite 4.2 8B marca 47,67 pontos, e o de 30B sobe para 57,00. No MMLU-Pro, uma versão mais exigente do teste de conhecimento geral MMLU, o 8B chega aos 74,04 pontos.

BenchmarkGranite 4.2 3BGranite 4.2 8BGranite 4.2 30B
SWE-Bench Verified47,6757,00
MMLU-Pro67,8474,0477,60
AIME25 (matemática)78,3386,6789,17
GPQA54,8064,1466,41
Arena-Hard-V234,9665,1967,93
Terminal-Bench 2.120,5629,24

Fora desta tabela, o Granite 4.2 8B regista ainda 19,11 pontos no SWE-bench Pro e 30,78% no SWE-bench Multilingual, segundo o cartão do modelo no Hugging Face. A plataforma independente Artificial Analysis atribui ao modelo um Índice de Inteligência de 12 pontos, claramente acima da mediana de 7 registada por modelos abertos de tamanho semelhante, segundo a análise publicada pela Artificial Analysis. Ou seja: dentro da sua categoria de peso, o Granite 4.2 8B compete de forma sólida, mas fica claramente atrás dos modelos de mistura de especialistas maiores quando o teste é código puro.

Granite 4.2 8B contra a concorrência aberta

Comparar o Granite 4.2 8B com outros modelos abertos obriga a olhar para além dos parâmetros brutos. O Llama 3.1 8B Instruct da Meta continua a ser o modelo mais usado localmente, mas os seus resultados no MMLU tradicional rondam os 47,6 pontos, bem abaixo dos 74,04 do MMLU-Pro do Granite. O Mistral 7B, também sob licença Apache 2.0, marca cerca de 63% no MMLU, e custa entre $0,10 e $0,25 por milhão de tokens de entrada consoante o fornecedor.

Já os dois rivais chineses jogam noutra categoria de arquitetura. O Qwen3.8-Flash-Next da Alibaba, lançado a 26 de agosto de 2026, tem 125 mil milhões de parâmetros totais mas ativa apenas 6 mil milhões por token, um desenho de mistura de especialistas que lhe permite marcar 62,5 pontos no SWE-Bench Pro, bem acima dos 19,11 do Granite 8B na mesma métrica. O GLM-5.3-Flash da Z.ai, também lançado no final de agosto, chega aos 320 mil milhões de parâmetros totais com 18 mil milhões ativos, licença MIT e uma pontuação de 63,4 no DeepSWE v1.1, segundo a comparação publicada pela MarktechPost. Ambos custam mais por token do que o Granite (entre $0,15 e $0,47 de entrada), mas superam-no claramente em tarefas de programação intensiva.

ModeloTamanho efetivoLicençaReferência de códigoPreço (entrada/saída por 1M)
IBM Granite 4.2 8B8B densoApache 2.0SWE-Bench Verified 47,67$0,06 / $0,25
Meta Llama 3.1 8B Instruct8B densoLicença Llama (Meta)MMLU ~47,6$0,05 / $0,08 (típico)
Mistral 7B7,3B densoApache 2.0MMLU ~63$0,10–0,25 / $0,25–0,30
Qwen3.8-Flash-Next125B total / 6B ativoQwen Community 1.0SWE-Bench Pro 62,5$0,16 / $0,47
GLM-5.3-Flash320B total / 18B ativoMITDeepSWE v1.1 63,4$0,15 / $0,50

A conclusão prática: quem precisa de código de qualidade máxima ainda paga mais e recorre a um modelo de mistura de especialistas chinês. Quem precisa de um modelo denso, previsível, barato e fácil de auto-hospedar em ambientes regulados, o Granite 4.2 8B fica entre as opções mais competitivas do mercado atual.

Os novos modelos de voz: Granite Speech 5.0 Turbo CTC

Ao lado dos modelos de linguagem, a IBM lançou também dois modelos de voz: o Granite Speech 5.0 Turbo CTC e a variante 5.0 Turbo CTC NC. São modelos de apenas 470 milhões de parâmetros, uma fração do tamanho habitual, pensados para correr em portáteis, smartphones e outros dispositivos de borda. A mudança de nome em relação à geração 4.1 assinala uma alteração estrutural: ao contrário dos modelos de voz anteriores da Granite, estes já não têm uma coluna vertebral de LLM, apoiando-se apenas em classificação temporal conectivista (CTC) para mapear áudio em texto.

Segundo a IBM, essa arquitetura mais enxuta traduz-se em velocidade: em testes internos com uma única GPU H200, o Granite Speech 5.0 Turbo CTC atingiu um débito de processamento (RTFx) de cerca de 12.600, contra uma referência de topo de cerca de 6.000 no ranking Open ASR da Hugging Face. Na prática, isso significa transcrever horas de gravação em muito menos tempo do que os líderes anteriores da categoria, uma vantagem relevante para call centers, legendagem automática e ferramentas de acessibilidade que processam grandes volumes de áudio todos os dias.

A parceria com a Hirundo e a redução de respostas indesejadas

Um dos pontos menos falados do lançamento é a colaboração da IBM com a startup Hirundo. A tecnologia de desaprendizagem automática da empresa (machine unlearning, em inglês) permite visar e reduzir respostas indesejadas de um modelo já treinado, sem obrigar a um novo ciclo completo de treino do zero. Para uma empresa que atualiza a sua linha de modelos a um ritmo praticamente trimestral, como é o caso da Granite desde 2024, poupar esse custo de recomeçar do zero cada vez que surge um problema de alinhamento tem impacto direto no calendário de lançamentos e no orçamento de computação.

Esta abordagem distingue a Granite 4.2 de outras famílias abertas que continuam a depender quase exclusivamente de filtros de moderação aplicados depois da geração de texto, uma técnica mais barata de implementar mas menos eficaz a longo prazo, porque não altera o comportamento interno do modelo.

Como experimentar o Granite 4.2 localmente

Para quem quer testar o modelo sem gastar um cêntimo em API, a via mais rápida é o Ollama, já com suporte oficial à família Granite 4. Basta um terminal e a ferramenta instalada:

ollama pull granite4:8b
ollama run granite4:8b "Explica em três frases o que muda no Granite 4.2 8B"

O modelo de 8B corre com folga numa placa gráfica de consumo com 12 a 16 GB de memória, graças à arquitetura densa e ao tamanho reduzido face aos gigantes de mistura de especialistas. Já o de 30B exige hardware mais robusto ou quantização mais agressiva para caber em GPUs de utilizador comum.

Da Granite 3.0 à 4.2: um ano e meio de evolução

A família Granite não nasceu em 2026. A IBM lançou a Granite 3.0 a 21 de outubro de 2024, no seu evento TechXchange, com modelos densos de 2B e 8B treinados em mais de 12 biliões de tokens e complementados pelos modelos de segurança Granite Guardian 3.0, tudo sob licença Apache 2.0, segundo o arquivo de anúncios da IBM. Seguiram-se a Granite 3.1 em dezembro de 2024, a Granite 3.2 em fevereiro de 2025 (com raciocínio em cadeia opcional e o modelo visual Granite Vision 3.2) e a Granite 3.3 ao longo de 2025.

A verdadeira mudança de rumo aconteceu a 2 de outubro de 2025, com a Granite 4.0, que trocou a maioria das camadas de atenção clássica por uma arquitetura híbrida Mamba-2, prometendo eficiência muito superior para contextos longos. Semanas depois, chegaram os modelos Granite 4.0 Nano, entre 350 milhões e 1,5 mil milhões de parâmetros, pensados para correr inteiramente em dispositivos locais. A Granite 4.2, lançada menos de um ano depois, volta a uma arquitetura densa nos tamanhos 3B, 8B e 30B, privilegiando compatibilidade ampla em detrimento da eficiência máxima de contexto que a linha híbrida perseguia.

O peso da IBM no mercado empresarial de IA: watsonx em números

O Granite 4.2 não existe isolado: é a componente aberta de uma estratégia empresarial maior, centrada na plataforma watsonx. A IBM fechou o ano fiscal de 2025 com receitas de 67,5 mil milhões de dólares, um crescimento de cerca de 7,6% a 8% face ao ano anterior, e um fluxo de caixa livre recorde de 14,7 mil milhões de dólares. A carteira acumulada de negócios ligados a IA generativa já ultrapassava os 12 mil milhões de dólares no final de 2025 e início de 2026, impulsionada sobretudo por contratos assentes na watsonx.

Os números de adoção reforçam essa leitura: no segundo trimestre de 2026, a receita da divisão de software da IBM chegou aos 7,1 mil milhões de dólares, um crescimento anual de 11%, enquanto o número de clientes empresariais da watsonx subiu de cerca de 3.200 no mesmo período de 2025 para aproximadamente 5.000 um ano depois, um aumento de 56% em apenas quatro trimestres. A IBM figura ainda como líder em vários relatórios da Gartner sobre plataformas de dados e IA publicados entre 2025 e 2026, incluindo o quadrante dedicado a plataformas de desenvolvimento de aplicações de IA.

Porque o preço de $0,06 por milhão de tokens é uma declaração de intenções

O preço do Granite 4.2 8B não é acidental. Ao posicionar-se abaixo de modelos comparáveis da Meta e da Mistral, e muito abaixo dos rivais chineses de mistura de especialistas, a IBM está a competir pelo segmento de clientes empresariais que valorizam previsibilidade de custo e simplicidade de auto-hospedagem acima do desempenho máximo em código. Bancos, seguradoras e administrações públicas que operam sob regras rígidas de residência de dados preferem, muitas vezes, um modelo mais pequeno e mais barato que corre dentro das suas próprias infraestruturas a um modelo mais capaz que exige enviar dados para uma API externa.

Esta estratégia de preço agressivo em modelos abertos, associada a serviços pagos de governação e suporte na watsonx, espelha o modelo de negócio clássico do software livre corporativo: dar o produto base e cobrar pela integração, pelo suporte e pela conformidade regulatória à volta dele.

O fosso que a IBM não fecha: onde os modelos chineses ainda ganham

Apesar do preço competitivo, os números não escondem uma diferença real de capacidade em tarefas de programação complexa. O Qwen3.8-Flash-Next marca mais do triplo do Granite 4.2 8B no SWE-bench Pro, e o GLM-5.3-Flash aproxima-se de resultados semelhantes no DeepSWE. Essa distância explica-se em parte pela própria arquitetura: os dois modelos chineses usam misturas de especialistas com dezenas ou centenas de mil milhões de parâmetros totais, ainda que ativem apenas uma fração por token, o que lhes dá mais capacidade de especialização em domínios de nicho como refatoração de código.

Para equipas de engenharia que dependem de agentes autónomos capazes de reescrever bases de código inteiras, essa diferença de pontuação pode pesar mais do que a poupança em tokens. Já para tarefas empresariais mais convencionais, como sumarização de documentos, apoio ao cliente ou extração de dados estruturados, a diferença tende a ser menos determinante na escolha final.

O que este lançamento significa para empresas europeias e portuguesas

Para empresas em Portugal e no resto da Europa, o Granite 4.2 chega num momento em que o Regulamento Geral de Proteção de Dados e o AI Act da União Europeia tornam a auto-hospedagem de modelos cada vez mais atrativa. Um modelo denso, sob licença Apache 2.0 e disponível em três tamanhos, permite a uma empresa escolher exatamente o nível de capacidade de que precisa sem depender de um único fornecedor de nuvem americano ou chinês. A presença da IBM na watsonx, com centros de dados também na Europa, reforça essa opção para setores como banca, seguros e administração pública, onde a soberania dos dados pesa tanto quanto o desempenho bruto do modelo.

Ao mesmo tempo, equipas de engenharia mais pequenas, sem orçamento para infraestrutura própria, continuam a poder aceder ao mesmo modelo através de qualquer uma das doze plataformas de API já mencionadas, o que baixa a barreira de entrada para experimentação sem compromisso.

Previsões: para onde vai a Granite depois da versão 4.2

  • A IBM deve lançar uma variante “Thinking” mais explícita da Granite 4.2, seguindo o padrão já anunciado para a linha 4.0, com um modo de raciocínio ainda mais alongado para tarefas de matemática e ciência.
  • É provável que surjam novos modelos Granite Nano ainda mais pequenos, na casa das centenas de milhões de parâmetros, para reforçar a presença da IBM em dispositivos de borda e telemóveis empresariais.
  • A pressão competitiva dos modelos chineses de mistura de especialistas deve empurrar a IBM a testar, nas próximas gerações, uma arquitetura híbrida que combine a eficiência de custo da linha densa com ganhos de especialização em código.
  • A parceria com a Hirundo tende a expandir-se para outros domínios de segurança além da desaprendizagem automática, possivelmente incluindo deteção de fugas de dados sensíveis em respostas geradas.
  • Espera-se que a IBM continue a divulgar números de crescimento da watsonx a cada trimestre, usando a base de clientes crescente como argumento comercial central da Granite junto de setores regulados.

Perguntas Frequentes

O Granite 4.2 é gratuito?
Os pesos do modelo são gratuitos e podem ser descarregados sob licença Apache 2.0 para uso comercial sem royalties. O que se paga é o acesso via API a plataformas como OpenRouter ou DeepInfra, ou o hardware necessário para correr o modelo localmente.

Qual a diferença entre os tamanhos 3B, 8B e 30B?
O 3B destina-se a tarefas rápidas e de alto volume, o 8B equilibra custo e capacidade para a maioria dos casos empresariais, e o 30B fica reservado para raciocínio mais profundo e programação complexa, exigindo mais memória e capacidade de computação.

O Granite 4.2 8B é melhor do que o Llama 3.1 8B?
Nos testes de conhecimento geral disponíveis, o Granite 4.2 8B supera o Llama 3.1 8B (74,04 no MMLU-Pro contra cerca de 47,6 no MMLU tradicional), mas o Llama continua a ter o ecossistema de ajuste fino mais amplo devido ao tempo de mercado.

Vale a pena escolher o Granite 4.2 em vez do Qwen3.8-Flash-Next ou do GLM-5.3-Flash?
Depende da prioridade. Para código complexo e refatoração de larga escala, os modelos chineses pontuam mais alto. Para custo previsível, licenciamento simples e facilidade de auto-hospedagem em ambientes regulados, o Granite 4.2 8B tende a ser a escolha mais prática.

Que hardware preciso para correr o Granite 4.2 8B localmente?
Uma GPU de consumo com 12 a 16 GB de memória é suficiente para o modelo de 8B em precisão reduzida através do Ollama ou do vLLM. O modelo de 3B corre em portáteis comuns, enquanto o de 30B exige hardware de servidor ou quantização mais agressiva.

Os modelos de voz Granite Speech também são gratuitos?
Sim, o Granite Speech 5.0 Turbo CTC e a variante CTC NC seguem o mesmo princípio de pesos abertos e podem ser descarregados e usados sem custo de licenciamento, pagando apenas o hardware necessário para os correr.

O que muda com a parceria entre IBM e Hirundo?
A Hirundo fornece tecnologia de desaprendizagem automática que permite corrigir comportamentos indesejados de um modelo já treinado sem repetir todo o processo de treino, reduzindo custo e tempo entre atualizações de segurança.

Onde posso testar o Granite 4.2 sem instalar nada?
Está disponível para teste direto em plataformas como Hugging Face, LM Studio e OpenRouter, além de integração nativa na watsonx da IBM para clientes empresariais.