Il 7 ottobre 2026 Anthropic ha lanciato Claude Haiku 5.5 tagliando i prezzi del suo modello più piccolo fino al 90% rispetto a Haiku 4.5. Il giorno dopo OpenAI ha reso GPT-6 Luna il motore predefinito di ChatGPT per gli utenti Free e Go, dimezzando a sua volta le tariffe della versione GPT-5.6. Google, da parte sua, aveva già mosso le sue pedine in estate con Gemini 3.6 Flash, puntando tutto su un contesto da un milione di token a un prezzo contenuto. Tre aziende, tre strategie diverse, tutte dirette allo stesso obiettivo: conquistare la fascia di mercato dove si gioca il volume, non il prestigio.

Per chi sviluppa prodotti con l’intelligenza artificiale, questa fascia “economica” non è un ripiego. È lì che finiscono la maggior parte delle chiamate API reali: classificazione di ticket, estrazione dati da documenti, riassunti, moderazione, chatbot di primo livello. Scegliere il modello sbagliato in questa categoria significa pagare due o tre volte il necessario su milioni di richieste al mese, oppure risparmiare sulla carta e perdere qualità dove conta. Questo confronto mette a fianco Claude Haiku 5.5, Gemini 3.6 Flash e GPT-6 Luna con dati di prezzo, benchmark e capacità verificati alle fonti ufficiali, aggiornati al 10 ottobre 2026.

Il contesto generale aiuta a capire perché tre aziende abbiano scelto lo stesso trimestre per muoversi su questa fascia di prezzo. Secondo i dati di BenchLM, al 8 ottobre 2026 l’indice dei prezzi dei modelli di frontiera è sceso a 16 punti, l’84% sotto il livello di base di marzo 2023, con un modello di punta mediano che costa 6,00$ per milione di token misti su 35 modelli attivi monitorati. La fascia economica segue la stessa traiettoria, ma con un ritmo ancora più aggressivo: in meno di una settimana, tra il 7 e l’8 ottobre 2026, due dei tre maggiori laboratori occidentali hanno tagliato i prezzi dei loro modelli più piccoli, segno che la guerra sui margini si è spostata dai modelli di punta a quelli che gestiscono il volume quotidiano.

Chi sono i tre contendenti: una fotografia rapida

Claude Haiku 5.5 è il modello compatto di Anthropic, presentato come “il più economico, veloce e capace modello piccolo mai rilasciato” dall’azienda. È pensato per attività ad alto volume e sensibili alla latenza: moderazione, categorizzazione, risposte rapide in chat di supporto. Ha un contesto da 1 milione di token e un output massimo di 128.000 token, con un parametro “effort” che regola quanto il modello “pensa” prima di rispondere. Le note di rilascio ufficiali della piattaforma Claude lo descrivono come il modello tarato per lavoro ad alto volume e sensibile alla latenza, la stessa definizione usata da Anthropic nel comunicato di lancio.

Gemini 3.6 Flash, pubblicato da Google DeepMind il 21 luglio 2026, punta sulla stessa finestra di contesto da 1 milione di token ma con un taglio diverso: meno token generati per la stessa risposta rispetto alla generazione Flash precedente, secondo i dati di prezzo pubblicati da Google. Il modello ha un knowledge cutoff di marzo 2026 e compare nelle classifiche di benchmark pubbliche con punteggi concreti su coding agentico e task di ingegneria del software.

GPT-6 Luna, infine, è il modello che OpenAI ha messo davanti a tutti gli utenti gratuiti di ChatGPT a partire dall’8 ottobre 2026, sostituendo GPT-5.6 Luna. Non è un modello di punta: è pensato per “compiti ripetuti e mirati su larga scala”, come l’estrazione di campi da una fattura o la classificazione di richieste, secondo la guida pratica pubblicata da OpenAI per la famiglia GPT-6. Il suo ruolo nell’ecosistema ChatGPT lo rende probabilmente il modello AI più usato al mondo in termini di numero di conversazioni, semplicemente perché è quello che gira di default per centinaia di milioni di account gratuiti.

Tabella comparativa: specifiche tecniche a confronto

Prima di entrare nei dettagli, ecco la fotografia completa delle specifiche dichiarate dai tre produttori. Dove un dato non è stato confermato da una fonte ufficiale lo segnaliamo esplicitamente, invece di stimarlo.

SpecificaClaude Haiku 5.5Gemini 3.6 FlashGPT-6 Luna
AziendaAnthropicGoogle DeepMindOpenAI
Data di rilascio7 ottobre 202621 luglio 20267 ottobre 2026 (default gratuito dall’8 ottobre)
Prezzo input (per milione di token)0,10$ (fino a 100K token)0,75$ (tariffa intro fino al 31/12/2026)0,10$
Prezzo output (per milione di token)0,50$ (fino a 100K token)3,75$ (tariffa intro fino al 31/12/2026)0,50$
Finestra di contesto1.000.000 token1.000.000 token1.050.000 token (fonte secondaria non ufficiale)
Output massimo128.000 tokenNon dichiarato nelle fonti consultateNon dichiarato nelle fonti consultate
Knowledge cutoffNon dichiarato nelle fonti consultateMarzo 2026Non dichiarato nelle fonti consultate
Input multimodaleNon dettagliato nelle fonti consultateNon dettagliato nelle fonti consultateTesto e immagini tramite Decisions API
Thinking adattivoSì, parametro “effort”Non dichiarato come taleNon dichiarato come tale
Cache read (per milione di token)0,01$ (fino a 100K)Non dichiarato nelle fonti consultate0,01$
PosizionamentoTask ad alto volume e bassa latenzaEfficienza su coding agentico e task lunghiTask ripetitivi su larga scala, estrazione dati
Disponibilità gratuitaNo (solo API, a pagamento)Tariffa introduttiva via APISì, default ChatGPT Free e Go

Il dato che salta all’occhio è la cifra “1.050.000 token” per GPT-6 Luna: proviene da un’analisi tecnica indipendente (Developers Digest) e non da una pagina ufficiale OpenAI con quel numero esatto, quindi lo trattiamo come indicativo e non come specifica garantita. Per Haiku 5.5 e Gemini 3.6 Flash, invece, il milione di token è confermato direttamente dalle pagine Anthropic e dalla model card di Google DeepMind.

Prezzi a confronto: la trappola dei 100.000 token

Sulla carta, Claude Haiku 5.5 e GPT-6 Luna hanno lo stesso prezzo di listino: 0,10$ per milione di token in input e 0,50$ in output. Ma Haiku 5.5 ha una clausola che gli altri due non hanno: superata la soglia dei 100.000 token in un singolo prompt, il prezzo sale a 0,50$ di input e 2,50$ di output, cioè cinque volte la tariffa base. Un utente di Hacker News ha definito quella soglia “un cutoff assurdamente basso”, dato che un contesto dichiarato di un milione di token invita naturalmente a usarlo per intero, non solo per il primo decimo.

Gemini 3.6 Flash gioca su un’altra fascia di prezzo fin dall’inizio: 0,75$ di input e 3,75$ di output per milione di token, con tariffa introduttiva valida solo fino al 31 dicembre 2026. Dal 1° gennaio 2027 il prezzo standard raddoppia a 1,50$ e 7,50$. Significa che oggi Gemini 3.6 Flash costa già 7,5 volte più di Haiku 5.5 in input sotto i 100.000 token, e che quel rapporto peggiorerà ulteriormente a gennaio.

ModelloInput $/M tokenOutput $/M tokenCache read $/MCache write $/MNota
Claude Haiku 5.5 (≤100K)0,10$0,50$0,01$0,125$Tariffa base
Claude Haiku 5.5 (>100K)0,50$2,50$0,05$0,625$5x la tariffa base
Claude Haiku 4.5 (predecessore)circa 1,00$circa 5,00$0,10$n.d.Haiku 5.5 è circa 90% più economico sotto i 100K
Gemini 3.6 Flash (intro, fino al 31/12/2026)0,75$3,75$n.d.n.d.Diventa 1,50$/7,50$ dal 2027
GPT-6 Luna0,10$0,50$0,01$n.d.50% più economico di GPT-5.6 Luna (0,20$/1,20$)
GPT-6 Sol (per contesto, modello di punta)2,00$10,00$n.d.n.d.20 volte più caro di GPT-6 Luna in output

Il confronto diretto, quindi, non è “chi costa meno” in assoluto: è “chi costa meno per il tuo caso d’uso specifico”. Se la maggior parte dei prompt resta sotto i 100.000 token, Haiku 5.5 e GPT-6 Luna sono testa a testa e nettamente più economici di Gemini 3.6 Flash. Se invece il flusso di lavoro richiede regolarmente contesti molto lunghi, oltre quella soglia Haiku 5.5 perde il suo vantaggio e Gemini 3.6 Flash, pur partendo più caro, diventa relativamente più prevedibile perché non ha scaglioni nascosti.

Benchmark e prestazioni: dati reali, non promesse

Qui le cose si complicano, perché i tre produttori non pubblicano gli stessi benchmark. Google DeepMind ha reso pubblica una scheda modello completa per Gemini 3.6 Flash con punteggi su task di coding agentico. Anthropic e OpenAI, per i loro modelli economici, si sono limitati a confronti relativi o a metriche di sicurezza, senza pubblicare tabelle MMLU o GPQA dirette per Haiku 5.5 e GPT-6 Luna al momento della scrittura.

BenchmarkGemini 3.6 FlashFonte
SWE-Bench Pro (coding agentico)64,7%Model card Google DeepMind
DeepSWE v1.1 (ingegneria software long-horizon)67%Model card Google DeepMind
Terminal-Bench 2.1 (coding da terminale agentico)84,7%Model card Google DeepMind
MLE-Bench (machine learning engineering)66,9%Model card Google DeepMind
GDM-MRCR v2 a 128K token91,8%Model card Google DeepMind
GDM-MRCR v2 a 1M token54,0%Model card Google DeepMind
LMArena Hard Prompts1501 punti, posizione #30BenchLeader
Punteggio conoscenza e comprensione64,7/100, #35 su 177 modelliBenchLM

Per Claude Haiku 5.5 la fonte più concreta che abbiamo trovato è un’analisi di terze parti, ComputingForGeeks, secondo cui sui benchmark pubblicati da Anthropic il nuovo Haiku batte GPT-6 Luna “quasi ovunque”. È un confronto riportato da un sito di settore, non una tabella numerica ufficiale pubblicata da Anthropic, e va letto con questa cautela. Per GPT-6 Luna, OpenAI ha reso pubblico un solo dato verificabile nella scheda di sistema del modello: una robustezza nella gestione della gerarchia delle istruzioni del 99,79%, contro il 99,99% del modello di punta GPT-6 Sol. È una metrica di sicurezza, non di capacità generale, ma è l’unico numero ufficiale disponibile al momento.

Il quadro che ne emerge: Gemini 3.6 Flash è il solo dei tre a offrire una scheda di benchmark pubblica, verificabile e comparabile con altri modelli della stessa classe su siti come BenchLM e BenchLeader. Questo non significa automaticamente che sia il più capace, ma significa che è l’unico su cui un team tecnico può basare una decisione con dati oggettivi invece che su dichiarazioni di marketing.

Finestra di contesto: un milione di token, tre modi diversi di usarlo

Tutti e tre i modelli rivendicano una finestra di contesto nell’ordine del milione di token, ma il modo in cui questa cifra si traduce in costo reale cambia completamente l’equazione. Gemini 3.6 Flash applica lo stesso prezzo per token dal primo all’ultimo, quindi un contesto da 900.000 token costa esattamente novanta volte un contesto da 10.000 token, senza sorprese. Claude Haiku 5.5, come visto, applica un prezzo quintuplicato oltre i 100.000 token: usare l’intero milione di token con Haiku 5.5 significa pagare la tariffa alta per il 90% del contenuto.

Per GPT-6 Luna la situazione è meno chiara perché OpenAI non ha pubblicato una pagina di pricing a scaglioni equivalente a quella di Anthropic nelle fonti disponibili al momento della scrittura. I dati raccolti indicano un prezzo unico di 0,10$/0,50$ per milione di token, ma la finestra di contesto dichiarata di 1.050.000 token proviene da un’analisi indipendente e non da una scheda tecnica ufficiale OpenAI con quella cifra esatta. Chi pianifica un uso intensivo del contesto lungo con GPT-6 Luna dovrebbe verificare direttamente sulla console developer di OpenAI prima di dimensionare un progetto di produzione.

Capacità multimodali e tool use

Sul fronte multimodale i dati pubblici sono disomogenei. GPT-6 Luna supporta input testo e immagini attraverso la nuova Decisions API di OpenAI, pensata per trasformare testo e immagini in risposte strutturate e tipizzate, utile per flussi come la lettura di fatture scansionate o moduli compilati a mano. Non è l’equivalente di un supporto multimodale completo in ogni endpoint, ma è una capacità concreta e documentata nel changelog ufficiale dell’API.

Per Gemini 3.6 Flash e Claude Haiku 5.5, le fonti raccolte non elencano in modo esplicito l’intero set di modalità supportate nelle pagine consultate. Dato che entrambe le famiglie (Gemini e Claude) hanno storicamente offerto supporto immagini nei modelli precedenti della stessa linea, è ragionevole aspettarsi continuità, ma non lo diamo per confermato senza una fonte diretta: chi deve integrare input visivi in produzione dovrebbe controllare la documentazione API del modello specifico prima di contare su quella capacità.

Il tool calling, cioè la capacità del modello di invocare funzioni esterne durante una conversazione, è un requisito quasi scontato per chiunque costruisca agenti o automazioni oggi, ma la documentazione pubblica consultata per questo confronto non specifica in modo granulare le differenze tra i tre modelli su questo fronte specifico. Dato il posizionamento dichiarato di tutti e tre come modelli per task ripetitivi e strutturati, è ragionevole presumere un supporto di base al tool calling in ciascuno, ma i limiti esatti (numero di funzioni richiamabili in parallelo, affidabilità su catene lunghe di chiamate) andrebbero testati caso per caso prima di affidare un flusso di produzione critico a uno di questi modelli economici piuttosto che al rispettivo modello di punta.

Claude Haiku 5.5: dove conviene davvero

Il taglio di prezzo di Anthropic è drastico: secondo l’annuncio ufficiale, Haiku 5.5 costa in media il 75% in meno rispetto a Haiku 4.5 considerando l’intero mix di utilizzo, e fino al 90% in meno sulla tariffa base sotto i 100.000 token. Per un servizio che instrada migliaia di richieste al minuto, come la moderazione di contenuti generati dagli utenti o la categorizzazione automatica di email, questo taglio può tradursi in una riduzione diretta e misurabile della bolletta cloud mensile.

Il parametro “effort” è la caratteristica che distingue di più Haiku 5.5 dai concorrenti in questa fascia: permette di decidere quanto tempo di calcolo (e quindi quanto costo) dedicare a ogni singola richiesta, invece di avere un comportamento fisso. Per chi gestisce un prodotto con richieste molto diverse tra loro, dalla domanda banale al caso complesso, poter regolare questo parametro riga per riga è un controllo che né Gemini 3.6 Flash né GPT-6 Luna offrono nella stessa forma esplicita, almeno secondo la documentazione pubblica consultata.

Gemini 3.6 Flash: il prezzo della trasparenza

Gemini 3.6 Flash costa di più degli altri due, ma è anche il solo a offrire una base di benchmark pubblica e dettagliata su cui un team tecnico può ragionare prima di impegnare un budget. Un punteggio Terminal-Bench 2.1 dell’84,7% non è un dato banale per chi sta valutando un modello economico da inserire in una pipeline di coding agentico: indica una capacità concreta di eseguire sequenze di comandi in un terminale senza supervisione costante, cosa che le classificazioni “quasi ovunque meglio” riportate per Haiku 5.5 non permettono di verificare con la stessa precisione.

La riduzione del numero di token generati rispetto alla generazione Flash precedente (3.5) è un altro punto a favore pratico: un modello che produce risposte più sintetiche a parità di qualità consuma meno budget in output, anche quando il prezzo nominale per token resta superiore a quello della concorrenza. È un dettaglio che spesso si perde nei confronti puramente basati sul prezzo di listino, ma che pesa concretamente sulla fattura a fine mese.

GPT-6 Luna: il modello che (quasi) nessuno ha scelto

GPT-6 Luna ha una particolarità che lo distingue da entrambi i concorrenti: non è un modello che gli sviluppatori scelgono attivamente nella maggior parte dei casi, è il modello che OpenAI ha scelto per loro. Da quando è diventato il default per gli account Free e Go di ChatGPT l’8 ottobre 2026, Luna gestisce probabilmente il volume di conversazioni più alto tra i tre modelli di questo confronto, semplicemente per effetto della sua posizione predefinita in un prodotto con centinaia di milioni di utenti attivi.

Per gli sviluppatori che lo usano via API, il caso d’uso dichiarato da OpenAI nella guida pratica alla famiglia GPT-6 è specifico: lavoro ripetuto e mirato su larga scala, con un obiettivo chiaro, come l’estrazione di campi da fatture, la classificazione di richieste o la produzione di riassunti strutturati. Non è presentato come un modello da usare per ragionamento complesso o compiti aperti, un ruolo che OpenAI riserva a GPT-6 Sol, il cui prezzo (2$ di input e 10$ di output per milione di token) è venti volte superiore su alcune voci.

Quanto costa salire di gamma: il confronto con i modelli di punta

Un modo utile per capire il posizionamento di questi tre modelli economici è guardare quanto costa, nella stessa famiglia, passare al modello di punta. In casa OpenAI il salto da GPT-6 Luna a GPT-6 Sol porta il prezzo da 0,10$/0,50$ a 2$/10$ per milione di token, un aumento di 20 volte sull’input e altrettanto sull’output. In casa Anthropic, il confronto tra Haiku 5.5 e il modello di punta Opus 5.5, che secondo la documentazione ufficiale sulla pagina dei prezzi di Claude parte da 10$ di input e 50$ di output per milione di token, porta a un rapporto ancora più ampio, fino a 100 volte sulla tariffa base di Haiku.

Google non pubblica nelle fonti consultate un confronto diretto equivalente per Gemini, ma la logica di mercato è la stessa: i modelli Flash sono pensati per assorbire il traffico che non richiede il massimo di capacità di ragionamento, lasciando ai modelli Pro o Ultra della stessa famiglia i task che giustificano un costo per token più alto. La domanda pratica per chi progetta un’architettura multi-modello non è quindi “quale modello è il migliore in assoluto”, ma “quale percentuale del mio traffico posso instradare verso il livello economico senza perdere qualità percepita dall’utente finale”. Più alta è quella percentuale, più il risparmio aggregato si avvicina ai rapporti di 20x o 100x descritti sopra.

La reazione della community sviluppatori

Il lancio di Claude Haiku 5.5 ha generato una discussione concreta su Hacker News, dove il punto più contestato non è il prezzo base, accolto positivamente, ma la soglia dei 100.000 token che fa scattare la tariffa quintuplicata. Il commento più condiviso nella discussione definisce quella soglia troppo bassa rispetto a una finestra di contesto pubblicizzata come un milione di token, un’osservazione che riflette un problema reale di comunicazione: un’azienda che promuove “1M di contesto” nel titolo del lancio, ma applica il prezzo premium per il 90% di quella finestra, rischia di creare aspettative sbagliate in chi non legge la pagina dei prezzi riga per riga.

Su scala più ampia, i canali di settore che monitorano i prezzi dei modelli linguistici, come BenchLM e AI/TLDR, hanno inquadrato il lancio di Haiku 5.5 e di GPT-6 Luna come parte di una tendenza di fondo: i margini sui modelli piccoli si stanno comprimendo più in fretta di quelli sui modelli di punta, perché la concorrenza su quella fascia è diretta, immediata e facilmente misurabile da chiunque abbia una bolletta API da confrontare mese su mese. In questo contesto, il vero banco di prova non è il prezzo di lancio annunciato in un post ufficiale, ma la fattura reale che un team tecnico vede arrivare dopo un mese di traffico misto.

Sei casi d’uso reali: chi dovrebbe scegliere cosa

Per rendere il confronto concreto, ecco cinque scenari tipici con l’indicazione del modello più sensato in base ai dati raccolti.

  • Help desk SaaS con 50.000 ticket al giorno: i ticket raramente superano qualche migliaio di token. Claude Haiku 5.5 resta sotto la soglia dei 100.000 token quasi sempre, quindi beneficia della tariffa base più bassa del gruppo senza mai toccare lo scaglione penalizzante.
  • Redazione che riassume report da 300 pagine: un documento di quella lunghezza supera facilmente i 100.000 token. Gemini 3.6 Flash, con prezzo lineare e benchmark pubblici su task lunghi, evita la sorpresa dello scaglione a cinque volte il prezzo che colpirebbe Haiku 5.5 sullo stesso documento.
  • App di fatturazione che estrae campi da PDF scansionati: GPT-6 Luna, con la Decisions API pensata proprio per trasformare testo e immagini in risposte strutturate, è il caso d’uso più allineato alla documentazione ufficiale OpenAI per questo modello.
  • Startup che fa evaluation A/B su un chatbot di supporto: la scelta sensata è testare tutti e tre in parallelo per due o tre settimane su traffico reale, misurando costo per conversazione risolta, non costo per token, prima di impegnarsi su un singolo fornitore.
  • Team DevOps che classifica log applicativi 24/7: un volume enorme di richieste piccole e ripetitive, il profilo ideale sia per Haiku 5.5 sotto i 100K token sia per GPT-6 Luna, con la scelta finale che dipende più dall’ecosistema cloud già in uso (Anthropic Console contro piattaforma OpenAI) che dalla pura differenza di prezzo, che qui è nulla.
  • Piattaforma e-learning che genera quiz da dispense universitarie: le dispense possono facilmente superare le 150-200 pagine, quindi avvicinarsi o superare i 100.000 token. In questo scenario Gemini 3.6 Flash evita lo scaglione penalizzante di Haiku 5.5 e porta con sé punteggi pubblici su MLE-Bench e DeepSWE utili se il quiz generato include anche esercizi di programmazione.

Guida alla migrazione: passare da un modello all’altro senza sorprese

Chi già usa Claude Haiku 4.5 o GPT-5.6 Luna in produzione e vuole passare alla nuova generazione dovrebbe seguire alcuni passaggi prima di sostituire il modello in blocco su tutto il traffico. La migrazione tra modelli della stessa famiglia è quasi sempre più semplice di un cambio di fornitore, ma anche un aggiornamento “minore” come questo può introdurre regressioni se non viene testato con lo stesso rigore di un cambio di provider completo. Il changelog ufficiale di OpenAI e quello di developers.openai.com restano i riferimenti da consultare prima di ogni switch, insieme alle pagine di OpenRouter per chi instrada le richieste attraverso un aggregatore multi-provider.

  • Misura la distribuzione reale della lunghezza dei prompt. Prima di migrare a Haiku 5.5, estrai dai log degli ultimi 30 giorni la percentuale di richieste che supera i 100.000 token. Se è sotto il 5%, il risparmio è quasi garantito. Se è sopra il 20%, il costo medio potrebbe addirittura salire.
  • Aggiorna l’identificatore del modello nel codice. Anthropic usa l’identificativo claude-haiku-5-5, OpenAI ha spostato Luna su gpt-6-luna nell’API: un semplice cambio di stringa, ma va testato su un ambiente di staging prima del rilascio in produzione.
  • Ricalibra il parametro di reasoning. Con Haiku 5.5 il parametro “effort” sostituisce comportamenti impliciti della versione precedente: va impostato esplicitamente, altrimenti si rischia di pagare per un livello di ragionamento più alto di quello necessario.
  • Verifica la cache dei prompt. I prezzi di cache read e cache write sono cambiati in entrambe le famiglie: chi si basa su prompt caching per ridurre i costi deve ricalcolare il risparmio netto con le nuove tariffe, non assumere che resti proporzionale a quello precedente.
  • Esegui un periodo di shadow traffic. Instrada una quota piccola ma significativa di richieste reali (il 5-10%) al nuovo modello, confrontando qualità delle risposte e costo effettivo per 1-2 settimane, prima di spostare il 100% del traffico.
  • Imposta un alert sui costi. Vista la tariffazione a scaglioni di Haiku 5.5, conviene configurare un avviso che scatti quando la quota di richieste sopra i 100.000 token supera una soglia prefissata, per evitare bollette fuori budget a fine mese.

Pro e contro di Claude Haiku 5.5

Il bilancio di Haiku 5.5 dipende quasi interamente dal profilo dei prompt che riceve in produzione.

  • Pro: tariffa base tra le più basse del mercato, fino al 90% più economica della generazione precedente.
  • Pro: parametro “effort” per regolare costo e qualità richiesta per richiesta.
  • Pro: finestra di contesto da 1 milione di token, in linea con i concorrenti.
  • Contro: scaglione di prezzo a 5x oltre i 100.000 token, criticato pubblicamente su Hacker News come troppo aggressivo.
  • Contro: benchmark numerici ufficiali comparabili (MMLU, GPQA, SWE-bench) non pubblicati da Anthropic al momento della scrittura.

Pro e contro di Gemini 3.6 Flash

  • Pro: unica scheda di benchmark pubblica e completa tra i tre modelli, con punteggi verificabili su più siti terzi.
  • Pro: prezzo lineare per token, senza scaglioni nascosti dopo una certa soglia di contesto.
  • Pro: riduzione dei token generati rispetto alla generazione precedente, con risparmio reale sull’output.
  • Contro: prezzo di listino da 7 a 10 volte superiore a Haiku 5.5 e GPT-6 Luna sotto i 100.000 token.
  • Contro: tariffa introduttiva destinata a raddoppiare dal 1° gennaio 2027.

Pro e contro di GPT-6 Luna

  • Pro: prezzo identico alla tariffa base di Haiku 5.5, senza scaglioni dichiarati nelle fonti consultate.
  • Pro: Decisions API nativa per output strutturati da testo e immagini.
  • Pro: volume d’uso più alto al mondo, essendo il default gratuito di ChatGPT.
  • Contro: finestra di contesto dichiarata solo da fonti secondarie, non da una scheda tecnica ufficiale con cifra esatta.
  • Contro: l’unico dato pubblico di valutazione è una metrica di sicurezza (robustezza della gerarchia delle istruzioni), non un benchmark di capacità generale.

Il verdetto: non c’è un vincitore unico, ci sono tre strategie diverse

Sui numeri raccolti, nessuno dei tre modelli domina su tutti i fronti. Se il criterio è il prezzo puro per prompt corti, Claude Haiku 5.5 e GPT-6 Luna sono appaiati a 0,10$/0,50$ per milione di token, e la scelta tra loro si riduce all’ecosistema cloud già in uso e al bisogno o meno del parametro “effort”. Se il criterio è la prevedibilità su contesti lunghi, Gemini 3.6 Flash vince per distacco, nonostante costi di listino più alti, perché non applica lo scaglione a cinque volte il prezzo che penalizza Haiku 5.5 sopra i 100.000 token.

Se invece il criterio è la qualità misurabile su benchmark pubblici e verificabili da terzi, Gemini 3.6 Flash è ancora l’unico dei tre con una scheda tecnica completa: un punteggio Terminal-Bench 2.1 dell’84,7% è un dato concreto su cui costruire un confronto, mentre le affermazioni “batte quasi ovunque” riportate per Haiku 5.5 restano, per ora, affermazioni di terze parti senza tabella numerica ufficiale a supporto. Per chi deve decidere oggi, la raccomandazione pratica è segmentare il traffico per lunghezza del prompt: Haiku 5.5 o GPT-6 Luna per tutto ciò che resta sotto i 100.000 token, Gemini 3.6 Flash per i casi che superano regolarmente quella soglia.

C’è anche una terza variabile che pesa più del prezzo nominale: dove vive già il resto dello stack applicativo. Un team che usa Google Cloud per storage, autenticazione e logging risparmia tempo di integrazione scegliendo Gemini 3.6 Flash, anche a parità di costo per token con le alternative. Lo stesso vale per chi ha già costruito agenti su Claude tramite l’SDK di Anthropic, o per chi ha un prodotto consumer collegato a ChatGPT e trova naturale restare nell’ecosistema OpenAI per sfruttare funzioni come la Decisions API. Il prezzo per milione di token è il primo filtro, ma raramente è l’unico che decide la scelta finale in un’azienda con un’infrastruttura già consolidata.

Come abbiamo verificato questi dati

Ogni cifra riportata in questo confronto proviene da una pagina ufficiale del produttore (Anthropic, Google DeepMind o OpenAI) oppure da una fonte terza nominata esplicitamente nel testo, come la pagina prezzi dell’API Gemini, OpenRouter, BenchLM o BenchLeader. Dove le fonti disponibili al momento della scrittura non riportavano un dato con sufficiente certezza, per esempio il knowledge cutoff di Claude Haiku 5.5 o il set completo di modalità multimodali di Gemini 3.6 Flash, lo abbiamo segnalato come “non dichiarato nelle fonti consultate” invece di stimarlo o di riportare un numero preso da un modello diverso della stessa famiglia.

Questo approccio ha un costo: alcune celle delle tabelle restano vuote o incomplete, e un confronto totalmente omogeneo su tutti i benchmark non è possibile con i dati pubblicati a oggi dai tre produttori. Il vantaggio è che ogni numero presente nel testo può essere verificato da chi legge, semplicemente seguendo il link alla fonte citata. Vista la velocità con cui queste aziende aggiornano prezzi e specifiche, anche nell’arco di pochi giorni come dimostra il passaggio da GPT-5.6 Luna a GPT-6 Luna, consigliamo di controllare le pagine ufficiali collegate prima di impegnare un budget su scala annuale.

Domande frequenti

Qual è il modello più economico tra Claude Haiku 5.5, Gemini 3.6 Flash e GPT-6 Luna?

Per prompt sotto i 100.000 token, Claude Haiku 5.5 e GPT-6 Luna sono appaiati a 0,10$ di input e 0,50$ di output per milione di token, entrambi più economici di Gemini 3.6 Flash, che parte da 0,75$/3,75$. Sopra i 100.000 token, Haiku 5.5 sale a 0,50$/2,50$ per via dello scaglione dichiarato da Anthropic.

Claude Haiku 5.5 conviene per prompt molto lunghi?

Non quanto per i prompt corti. Superati i 100.000 token il prezzo di Haiku 5.5 sale di cinque volte sia in input che in output, una soglia che un utente di Hacker News ha definito troppo bassa rispetto alla finestra di contesto dichiarata di un milione di token.

Gemini 3.6 Flash ha davvero un milione di token di contesto al prezzo introduttivo?

Sì, la finestra di contesto da 1 milione di token è confermata dalla model card ufficiale di Google DeepMind, ma la tariffa introduttiva di 0,75$/3,75$ per milione di token vale solo fino al 31 dicembre 2026. Dal 1° gennaio 2027 il prezzo standard raddoppia a 1,50$/7,50$.

GPT-6 Luna è lo stesso modello di GPT-5.6 Luna?

No. GPT-6 Luna è un modello nuovo, introdotto da OpenAI il 7 ottobre 2026 e distribuito come default per gli utenti Free e Go di ChatGPT dall’8 ottobre, in sostituzione di GPT-5.6 Luna. Il prezzo è sceso del 50%, da 0,20$/1,20$ a 0,10$/0,50$ per milione di token.

Quale dei tre modelli è più adatto al coding agentico?

In base ai dati disponibili, Gemini 3.6 Flash è il solo con benchmark pubblici specifici su coding agentico, tra cui un punteggio dell’84,7% su Terminal-Bench 2.1 e del 64,7% su SWE-Bench Pro. Per Claude Haiku 5.5 e GPT-6 Luna non sono stati pubblicati, al momento della scrittura, punteggi ufficiali comparabili su questi stessi benchmark.

Posso usare uno di questi tre modelli gratuitamente?

Solo GPT-6 Luna è disponibile gratuitamente, come modello predefinito per gli account Free e Go di ChatGPT. Claude Haiku 5.5 e Gemini 3.6 Flash sono accessibili solo tramite API a pagamento, anche se Gemini 3.6 Flash ha una tariffa introduttiva più bassa di quella standard fino a fine 2026.

Questi modelli supportano l’input di immagini e il tool calling?

GPT-6 Luna supporta testo e immagini tramite la Decisions API di OpenAI, documentata nel changelog ufficiale. Per Claude Haiku 5.5 e Gemini 3.6 Flash le fonti consultate non elencano in modo esplicito il set completo di modalità supportate: conviene verificare la documentazione API aggiornata prima di progettare un’integrazione multimodale in produzione.

Come faccio a migrare da Claude Haiku 4.5 a Haiku 5.5 senza aumentare i costi?

Il passaggio più importante è misurare quale percentuale dei prompt attuali supera i 100.000 token prima di spostare tutto il traffico. Se la quota è bassa, il risparmio è quasi automatico grazie al taglio di prezzo fino al 90%. Se è alta, conviene instradare solo una parte del traffico su Haiku 5.5 e lasciare il resto su un modello a prezzo lineare come Gemini 3.6 Flash.