Il 22 settembre 2026 OpenAI e Anthropic hanno pubblicato due modelli a distanza di poche ore: GPT-6 Sol (insieme al più economico GPT-6 Luna) e Claude Opus 5.5. Non è un caso isolato: negli ultimi mesi i due laboratori si sono rincorsi quasi settimana per settimana, come avevamo già documentato nel confronto tra GPT-6 Astra e Gemini 3.8 Flash. Questa volta, però, il divario di prezzo è netto fin dal primo giorno: Sol costa esattamente la metà di Opus 5.5 su ogni token, sia in input che in output. La domanda che si pongono sviluppatori e aziende italiane è semplice: conviene di più il modello economico o quello che vince quasi tutti i benchmark condivisi? Questo confronto mette in fila prezzi, specifiche tecniche, punteggi verificati da fonti indipendenti e casi d’uso concreti, evitando di mischiare numeri che le due aziende non hanno mai testato l’uno contro l’altro in modo diretto.

Per chi gestisce un budget API in euro, il momento del confronto non è casuale. Il cambio di generazione arriva mentre molte aziende italiane stanno ancora ammortizzando i costi di integrazione dei modelli lanciati in estate, e un taglio di prezzo del 20-50% su entrambi i fronti cambia in modo concreto il calcolo del ritorno sull’investimento per chi usa questi modelli in produzione. Vale la pena guardare oltre il comunicato stampa e capire cosa cambia davvero riga per riga, dalla finestra di contesto al costo reale per attività completata.

GPT-6 Sol e Claude Opus 5.5: due lanci a poche ore di distanza

GPT-6 Sol nasce come il livello intermedio della famiglia GPT-6, erede diretto di GPT-5.6 Sol e fratello minore di GPT-6 Astra, uscito il 3 settembre 2026 come modello di punta per l’uso del computer. OpenAI lo posiziona esplicitamente per attività di lavoro complesse a costo contenuto, non come sfidante diretto dei modelli di punta di Anthropic. Lo conferma il materiale di lancio riportato da explainx.ai, dove OpenAI descrive Sol come pensato per “prendere in carico compiti di lavoro difficili offrendo più margine di iterazione grazie a limiti d’uso più alti e costi più bassi, con più intelligenza e risultati migliori rispetto a modelli concorrenti dello stesso prezzo” (fonte: explainx.ai).

Claude Opus 5.5, invece, sostituisce Opus 5 come modello di punta di Anthropic per ragionamento e coding agentico, mantenendo lo stesso identificativo di famiglia (claude-opus-5-5) ma con un taglio di prezzo del 20% e miglioramenti di efficienza che Anthropic dichiara pubblicamente sul proprio sito ufficiale (anthropic.com/claude/opus). Il paragone naturale, secondo la stessa Anthropic, non è con Sol ma con GPT-6 Astra: l’azienda sostiene che Opus 5.5 batta Astra a una frazione del suo costo sui benchmark condivisi, posizionandosi quindi contro il modello di punta di OpenAI e non contro quello di fascia media. È lo stesso schema già visto quando avevamo confrontato Claude Opus 5 e GPT-5.6: ogni azienda sceglie il proprio metro di paragone preferito.

Il risultato è che GPT-6 Sol e Claude Opus 5.5 non sono mai stati testati l’uno contro l’altro con un benchmark controllato e pubblicato da nessuna delle due aziende. Ogni numero che segue in questo articolo proviene dai materiali di lancio separati di OpenAI e Anthropic, più le misurazioni indipendenti di Artificial Analysis, e viene citato con la fonte esatta.

Specifiche tecniche a confronto: la tabella completa

Ecco un riepilogo delle specifiche verificabili per entrambi i modelli, con le fonti principali indicate riga per riga dove i dati provengono da terze parti anziché dalla documentazione ufficiale.

SpecificaGPT-6 Sol (OpenAI)Claude Opus 5.5 (Anthropic)
Data di rilascio22 settembre 202622 settembre 2026
Identificativo modelloopenai/gpt-6-solclaude-opus-5-5
Finestra di contesto1.050.000 token (fino a 922.000 in input)1.000.000 di token standard
Output massimo128.000 token128.000 token (300.000 in modalità Batch beta)
Sovrapprezzo long-contextOltre 272.000 token in input: 2x su input/cache, 1,5x su output per l’intera richiestaTariffa standard fino a 1M di token, nessun sovrapprezzo dichiarato
Input multimodaleTesto, immagini, fileTesto, immagini (documenti, grafici, screenshot, diagrammi)
RagionamentoEffort configurabile (incluso livello “xhigh”)Adaptive thinking sempre attivo
Knowledge cutoff20 aprile 2026 (da tracker terzi, non confermato ufficialmente)Giugno 2026 (da tracker terzi, non confermato ufficialmente)
DisponibilitàChatGPT Work e Codex (piani Plus/Pro/Business/Enterprise/Edu); Luna anche su app desktop freeClaude Developer Platform, AWS Bedrock, Google Cloud Vertex AI, Microsoft Azure
Integrazione Microsoft 365 CopilotSìSì
Modalità veloce dedicataNon dichiarata nei materiali di lancioFast mode fino a 2,5x più veloce (Claude Code e Claude Platform)

Il dato più interessante è la finestra di contesto: GPT-6 Sol dichiara 1,05 milioni di token contro 1 milione di Opus 5.5, ma applica un sovrapprezzo se si superano i 272.000 token in ingresso, cosa che Opus 5.5 non fa fino al tetto di un milione. Per chi lavora su codebase molto grandi, questa differenza pesa più della finestra nominale in sé (fonte: DigitalApplied).

Prezzi per milione di token: chi costa meno davvero

Sul prezzo di listino non c’è partita: GPT-6 Sol costa esattamente la metà di Claude Opus 5.5 su ogni categoria di token. OpenAI ha comunicato che il taglio rispetto a GPT-5.6 è del 50% rispetto al prezzo promozionale precedente, mentre Anthropic ha ridotto Opus 5.5 del 20% rispetto a Opus 5 sui token grezzi e addirittura del 60% sulla lettura dalla cache.

Voce di prezzoGPT-6 SolClaude Opus 5.5
Input (per milione di token)2,00 $4,00 $
Output (per milione di token)10,00 $20,00 $
Lettura cache (per milione di token)0,20 $ (da listino di terze parti, non confermato da OpenAI)0,20 $ (contro 0,50 $ di Opus 5, -60%)
Scrittura cache (per milione di token)Non pubblicata5,00 $
Modalità veloce (input/output)Non disponibile8,00 $ / 40,00 $
Prezzo modello precedente (input/output)GPT-5.6 Sol: prezzo dimezzato rispetto alla tariffa promozionaleOpus 5: 5,00 $ / 25,00 $ (-20% su Opus 5.5)

Le fonti concordano sul punto centrale: sia The Register che MacRumors riportano lo stesso rapporto di prezzo 2:1 tra Sol e Opus 5.5 (The Register, MacRumors). OpenAI ha dichiarato apertamente il motivo del taglio: “i miglioramenti nel caching e nell’inferenza ci permettono di offrire questi modelli a un costo inferiore, e stiamo trasferendo questi risparmi direttamente a utenti e clienti riducendo i prezzi API di Sol e Luna del 50% rispetto alla tariffa promozionale di GPT-5.6” (fonte: The Register). Ma il prezzo di listino non racconta tutta la storia, come vedremo nella sezione sui benchmark del costo per attività.

Benchmark: AutomationBench, Terminal-Bench 4.0 e Intelligence Index

Qui i numeri vanno letti con attenzione perché arrivano da fonti diverse: i punteggi di Opus 5.5 sono dichiarati da Anthropic, quelli di GPT-6 Sol su Terminal-Bench arrivano dalla misurazione indipendente di Artificial Analysis, perché OpenAI non ha pubblicato una cifra propria su quel benchmark specifico. Su ogni parametro dove esiste un confronto diretto, Opus 5.5 è avanti.

BenchmarkClaude Opus 5.5GPT-6 SolFonte
AutomationBench (xhigh)40,0%33,2%Materiali di lancio OpenAI/Anthropic, via explainx.ai
Terminal-Bench 4.0 (max/xhigh)66,4%43,0% – 43,9%Anthropic (Opus 5.5) e Artificial Analysis (Sol)
FrontierCode v1.154,4%Non pubblicato (OpenAI dichiara parità con Fable 5.1)explainx.ai
Artificial Analysis Intelligence Index57,647,5Techtimes.com e CatDoes.com
Terminal-Bench 4.0 vs GPT-5.6 Sol (confronto ufficiale Anthropic)66,4%37,3% (GPT-5.6 Sol, non Sol 6)Anthropic, via explainx.ai

Il divario più ampio è su Terminal-Bench 4.0, dove Opus 5.5 supera Sol di circa 54 punti percentuali relativi. Va detto che le due cifre non sono perfettamente comparabili: derivano da metodologie diverse (Anthropic testa se stessa, Artificial Analysis testa Sol), quindi il gap reale potrebbe essere leggermente diverso da quello riportato. Anche su AutomationBench, però, dove entrambe le aziende hanno usato lo stesso effort level “xhigh”, Opus 5.5 resta avanti di quasi 7 punti percentuali.

Anche l’Artificial Analysis Intelligence Index, un punteggio aggregato che pesa più benchmark in un unico numero, colloca Opus 5.5 a 57,6 contro il 47,5 di Sol, un divario riportato in modo indipendente da due fonti diverse (Techtimes.com e CatDoes.com), il che rafforza l’affidabilità del dato rispetto a una singola misurazione isolata. Va comunque ricordato che un indice aggregato nasconde le differenze tra le singole categorie di task: un’azienda che lavora quasi esclusivamente su compiti di classificazione semplice potrebbe trovare il divario reale molto più piccolo di quanto suggerisca l’indice complessivo.

Sul fronte BenchLM, un altro aggregatore che pesca da più test pubblici, GPT-6 Sol ottiene un punteggio di 81,3 su 100 e si piazza al quarto posto su 507 modelli testati complessivamente, con il punto di forza principale nella categoria “Knowledge”, dove si posiziona sesto (fonte: BenchLM). Non è un dato direttamente comparabile con l’Intelligence Index di Artificial Analysis, perché le due classifiche pesano benchmark diversi con metodologie proprie, ma conferma che Sol non è un modello debole in assoluto: è semplicemente più indietro quando il paragone è specificamente con un modello di fascia superiore come Opus 5.5.

Il costo per attività cambia la prospettiva

Il dato che ribalta parzialmente il discorso è il costo per singola attività completata, misurato da Artificial Analysis: GPT-6 Sol costa circa 1,06 $ per task, mentre Claude Opus 5.5 arriva a circa 5,98 $, quasi 5,6 volte tanto. Il motivo non è solo il prezzo per token più alto, ma il fatto che Opus 5.5 ragiona più a lungo prima di rispondere, consumando più token totali per lo stesso compito. È lo stesso schema di prezzo-prestazioni già visto in Claude Opus 5 contro Fable 5.1: il modello più costoso vince quasi sempre sui benchmark, ma il divario di costo reale è più ampio del semplice prezzo di listino.

OpenAI ha usato proprio questo argomento nel proprio materiale di lancio, dichiarando che Sol a effort “xhigh” batte Claude Opus 5 (il modello precedente, non Opus 5.5) a effort massimo su AutomationBench spendendo solo il 9% del suo costo per attività. È un dato reale, ma calcolato contro Opus 5, che il giorno stesso ha ricevuto un taglio di prezzo del 20% sui token grezzi e del 60% sulla cache: ricalcolato contro Opus 5.5, il vantaggio di costo di Sol resterebbe comunque ampio ma meno estremo di come viene presentato nel materiale originale.

Finestra di contesto e sovrapprezzo long-context

Entrambi i modelli superano la soglia del milione di token, ma con condizioni diverse. Claude Opus 5.5 applica la tariffa standard ($4/$20 per milione) fino al tetto di un milione di token, senza scaglioni aggiuntivi secondo le note di rilascio ufficiali di Anthropic (docs.anthropic.com), che indicano testualmente: “ha una finestra di contesto di 1M di token di default, 128k token di output massimo, e adaptive thinking sempre attivo, a 4$/20$ USD per MTok”.

GPT-6 Sol, invece, dichiara 1.050.000 token totali ma introduce un sovrapprezzo oltre i 272.000 token di input: le tariffe raddoppiano su input e cache, e salgono di 1,5 volte sull’output, applicate all’intera richiesta e non solo alla parte eccedente. Per un’applicazione che lavora costantemente con prompt molto lunghi (analisi di intere codebase, documenti legali estesi, log applicativi) questo dettaglio può ribaltare il confronto di costo calcolato solo sul prezzo base per milione di token.

Multimodalità e capacità di visione

Sul fronte multimodale entrambi i modelli accettano testo e immagini. Anthropic descrive Opus 5.5 come “il miglior modello Opus per la visione e l’uso del computer”, capace di leggere documenti densi, grafici, screenshot e diagrammi complessi ad alta fedeltà per l’estrazione di dati e l’analisi visiva (fonte: Anthropic). GPT-6 Sol, secondo la scheda tecnica pubblicata da Kilo Code, accetta testo, immagini e file come input, senza però l’enfasi specifica sull’uso del computer che caratterizza il modello di punta GPT-6 Astra (fonte: Kilo Code).

Nessuna delle due aziende ha confermato ufficialmente input audio o video nativi per questi due modelli specifici: se la tua applicazione richiede quelle modalità, resta necessario verificare la documentazione API più recente prima di scegliere, perché entrambe le famiglie di modelli evolvono rapidamente su questo fronte.

Integrazione con gli strumenti di sviluppo quotidiani

Un fattore spesso sottovalutato in questo tipo di confronto è dove il modello arriva prima, e con quale livello di integrazione. GPT-6 Sol è disponibile da subito dentro ChatGPT Work e Codex per gli abbonati Plus, Pro, Business, Enterprise ed Edu, mentre GPT-6 Luna, la variante ancora più economica, è accessibile anche nell’app desktop gratuita e nel piano Go (fonte: 9to5Google). Per i team che già lavorano dentro l’ecosistema Codex, questo significa poter testare Sol senza modificare la pipeline di deploy, semplicemente cambiando il modello selezionato nell’interfaccia o nella configurazione del progetto.

Claude Opus 5.5, dal canto suo, è disponibile sulla Claude Developer Platform con l’identificativo claude-opus-5-5 e, cosa rilevante per le aziende europee con vincoli su dove risiedono i dati, anche tramite tre grandi fornitori cloud: AWS Bedrock, Google Cloud Vertex AI e Microsoft Azure (fonte: SiliconANGLE). Entrambi i modelli sono stati inoltre integrati in Microsoft 365 Copilot, anche se Microsoft non ha ancora pubblicato dettagli su finestre di contesto, livelli di ragionamento o accesso agli strumenti disponibili all’interno di Word ed Excel per nessuno dei due (fonte: WindowsForum). Per i team che sviluppano con Claude Code, la disponibilità della Fast mode a 2,5 volte la velocità standard è un argomento pratico in più a favore di Opus 5.5 nei flussi di lavoro dove il tempo di risposta percepito dall’utente conta quanto il costo per token.

Il taglio della cache che pesa più del prezzo di listino

Un dettaglio facile da perdere in un confronto superficiale: Anthropic ha tagliato il prezzo di lettura dalla cache di Opus 5.5 del 60%, passando da 0,50 $ a 0,20 $ per milione di token, una riduzione molto più aggressiva del 20% applicato ai prezzi grezzi di input e output. Dato che le letture dalla cache dominano il costo di qualsiasi sessione agentica di lunga durata (un agente che rilegge ripetutamente lo stesso contesto di sistema o la stessa codebase), questo taglio specifico incide sulla spesa mensile reale più del prezzo di listino su cui si concentra la maggior parte dei confronti superficiali.

Sul fronte GPT-6 Sol, i materiali di lancio ufficiali di OpenAI non includono una scomposizione altrettanto dettagliata del prezzo cache: il valore di 0,20 $ per milione riportato da alcuni aggregatori terzi come Kilo Code non risulta confermato in modo esplicito dalla documentazione OpenAI consultata. È un vuoto informativo che vale la pena segnalare a chi deve calcolare un budget preciso per un carico di lavoro agentico di lunga durata su entrambi i modelli.

Cosa dicono OpenAI e Anthropic sul posizionamento dei due modelli

Le due aziende sono state esplicite, ognuna a modo suo, su chi considerano il vero rivale del proprio modello. Anthropic inquadra Opus 5.5 come il modello di punta quotidiano, rivendicando di battere GPT-6 Astra (il modello top di gamma di OpenAI, non Sol) a una frazione del suo costo sui benchmark condivisi: significa che Anthropic stessa posiziona Opus 5.5 contro il livello Astra, non contro Sol.

OpenAI, dal canto suo, ha scelto un metro di paragone di natura diversa: Sol viene descritto come pensato per chi cerca “più intelligenza e risultati migliori rispetto a modelli concorrenti dello stesso prezzo”, un confronto esplicitamente limitato ai modelli della stessa fascia di prezzo, non al modello di punta di Anthropic (fonte: explainx.ai). Mettendo le due posizioni una accanto all’altra, nessuna delle due aziende rivendica di aver costruito il vincitore di questo specifico confronto testa a testa: ognuna gioca su un metro di paragone diverso, il che è esattamente il motivo per cui un confronto imparziale richiede dati esterni a entrambi i materiali di marketing.

Questa strategia di scegliere il proprio rivale preferito non è nuova: Anthropic l’aveva già applicata quando aveva messo Opus 5.5 a confronto diretto con Grok 4.7 di xAI pochi giorni prima del lancio di Sol, e Google aveva fatto lo stesso quando aveva posizionato Gemini contro Claude Opus 5 su SWE-bench. Il pattern che emerge in tutto il settore è coerente: ogni laboratorio pubblica i confronti che lo favoriscono e lascia agli osservatori indipendenti, o alla stampa specializzata, il compito di ricostruire il quadro completo mettendo insieme le fonti separate.

5 casi d’uso reali: quale modello scegliere per il tuo progetto

Sulla base dei dati di prezzo e benchmark raccolti, ecco cinque scenari concreti e quale modello si adatta meglio a ciascuno.

  • Customer support automatizzato ad alto volume (e-commerce, telco): migliaia di richieste ripetitive al giorno, dove la maggior parte dei ticket riguarda resi, stato ordine o domande frequenti già coperte da una knowledge base. GPT-6 Sol è la scelta più razionale: il costo per attività di circa 1,06 $ contro i 5,98 $ di Opus 5.5 rende la differenza enorme su scala, e la complessità dei task raramente giustifica il ragionamento più profondo di Opus 5.5. Su un volume di centomila richieste al mese, la differenza di costo si misura in migliaia di euro, non in centesimi.
  • Refactoring di codebase legacy multi-file (software house, banche, assicurazioni): task lunghi e complessi, spesso su sistemi Cobol o Java risalenti a decenni fa, dove un errore di ragionamento costa più in ore di debugging umano del token risparmiato sull’API. Claude Opus 5.5 è preferibile: il vantaggio di 54 punti percentuali su Terminal-Bench 4.0 si traduce concretamente in meno interventi manuali di correzione e meno cicli di revisione del codice generato.
  • Startup SaaS in fase di crescita con budget limitato: prototipazione rapida di funzionalità AI, dove il volume di chiamate cresce insieme alla base utenti ma il margine per singola transazione resta sottile. GPT-6 Sol, grazie al prezzo dimezzato e alla finestra di contesto di 1,05 milioni di token per la maggior parte dei task sotto i 272.000 token, offre il miglior rapporto costo-capacità nella fase in cui ogni euro di infrastruttura pesa sul runway.
  • Agenzie di consulenza IT italiane che gestiscono ticket multipli per più clienti: volumi medio-alti, task di media complessità, con la necessità di rispettare SLA diversi per ogni cliente. Una combinazione ibrida è realistica: Sol per la classificazione e la prima risposta automatizzata, Opus 5.5 per l’escalation sui casi complessi che richiedono ragionamento più profondo o interpretazione di documenti tecnici allegati.
  • Fintech con requisiti di compliance e analisi documentale: analisi di contratti, estrazione dati da documenti densi, verifica di conformità normativa in ambito bancario o assicurativo. Le capacità di visione dichiarate ufficialmente da Anthropic per Opus 5.5 su documenti, grafici e screenshot ad alta fedeltà lo rendono la scelta più sicura quando l’accuratezza pesa più del costo per token, soprattutto in contesti dove un errore ha implicazioni regolatorie.

In tutti e cinque i casi, il criterio decisivo non è “quale modello è più intelligente” in astratto, ma quanto costa un errore rispetto a quanto costa un token in più. Dove l’errore è economico da correggere, Sol vince quasi sempre sul totale. Dove l’errore è costoso da correggere, il prezzo più alto di Opus 5.5 si ripaga da solo.

Guida alla migrazione: passare a GPT-6 Sol o a Claude Opus 5.5

Chi già usa le versioni precedenti di questi modelli può aggiornare con modifiche minime al codice, ma alcuni dettagli tecnici richiedono attenzione prima del deploy in produzione.

Migrare da GPT-5.6 Sol a GPT-6 Sol

Il cambio più semplice è aggiornare l’identificativo del modello nella chiamata API. Prima di spostare traffico di produzione, però, verifica due cose: il comportamento dei prompt superiori ai 272.000 token, dato che il sovrapprezzo long-context si applica all’intera richiesta e non solo alla parte eccedente, e i nuovi limiti di utilizzo più alti annunciati da OpenAI, che potrebbero cambiare la logica di retry e throttling già implementata per GPT-5.6.

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-sol",
    "input": "Analizza questo documento e riassumi i punti chiave.",
    "reasoning": { "effort": "high" }
  }'

Migrare da Claude Opus 5 a Claude Opus 5.5

Anche qui il cambio base è l’identificativo del modello, da sostituire con claude-opus-5-5 nelle chiamate alla Claude Developer Platform o al provider cloud in uso (AWS Bedrock, Google Cloud Vertex AI o Microsoft Azure). Anthropic dichiara che Opus 5.5 risolve più attività reali da riga di comando rispetto a Opus 5 effettuando circa il 40% di chiamate in meno e usando la metà dei token: significa che, dopo la migrazione, è ragionevole aspettarsi una spesa mensile inferiore a parità di carico di lavoro, non superiore, nonostante il modello resti più costoso per token rispetto a Sol. Chi usa Claude Code può inoltre valutare la Fast mode a 8 $/40 $ per milione di token per i workflow dove la velocità di risposta conta più del costo marginale.

Per chi valuta invece una migrazione tra provider diversi (da OpenAI ad Anthropic o viceversa), il lavoro non si limita a cambiare l’endpoint: formato dei messaggi, schema del tool-calling e gestione del ragionamento (effort su Sol, adaptive thinking su Opus 5.5) sono strutturalmente diversi e richiedono test dedicati prima di qualsiasi rollout, oltre a un piano di rollback che mantenga temporaneamente attivo il vecchio modello per una percentuale del traffico.

In entrambi i casi, il consiglio pratico più utile è monitorare il costo per attività completata fin dal primo giorno, non solo il costo per token. Un dashboard che traccia quante chiamate servono in media per chiudere un task (una metrica interna, facile da calcolare dai log applicativi) rivela molto più della sola spesa mensile aggregata, soprattutto quando si confrontano modelli con logiche di ragionamento diverse come effort configurabile su Sol e adaptive thinking sempre attivo su Opus 5.5. Vale anche la pena fissare un budget di allarme sui prompt che superano i 272.000 token se si sceglie Sol, proprio per il sovrapprezzo long-context che si applica all’intera richiesta.

Pro e contro di GPT-6 Sol

Pro:

  • Prezzo dimezzato rispetto a Claude Opus 5.5 su ogni categoria di token.
  • Finestra di contesto nominale più ampia (1,05 milioni di token contro 1 milione).
  • Costo per attività completata molto più basso secondo Artificial Analysis (1,06 $ contro 5,98 $).
  • Punteggio aggregato solido su BenchLM: 81,3/100, quarto posto su 194 modelli testati.
  • Disponibile da subito su ChatGPT Work, Codex e Microsoft 365 Copilot.

Contro:

  • Perde su ogni benchmark direttamente comparabile con Opus 5.5, inclusi AutomationBench e Terminal-Bench 4.0.
  • Sovrapprezzo automatico oltre i 272.000 token di input, applicato all’intera richiesta.
  • Prezzo cache non confermato ufficialmente da OpenAI nei materiali di lancio.
  • Nessun punteggio pubblicato su FrontierCode v1.1, solo una dichiarazione generica di parità con Fable 5.1.

Pro e contro di Claude Opus 5.5

Pro:

  • In vantaggio su tutti i benchmark condivisi con Sol, con un margine particolarmente ampio su Terminal-Bench 4.0 (66,4% contro 43-43,9%).
  • Taglio del 60% sul prezzo di lettura cache, il fattore di costo più rilevante nei carichi agentici lunghi.
  • Capacità di visione dichiarate ufficialmente per documenti, grafici e diagrammi complessi.
  • Disponibile su tre grandi cloud (AWS Bedrock, Google Cloud Vertex AI, Microsoft Azure) oltre alla piattaforma Anthropic diretta.
  • Efficienza migliorata rispetto a Opus 5: circa il 40% di chiamate in meno e la metà dei token per completare gli stessi task da riga di comando.

Contro:

  • Prezzo doppio rispetto a Sol su ogni categoria di token.
  • Costo per attività completata quasi 5,6 volte superiore secondo Artificial Analysis, perché ragiona più a lungo per ogni richiesta.
  • Finestra di contesto nominale leggermente inferiore a quella dichiarata da Sol (1 milione contro 1,05 milioni).
  • Nessun sovrapprezzo long-context dichiarato, ma anche nessuna modalità gratuita o a bassissimo costo equivalente a GPT-6 Luna.

I limiti di questo confronto (e l’arrivo di Claude Sonnet 5.5)

Vale la pena essere onesti sui limiti dei dati disponibili. Nessuna delle due aziende ha pubblicato un test diretto e controllato tra questi due modelli specifici: ogni cifra di questo articolo arriva da materiali di lancio separati più le misurazioni di un valutatore indipendente, Artificial Analysis, non da un singolo test unificato. I livelli di reasoning effort non sono sempre allineati tra le due parti in ogni singolo benchmark citato, e il costo per attività completata, la metrica che più si avvicina alla spesa reale, non è disponibile per ogni possibile categoria di task su entrambi i modelli.

C’è poi un elemento che potrebbe rendere questo confronto meno rilevante nel giro di poche settimane: Anthropic ha confermato che Claude Sonnet 5.5 è in arrivo “nelle prossime settimane”, con le stesse migliorie di efficienza ed eloquio di Opus 5.5 ma a un prezzo inferiore, potenzialmente più vicino alla fascia occupata oggi da Sol. Se questo accadrà, il confronto più rilevante tra qualche settimana potrebbe non essere più Sol contro Opus 5.5, ma Sol contro Sonnet 5.5 a parità di fascia di prezzo: un motivo in più per non trattare questa fotografia di fine settembre 2026 come definitiva.

Verdetto finale: quale modello conviene nel 2026

I dati raccolti raccontano una storia coerente: più paghi, più ottieni, in una proporzione che grosso modo segue il prezzo. Claude Opus 5.5 vince ogni benchmark diretto contro GPT-6 Sol, con un margine che va dai 7 punti percentuali di AutomationBench ai 54 punti relativi di Terminal-Bench 4.0, e lo fa mantenendo capacità di visione più mature e un taglio aggressivo sul costo della cache che aiuta parecchio nei carichi di lavoro agentici prolungati.

GPT-6 Sol, dal canto suo, non prova a vincere sui benchmark: prova a vincere sul rapporto tra capacità e prezzo, e ci riesce, con un costo per attività completata quasi sei volte più basso secondo Artificial Analysis. Per la maggior parte delle applicazioni ad alto volume e bassa-media complessità (supporto clienti, classificazione, prima risposta automatizzata), quel dato conta più del punteggio su Terminal-Bench. Per i task dove un errore di ragionamento costa più del budget API risparmiato (refactoring critico, analisi legale, compliance), Opus 5.5 resta la scelta più difendibile nonostante il prezzo più alto. La scelta corretta, in altre parole, dipende meno da “quale modello vince” e più da quale fascia di prezzo il tuo caso d’uso richiede davvero.

Per chi deve prendere una decisione operativa questa settimana, un approccio pragmatico è partire da GPT-6 Sol come modello di default per tutto il traffico e riservare Claude Opus 5.5 solo per i task che superano una soglia di complessità misurabile, per esempio quando il primo tentativo di Sol fallisce un controllo di qualità automatico o supera un certo numero di iterazioni. Questo schema a cascata, comune tra i team che ottimizzano la spesa API, permette di sfruttare il prezzo più basso di Sol sulla maggioranza del volume mantenendo la qualità superiore di Opus 5.5 esattamente dove serve.

Domande frequenti

GPT-6 Sol è pensato per competere direttamente con Claude Opus 5.5?
Non per posizionamento di prezzo. GPT-6 Sol costa la metà di Opus 5.5 ed è descritto da OpenAI come rivale di modelli della stessa fascia di prezzo, non del modello di punta di Anthropic. I materiali di lancio di OpenAI confrontano Sol principalmente con il proprio predecessore GPT-5.6 Sol e con Claude Fable 5.1, non con Opus 5.5.

Quale dei due modelli vince sui benchmark condivisi?
Claude Opus 5.5 è in vantaggio su ogni benchmark dove esiste un numero direttamente comparabile, incluso AutomationBench (40,0% contro 33,2%) e Terminal-Bench 4.0 (66,4% contro 43-43,9% secondo la misurazione indipendente di Artificial Analysis).

Quale modello costa meno da usare?
GPT-6 Sol, a metà del prezzo per token di Opus 5.5 sia in input che in output. Il divario si allarga ulteriormente sul costo per attività completata: circa 1,06 $ contro 5,98 $ secondo Artificial Analysis, perché Opus 5.5 ragiona più a lungo per ogni richiesta.

Conviene passare da GPT-6 Sol a Opus 5.5, o viceversa?
Dipende dal task e dal budget, non c’è un vincitore universale. Per attività agentiche lunghe e complesse dove la capacità di ragionamento conta più del costo per token, il vantaggio di Opus 5.5 sui benchmark è reale e sostanziale. Per attività ad alto volume e budget contenuto dove la capacità di Sol è già sufficiente, il suo prezzo dimezzato lo rende l’opzione più economica di default.

Perché il taglio del prezzo cache conta più del taglio sui token grezzi?
Perché nelle sessioni agentiche di lunga durata, dove un agente rilegge ripetutamente lo stesso contesto (codebase, istruzioni di sistema, cronologia), la maggior parte del costo deriva dalle letture dalla cache, non dai token nuovi. Il taglio del 60% di Anthropic su questa voce specifica incide sulla spesa mensile reale più della riduzione del 20% sui prezzi grezzi di input e output.

Quando arriva Claude Sonnet 5.5 e cambierà questo confronto?
Anthropic ha confermato che Sonnet 5.5 arriverà nelle prossime settimane, con le stesse migliorie di efficienza di Opus 5.5 ma a un prezzo inferiore. Se il suo prezzo si avvicinerà a quello di Sol, il confronto più rilevante da seguire diventerà probabilmente Sol contro Sonnet 5.5, non più Sol contro Opus 5.5.

GPT-6 Sol supporta input multimodali?
Sì, accetta testo, immagini e file secondo la scheda tecnica pubblicata da Kilo Code. Non risulta però confermata ufficialmente la stessa enfasi sull’uso del computer che caratterizza il modello di punta GPT-6 Astra.

Qual è la reale finestra di contesto disponibile per l’input su GPT-6 Sol?
Pur dichiarando 1.050.000 token totali, alcune fonti indicano un limite pratico di circa 922.000 token per l’input una volta riservato lo spazio per l’output massimo di 128.000 token, oltre al sovrapprezzo che scatta già a 272.000 token di input.