Tra il 22 e il 30 settembre 2026 i tre grandi laboratori americani hanno rilasciato, uno dopo l’altro, un nuovo modello di punta. OpenAI ha aperto le danze con GPT-6.1 Sol il 22 settembre, Anthropic ha risposto con Claude Sonnet 5.5 il 28 settembre, e Google ha chiuso il mese con Gemini 4 Argon il 30 settembre. Otto giorni, tre lanci, e un dettaglio che cambia tutto: solo due di questi tre modelli sono effettivamente disponibili a chi li vuole usare oggi.
Non è un dettaglio da poco. Gemini 4 Argon, descritto da Google come il modello più avanzato mai costruito dall’azienda, è per ora riservato a un gruppo selezionato di difensori informatici tramite il programma Fairwind. Chi cerca “gemini 4 argon” su Google in Italia genera già circa 1.000 ricerche al mese, segno che l’attesa per capire cosa sia davvero questo modello è alta. In questo confronto mettiamo a fianco i tre modelli su prezzo, velocità, benchmark, accesso e sicurezza, con dati verificati dalle pagine ufficiali dei laboratori e da testate come Reuters, TechCrunch e Axios.
Cosa sono Gemini 4 Argon, GPT-6.1 Sol e Claude Sonnet 5.5
Partiamo dalle basi, perché i nomi di questa generazione di modelli confondono anche chi segue il settore ogni giorno. Gemini 4 Argon è, secondo quanto scritto da Google sul blog ufficiale, il primo modello della nuova famiglia Gemini 4 e punta su ragionamento avanzato per compiti professionali lunghi e complessi: ingegneria del software, finanza, lavoro legale e, soprattutto, cybersecurity difensiva. Google lo definisce il suo modello più potente fino a oggi, con la capacità dichiarata di trovare, validare e correggere in autonomia vulnerabilità critiche nel software.
GPT-6.1 Sol arriva invece come evoluzione di GPT-6 Sol, non come un salto generazionale completo. OpenAI lo presenta come un modello che si avvicina all’intelligenza di GPT-6 Astra, il modello di punta della casa, ma a un quinto del prezzo per token in input e output. È pensato per coding agentico, uso del computer e lavoro professionale quotidiano, ed è il primo dei tre ad aver richiesto un addendum formale alla system card di sicurezza di GPT-6 Astra.
Claude Sonnet 5.5 completa il trio come secondo modello della famiglia Claude 5.5, dopo Claude Opus 5.5. Anthropic lo descrive come un chiaro passo avanti rispetto a Sonnet 5, oltre il 30% più veloce e fino al 30% più economico per la maggior parte dei carichi di lavoro. La casa di Dario Amodei lo posiziona come il complemento rapido ed economico di Opus 5.5, non come un suo sostituto.
Il punto in comune tra i tre lanci è la tempistica: tutti e tre arrivano nella stessa finestra di otto giorni, in piena corsa dei tre laboratori a presentarsi come la scelta migliore per gli sviluppatori professionali prima della fine del 2026. Ma le strategie di accesso, come vedremo, divergono parecchio.
Dalla generazione precedente: cosa cambia davvero
Per capire il salto reale compiuto da ciascun modello bisogna guardare cosa sostituisce. GPT-6.1 Sol non nasce dal nulla: è un aggiornamento diretto di GPT-6 Sol, lanciato da OpenAI come modello economico della famiglia GPT-6 accanto al più costoso GPT-6 Astra. La novità principale di questa revisione “punto uno” è che OpenAI dichiara di aver chiuso gran parte del divario di intelligenza con Astra pur mantenendo un prezzo pari a un quinto. È un pattern che OpenAI ha già seguito in passato: rilasciare un modello di punta costoso, poi distillarne le capacità in varianti più economiche nel giro di poche settimane.
Claude Sonnet 5.5 segue una logica simile ma con un’enfasi diversa. Sonnet 5, il suo predecessore, era già il modello “di mezzo” della gamma Claude, sotto Opus e sopra Haiku. Il salto a 5.5 porta soprattutto un guadagno di velocità, dichiarato da Anthropic oltre il 30%, a parità di prezzo per token. Non è quindi un salto di generazione nel senso classico, quanto un’ottimizzazione ingegneristica che rende il modello più economico da eseguire per l’azienda e più rapido da usare per lo sviluppatore, senza cambiare la fascia di prezzo per l’utente finale.
Gemini 4 Argon è il caso più diverso dei tre. Non sostituisce un “Gemini 4” precedente, perché non esisteva: arriva direttamente come apripista di una nuova numerazione, dopo la serie Gemini 3.x che includeva Gemini 3 Pro e le varianti Flash. Il salto dichiarato da Google riguarda soprattutto il limite di output, passato da 64.000 a 1.000.000 di token, e l’introduzione di capacità di analisi video e documentale che le versioni Gemini 3.x non offrivano con la stessa ampiezza. È un cambio di passo più marcato sulla carta, ma anche l’unico dei tre non ancora verificabile da chi scrive codice o testa applicazioni reali.
Tabella comparativa: specifiche tecniche a confronto
Ecco i dati verificati sui tre modelli, con il contesto di Claude Opus 5.5 e DeepSeek V4.1 Flash per avere un riferimento di mercato più ampio. I punteggi di velocità e indice di intelligenza provengono dal tracker indipendente techtimes.com, mentre prezzi e date di rilascio sono presi dalle pagine ufficiali dei laboratori.
| Modello | Laboratorio | Data di rilascio | Prezzo input (per 1M token) | Prezzo output (per 1M token) | Velocità stimata (tok/s) | Indice intelligenza | Accesso | Contesto / output | Multimodalità |
|---|---|---|---|---|---|---|---|---|---|
| Gemini 4 Argon | 30 settembre 2026 | $2,00 | $10,00 | Non reso pubblico | Non ancora benchmarkato pubblicamente | Riservato, programma Fairwind | Output fino a 1.000.000 token (contesto totale non confermato) | Video lunghi, grafici, documenti visivi | |
| GPT-6.1 Sol | OpenAI | 22 settembre 2026 | $2,00 (cache $0,10) | $10,00 | circa 73.384 | 51,8 | Generale: Plus, Pro, Business, Enterprise, Edu, API | Non dichiarato nel materiale pubblico | Testo, coding agentico, uso del computer |
| Claude Sonnet 5.5 | Anthropic | 28 settembre 2026 | $2,00 | $10,00 | circa 145.160 | 56,0 | Generale: app, API, AWS, Google Cloud, Azure | Non dichiarato nel materiale pubblico | Testo, coding, agenti |
| Claude Opus 5.5 (riferimento) | Anthropic | 22 settembre 2026 | $4,00 | $20,00 | circa 95.679 | 57,6 | Generale | Non dichiarato nel materiale pubblico | Testo, coding, agenti, controllo “effort” a 5 livelli |
| DeepSeek V4.1 Flash (riferimento) | DeepSeek | 10 settembre 2026 | circa $0,53 (blended) | incluso nel blended | circa 219.837 | 39,5 | Open-weight, licenza MIT | 1.000.000 token dichiarati | Testo, uso agentico |
Il dato che salta all’occhio subito è il prezzo: Gemini 4 Argon, GPT-6.1 Sol e Claude Sonnet 5.5 condividono esattamente la stessa tariffa standard, 2 dollari per milione di token in input e 10 dollari per milione in output. Tre laboratori concorrenti, stesso numero. Non è un caso isolato: nell’ultimo anno i prezzi dei modelli “di fascia media veloce” si sono allineati quasi perfettamente, segno che la competizione si gioca ormai più su velocità, affidabilità e accesso che su differenze di listino.
Benchmark: chi vince davvero sui numeri
Qui le cose si complicano, perché Gemini 4 Argon non ha ancora un punteggio pubblico comparabile con gli altri due. Google ha scelto di non pubblicare un indice di intelligenza aggregato al lancio, preferendo parlare di capacità qualitative: analisi di codice complesso, gestione di video lunghi, lettura di grafici e documenti. È una scelta comunicativa diversa da quella di OpenAI e Anthropic, che pubblicano quasi sempre tabelle di confronto dirette con i modelli rivali il giorno del lancio.
Sui due modelli con dati pubblici, secondo il tracker techtimes.com, Claude Sonnet 5.5 segna un indice di intelligenza di 56,0 contro il 51,8 di GPT-6.1 Sol. Claude Opus 5.5, il modello di punta di Anthropic, resta leggermente sopra entrambi con 57,6, confermando che Sonnet 5.5 è pensato come opzione “quasi quanto Opus, ma più rapida” piuttosto che come nuovo capofila.
Sulla velocità il divario è più netto. Claude Sonnet 5.5 gira a circa 145.160 token al secondo nei test del tracker indipendente, quasi il doppio di GPT-6.1 Sol (73.384 token al secondo). Anthropic stessa dichiara un miglioramento di oltre il 30% rispetto a Sonnet 5, un dato che coincide abbastanza bene con le misurazioni esterne. OpenAI, per GPT-6.1 Sol, insiste invece sul rapporto qualità-prezzo: il modello raggiungerebbe un’intelligenza “quasi-Astra” a un quinto del costo del modello di punta della casa, un posizionamento diverso da quello di velocità pura scelto da Anthropic.
Va ricordato che l’indice di intelligenza aggregato di benchmark indipendenti non equivale a una singola prova come SWE-bench o MMLU: è una media pesata su più test che ogni tracker calcola con metodologia propria, quindi i numeri sono comparabili tra modelli misurati dallo stesso tracker, ma vanno presi come indicazione di tendenza più che come verità assoluta.
Cosa misurano davvero questi benchmark
Per chi non segue il settore ogni giorno, vale la pena ricordare cosa c’è dietro le sigle che circolano in questi confronti. SWE-bench misura la capacità di un modello di risolvere problemi reali tratti da repository GitHub, chiedendogli di produrre una patch funzionante che superi i test automatizzati del progetto: è il test più vicino al lavoro quotidiano di un ingegnere software. MMLU copre invece conoscenza generale su decine di materie, dalla storia alla biologia al diritto, ed è più indicativo di cultura generale che di capacità applicativa. GPQA, infine, si concentra su domande scientifiche di livello da dottorato di ricerca, pensate per essere difficili anche per un esperto umano senza accesso a internet.
Nessuno dei tre laboratori ha pubblicato, al momento della scrittura, un punteggio SWE-bench diretto e comparabile per tutti e tre i modelli protagonisti di questo confronto. Questo è uno dei motivi per cui affidarsi a un indice aggregato calcolato da terze parti, pur con i suoi limiti, resta utile: permette almeno di confrontare GPT-6.1 Sol e Claude Sonnet 5.5 su una base comune, anche se non copre ancora Gemini 4 Argon.
Il nodo dell’accesso: perché Argon non lo puoi ancora usare
Questo è probabilmente l’aspetto più insolito del confronto. Mentre GPT-6.1 Sol è disponibile da subito a tutti gli utenti Plus, Pro, Business, Enterprise ed Edu di ChatGPT e tramite API, e Claude Sonnet 5.5 è accessibile su app, API e sui tre grandi cloud (AWS, Google Cloud, Microsoft Azure), Gemini 4 Argon segue una strada completamente diversa.
Google ha confermato tramite il proprio account X che Argon è “in fase di distribuzione a un primo gruppo di difensori informatici tramite il programma Fairwind, così che possano sfruttare le sue capacità di difesa cyber di livello frontiera”, mentre l’azienda continua a raccogliere feedback dai primi tester prima di rendere il modello disponibile più ampiamente. Secondo quanto riportato da TechCrunch, l’accesso iniziale riguarda partner di cybersecurity fidati, non il pubblico generale né gli sviluppatori che usano l’API Gemini standard.
È una scelta che rovescia la logica tipica dei lanci AI, dove il modello più nuovo è anche il primo a diventare pubblico. Google sembra applicare qui un approccio già visto con Gemini 3.8 Flash Cyber: prima testare le mitigazioni di sicurezza con partner selezionati, poi aprire gradualmente l’accesso. La differenza, questa volta, è che Argon non è una variante “cyber” di un modello già pubblico, ma il modello di punta in assoluto della nuova generazione Gemini 4.
Per chi lavora nello sviluppo software o nella sicurezza informatica in Italia e in Europa, questo significa una cosa pratica: oggi, 1 ottobre 2026, puoi integrare GPT-6.1 Sol o Claude Sonnet 5.5 nel tuo stack in pochi minuti, ma per Gemini 4 Argon devi aspettare, oppure candidarti al programma Fairwind se la tua organizzazione gestisce infrastrutture critiche o sviluppo di software ad ampia diffusione.
Disponibilità in Europa: cloud, regioni e conformità
Per un’azienda italiana che deve rispettare il GDPR, la domanda non è solo “quale modello è più intelligente” ma anche “dove girano i miei dati”. Claude Sonnet 5.5 ha il vantaggio di essere distribuito, oltre che tramite l’app e l’API dirette di Anthropic, anche su AWS, Google Cloud e Microsoft Azure, tre piattaforme che offrono tutte opzioni di region europea per l’elaborazione dei dati. Questo dà ai team legali e di compliance più margine per scegliere dove far transitare le richieste.
GPT-6.1 Sol segue lo schema classico di OpenAI: accesso tramite ChatGPT (con i piani Business, Enterprise ed Edu pensati apposta per organizzazioni con esigenze di governance dei dati) oppure tramite API diretta, con le garanzie contrattuali che OpenAI offre ai clienti enterprise europei. Gemini 4 Argon, per sua natura, al momento non pone questo problema nello stesso modo: essendo distribuito solo tramite il programma Fairwind a partner selezionati, ogni organizzazione che vi accede riceve condizioni di trattamento dati negoziate caso per caso con Google, non uno schema standard pubblico.
Per i team italiani che devono decidere oggi, il consiglio pratico è semplice: se la priorità è la conformità con fornitori cloud già approvati internamente (molte aziende italiane hanno già un rapporto consolidato con AWS, Azure o Google Cloud per altri workload), Claude Sonnet 5.5 si inserisce più facilmente in un’infrastruttura esistente grazie alla disponibilità su tutti e tre gli hyperscaler contemporaneamente.
Sicurezza e guardrail: tre approcci diversi
Sul fronte della sicurezza, i tre laboratori raccontano tre storie diverse. OpenAI ha pubblicato un addendum formale alla system card di GPT-6 Astra specifico per GPT-6.1 Sol, un documento che descrive le valutazioni di sicurezza applicate prima del rilascio generale. È un passaggio che OpenAI riserva ai modelli che si avvicinano alle capacità del proprio modello di punta, segno che l’azienda considera Sol abbastanza potente da richiedere lo stesso livello di scrutinio.
Anthropic non ha pubblicato, al momento del lancio di Sonnet 5.5, un documento di sicurezza altrettanto dettagliato e specifico per questo modello. Le informazioni disponibili si concentrano su performance e costo, non su nuove misure di guardrail rispetto a Sonnet 5. Questo non significa che le mitigazioni siano assenti, solo che la comunicazione pubblica al lancio ha dato priorità ad altri aspetti.
Google, come visto, ha scelto l’approccio più restrittivo: distribuzione controllata prima del lancio pubblico, proprio per raccogliere segnali su come Gemini 4 Argon si comporta in scenari di cybersecurity reale prima di aprirlo a tutti. È lo stesso schema già applicato a Gemini 3.8 Flash Cyber, che resta riservato tramite Fairwind anche mesi dopo il suo debutto. Per chi valuta quale di questi tre modelli integrare in un prodotto che gestisce dati sensibili, la differenza tra “documentazione di sicurezza pubblica” e “accesso controllato a monte” è una distinzione pratica da tenere a mente, non solo teorica.
Tabella prezzi: costo reale per caso d’uso
Il prezzo per milione di token racconta solo metà della storia. Ecco una stima del costo mensile per tre scenari tipici di utilizzo in azienda, calcolata sui prezzi standard pubblicati dai laboratori (i costi di Gemini 4 Argon sono proiettati sulla tariffa standard annunciata, in attesa dell’apertura generale).
| Scenario | Volume stimato mensile | GPT-6.1 Sol | Claude Sonnet 5.5 | Gemini 4 Argon (proiezione) | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|
| Chatbot assistenza clienti (PMI) | 20M input / 5M output | $90 | $90 | $90 (stimato) | circa $13 |
| Agente di coding per team dev | 50M input / 15M output | $250 | $250 | $250 (stimato) | circa $34 |
| Analisi documenti legali/finanziari su larga scala | 200M input / 40M output | $800 | $800 | $800 (stimato, accesso permettendo) | circa $127 |
| Cache input ricorrente (prompt ripetuti) | 100M input in cache | $10 (con cache $0,10/1M) | Non dichiarato sconto cache | Sconto 95% su input in cache dichiarato da Google | Non dichiarato |
Il dettaglio più interessante per chi gestisce un budget IT riguarda la cache: Google dichiara uno sconto del 95% sui token in input già visti dal modello in una conversazione precedente, applicabile a Gemini 4 Argon. GPT-6.1 Sol offre uno sconto simile per gli input in cache, sceso a 0,10 dollari per milione di token contro i 2 dollari standard. Claude Sonnet 5.5, nel materiale pubblico consultato, non riporta una percentuale di sconto cache altrettanto esplicita al lancio.
Cinque casi d’uso reali: quale modello scegliere
Passiamo dalla teoria alla pratica. Ecco cinque scenari concreti che un team tecnico italiano potrebbe affrontare oggi, 1 ottobre 2026, e quale dei tre modelli ha più senso per ciascuno.
- Team di sicurezza che gestisce infrastrutture critiche (energia, trasporti, sanità): Gemini 4 Argon è pensato esattamente per questo caso, con capacità dichiarate di trovare e correggere vulnerabilità critiche in autonomia. Il problema è l’accesso: serve candidarsi al programma Fairwind, quindi nel breve termine la scelta pratica resta Claude Sonnet 5.5 o GPT-6.1 Sol per il lavoro quotidiano, con Argon da valutare appena si apre.
- Startup che costruisce un agente di coding per sviluppatori: Claude Sonnet 5.5 è la scelta più diretta, grazie alla velocità quasi doppia rispetto a GPT-6.1 Sol e a un indice di intelligenza superiore nei test indipendenti, a parità di prezzo per token.
- Azienda che vuole ridurre i costi di un assistente ChatGPT già in produzione: GPT-6.1 Sol, essendo un aggiornamento diretto di GPT-6 Sol disponibile da subito a tutti i piani Plus, Pro, Business ed Enterprise, è l’opzione con il percorso di migrazione più breve, senza dover cambiare provider.
- Team che analizza video lunghi, grafici o documenti visivi complessi: la descrizione di Google per Gemini 4 Argon menziona esplicitamente capacità multimodali per video e grafici, un’area dove gli altri due modelli non hanno pubblicato dettagli comparabili altrettanto specifici al lancio.
- Progetto con budget molto limitato o esigenza di eseguire il modello in locale: nessuno dei tre modelli di punta è la scelta giusta qui. DeepSeek V4.1 Flash, open-weight con licenza MIT e un contesto dichiarato di 1 milione di token, resta l’opzione più economica e flessibile per chi deve controllare i costi o ispezionare il modello.
Guida alla migrazione: come passare al nuovo modello senza rotture
Per i team che già usano GPT-6 Sol o Claude Sonnet 5, il passaggio alla nuova generazione segue un percorso abbastanza simile nei tre casi, con alcune differenze pratiche da conoscere prima di cambiare l’endpoint in produzione.
- Verifica la disponibilità del modello sul tuo piano: GPT-6.1 Sol richiede un piano Plus, Pro, Business, Enterprise o Edu per l’uso in ChatGPT, oppure accesso API con il nome
gpt-6.1-sol; Claude Sonnet 5.5 è raggiungibile tramite l’app Claude, l’API Anthropic diretta o tramite AWS Bedrock, Google Cloud Vertex AI e Microsoft Azure. - Esegui un test A/B su un sottoinsieme di traffico reale per 48-72 ore, confrontando latenza, tasso di errore e qualità delle risposte rispetto al modello precedente, prima di spostare il 100% del traffico.
- Controlla i prezzi di cache: se il tuo caso d’uso ripete spesso lo stesso contesto (documenti lunghi, istruzioni di sistema fisse), attiva il caching su GPT-6.1 Sol per sfruttare lo sconto a 0,10 dollari per milione di token in input ripetuto.
- Per i team che puntano a Gemini 4 Argon, candidati fin da ora al programma Fairwind tramite i canali Google Cloud dedicati alla cybersecurity, dato che l’azienda ha dichiarato un rilascio graduale e non una finestra di attesa definita pubblicamente.
- Aggiorna la documentazione interna sui limiti di contesto: nessuno dei tre modelli ha pubblicato al lancio un numero di contesto totale comparabile in modo diretto, quindi testa empiricamente i limiti pratici con i tuoi documenti reali prima di fidarti delle cifre di marketing.
- Mantieni un fallback sul modello precedente per almeno due settimane dopo il passaggio, soprattutto per i flussi che toccano dati sensibili o processi critici, in modo da poter tornare indietro rapidamente se emergono regressioni.
- Monitora i costi reali nella prima settimana: i prezzi per milione di token sono identici tra i tre modelli nella fascia standard, ma il comportamento di generazione (output più lunghi o più brevi) può far variare la spesa effettiva più di quanto suggerisca il listino.
Esempio pratico: come cambia il codice per lo sviluppatore
Dal punto di vista di chi scrive codice, passare da un modello all’altro dei tre significa soprattutto cambiare il nome del modello nella chiamata API e, nel caso di Claude Sonnet 5.5, scegliere su quale piattaforma instradare la richiesta. Ecco tre esempi semplificati, uno per laboratorio, che mostrano la differenza pratica.
Per GPT-6.1 Sol tramite l’API OpenAI, la chiamata segue lo schema già noto a chi usa GPT-6 Sol, con il solo cambio del parametro model:
response = client.chat.completions.create(
model="gpt-6.1-sol",
messages=[{"role": "user", "content": "Analizza questo modulo di autenticazione"}]
)
Per Claude Sonnet 5.5, la chiamata tramite API Anthropic diretta cambia solo il nome del modello, ma lo stesso identificatore funziona anche se si instrada la richiesta tramite AWS Bedrock o Google Cloud Vertex AI, con la sola differenza nell’endpoint e nelle credenziali usate:
response = anthropic_client.messages.create(
model="claude-sonnet-5-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Rivedi questa pull request"}]
)
Per Gemini 4 Argon la situazione è diversa: non esiste ancora un identificatore di modello pubblico utilizzabile liberamente, perché l’accesso passa dal programma Fairwind. Chi viene ammesso riceve credenziali e documentazione dedicate direttamente da Google, non attraverso la console standard dell’API Gemini usata per i modelli 3.x o Flash.
Questa differenza, piccola sulla carta, ha un impatto reale sulla pianificazione dei team tecnici: un’azienda può scrivere oggi stesso un prototipo funzionante con GPT-6.1 Sol o Claude Sonnet 5.5, testarlo in produzione entro la settimana e misurarne i costi reali. Con Gemini 4 Argon, lo stesso prototipo resta sulla carta finché non arriva l’approvazione al programma Fairwind, un processo che Google non ha reso pubblico in termini di tempistiche medie di attesa.
Pro e contro di ciascun modello
Gemini 4 Argon
Pro: capacità dichiarate molto forti su cybersecurity difensiva e correzione autonoma di vulnerabilità; gestione multimodale di video e grafici; sconto del 95% sui token in cache. Contro: non è disponibile al pubblico generale, nessun benchmark indipendente pubblico al momento della scrittura, tempistiche di apertura non confermate da Google.
GPT-6.1 Sol
Pro: disponibile da subito su quasi tutti i piani ChatGPT e via API; rapporto qualità-prezzo dichiarato molto favorevole rispetto a GPT-6 Astra; addendum di sicurezza pubblico. Contro: indice di intelligenza più basso di Sonnet 5.5 nei test indipendenti consultati; velocità inferiore rispetto a Sonnet 5.5 nello stesso tracker.
Claude Sonnet 5.5
Pro: velocità quasi doppia rispetto a GPT-6.1 Sol secondo i dati indipendenti; disponibile su app, API e tutti i tre grandi cloud; prezzo invariato rispetto a Sonnet 5 nonostante il miglioramento delle prestazioni. Contro: resta sotto Claude Opus 5.5 come intelligenza pura; documentazione di sicurezza specifica meno dettagliata al lancio rispetto a GPT-6.1 Sol.
Perché i tre laboratori si muovono in questo modo
Guardando i tre lanci insieme, emerge uno schema che va oltre il singolo modello. OpenAI punta su un posizionamento di prezzo-prestazioni, offrendo capacità vicine al proprio top di gamma a una frazione del costo. Anthropic punta sulla velocità e sull’efficienza, mantenendo il prezzo fermo mentre aumenta le prestazioni, in una fase in cui l’azienda si prepara a un’eventuale quotazione in borsa secondo quanto riportato da Reuters. Google, da parte sua, sceglie la strada più cauta per il modello più potente del proprio catalogo, dando priorità a un rilascio controllato nel settore della sicurezza informatica prima di aprirsi al mercato di massa.
Questo scenario fotografa bene lo stato del settore a fine 2026: la corsa al modello più grande in assoluto ha lasciato spazio a una competizione più sottile, fatta di varianti, programmi di accesso selettivo e differenziazione per caso d’uso, più che di semplici salti generazionali. Chi lavora con l’intelligenza artificiale ogni giorno deve ormai valutare non solo “quale modello è più intelligente”, ma anche “chi può effettivamente usarlo, e quando”.
Il resto del mercato: DeepSeek, Qwen e i modelli open-weight
Mentre i tre laboratori americani si contendono la fascia alta del mercato enterprise, il fronte open-weight continua a muoversi a un ritmo quasi indipendente. DeepSeek V4.1 Flash, rilasciato il 10 settembre 2026, ha sostituito sia V4-Flash che gran parte del traffico API di V4-Pro, secondo quanto riportato dal catalogo LLM Releases, con un prezzo blended di circa 0,53 dollari per milione di token: una frazione dei 2 dollari di input richiesti dai tre modelli protagonisti di questo confronto.
Questo scarto di prezzo non significa che i modelli open-weight siano pronti a sostituire Gemini, GPT o Claude nei carichi di lavoro più complessi: l’indice di intelligenza di DeepSeek V4.1 Flash, fermo a 39,5 nel tracker indipendente consultato, resta sotto sia GPT-6.1 Sol (51,8) sia Claude Sonnet 5.5 (56,0). Il divario si sposta quindi su un asse diverso da quello di prezzo: chi ha bisogno della massima qualità di ragionamento paga di più e si affida a un laboratorio chiuso, chi ha bisogno di costi minimi o di eseguire il modello su hardware proprio si rivolge all’open-weight, accettando un gradino di qualità più basso.
I dati di prezzo raccolti dal tracker BenchLM.ai confermano questa dinamica su scala più ampia: nell’ultimo trimestre il prezzo medio per milione di token dei modelli di fascia alta è rimasto sostanzialmente stabile, mentre il prezzo dei modelli open-weight più competitivi continua a scendere, allargando la forbice tra le due fasce di mercato invece di restringerla.
Per un’azienda italiana che valuta entrambe le strade, la domanda da porsi non è più “modello chiuso o aperto” in astratto, ma “quale parte del flusso di lavoro tollera una qualità più bassa in cambio di un costo molto inferiore”. Un caso tipico è la pre-elaborazione di grandi volumi di documenti, dove un modello open-weight economico può filtrare e classificare, lasciando poi i casi più complessi a un modello di fascia alta come Claude Sonnet 5.5 o GPT-6.1 Sol. Questo approccio a cascata, già diffuso tra i team che gestiscono grandi volumi di richieste, riduce la spesa complessiva senza sacrificare la qualità sui compiti che contano davvero.
Il verdetto: quale modello scegliere oggi
Sui dati disponibili al 1 ottobre 2026, il verdetto si divide in due parti. Per chi cerca il modello più rapido e con il miglior punteggio di intelligenza tra quelli effettivamente disponibili, Claude Sonnet 5.5 vince il confronto diretto con GPT-6.1 Sol: più veloce (145.160 contro 73.384 token al secondo nei test indipendenti), più intelligente (56,0 contro 51,8 nell’indice aggregato) e allo stesso prezzo per token. GPT-6.1 Sol resta comunque una scelta solida per chi è già nell’ecosistema OpenAI e vuole il percorso di aggiornamento più semplice, con il vantaggio di un addendum di sicurezza pubblico che aggiunge trasparenza.
Gemini 4 Argon resta, per ora, un discorso a parte. Le capacità dichiarate da Google per la cybersecurity difensiva e l’analisi multimodale sembrano le più ambiziose dei tre, ma senza benchmark pubblici indipendenti e con un accesso limitato al programma Fairwind, è impossibile dare un verdetto basato sui numeri. Chi gestisce infrastrutture critiche dovrebbe comunque muoversi subito per richiedere l’accesso, visto che Google non ha fissato una data per l’apertura generale.
Il consiglio più pratico, per chi deve decidere entro la settimana, è questo: non aspettare Gemini 4 Argon per iniziare a lavorare con la nuova generazione di modelli. Le due opzioni già disponibili coprono la maggior parte dei casi d’uso aziendali reali, dal coding agentico all’assistenza clienti, e permettono di misurare costi e prestazioni su dati veri invece che su annunci. Quando Google deciderà di aprire l’accesso ad Argon a un pubblico più ampio, ci sarà tempo per valutarlo con gli stessi criteri usati qui: prezzo, velocità misurata indipendentemente e trasparenza sulla sicurezza.
Domande frequenti
Gemini 4 Argon è già disponibile in Italia?
No. Al 1 ottobre 2026 Gemini 4 Argon è distribuito solo a un primo gruppo di partner selezionati tramite il programma Fairwind di Google, con priorità a difensori informatici e gestori di infrastrutture critiche. Non esiste ancora un accesso pubblico via app o API standard, né in Italia né altrove.
Quanto costa usare GPT-6.1 Sol o Claude Sonnet 5.5 tramite API?
Entrambi usano lo stesso schema di prezzo: 2 dollari per milione di token in input e 10 dollari per milione di token in output. GPT-6.1 Sol offre inoltre uno sconto sugli input in cache, scesi a 0,10 dollari per milione di token.
Claude Sonnet 5.5 sostituisce Claude Opus 5.5?
No. Anthropic presenta Sonnet 5.5 come complemento più rapido ed economico di Opus 5.5, non come sostituto. Opus 5.5 resta il modello di punta della famiglia Claude 5.5, con un indice di intelligenza più alto (57,6 contro 56,0) ma un prezzo doppio per token.
Qual è la differenza tra GPT-6.1 Sol e GPT-6 Astra?
GPT-6 Astra è il modello di punta assoluto di OpenAI nella generazione GPT-6. GPT-6.1 Sol è pensato per offrire prestazioni vicine a quelle di Astra su coding agentico, uso del computer e lavoro professionale, ma a circa un quinto del prezzo standard per token di Astra.
Gemini 4 Argon ha un contesto da 1 milione di token come DeepSeek V4.1 Flash?
Google ha confermato un limite di output fino a 1 milione di token per Gemini 4 Argon, in crescita rispetto ai 64.000 token precedenti, ma non ha reso pubblica la dimensione totale della finestra di contesto in ingresso. Non va confuso con il contesto totale dichiarato da DeepSeek V4.1 Flash, che riguarda l’intera finestra, non solo l’output.
Perché Google ha scelto di limitare l’accesso al suo modello più potente?
Secondo le dichiarazioni ufficiali di Google, l’azienda vuole raccogliere feedback da partner di cybersecurity fidati e perfezionare i guardrail di sicurezza prima di un rilascio più ampio, viste le capacità dichiarate di Argon nel trovare e correggere vulnerabilità critiche in autonomia. È lo stesso approccio già seguito con la variante Gemini 3.8 Flash Cyber.
Quale dei tre modelli conviene per un budget IT limitato?
Tra i tre modelli di punta, i prezzi standard sono identici (2 dollari input, 10 dollari output per milione di token). Chi ha un budget molto ridotto o vuole eseguire il modello in locale dovrebbe però considerare alternative open-weight come DeepSeek V4.1 Flash, che costa una frazione del prezzo e consente l’esecuzione autonoma.
Esiste già un benchmark SWE-bench ufficiale per Gemini 4 Argon?
Al momento della pubblicazione di questo articolo (1 ottobre 2026), Google non ha diffuso un punteggio SWE-bench o un indice di intelligenza aggregato comparabile per Gemini 4 Argon. L’azienda ha condiviso solo descrizioni qualitative delle capacità del modello, non tabelle di benchmark dirette con i modelli concorrenti.
Sono usciti altri modelli importanti nella stessa settimana?
Sì, settembre 2026 è stato un mese particolarmente denso per i rilasci AI. Oltre ai tre modelli protagonisti di questo confronto, Google ha pubblicato Gemini 3.8 Flash TTS e Flash-Lite TTS, due modelli dedicati alla sintesi vocale, mentre Alibaba ha rilasciato Qwen-Audio-3.1 il 23 settembre con componenti aggiornati per riconoscimento vocale, sintesi e interazione in tempo reale. Nello stesso periodo DeepSeek ha lanciato V4.1 Flash il 10 settembre, confermando un ritmo di aggiornamenti che nel 2026 è diventato quasi settimanale tra i principali laboratori.




