Tre modelli, tre filosofie diverse e una forbice di prezzo che arriva a 71 volte tra il più economico e il più caro. A fine settembre 2026 i team tecnici europei si trovano davanti a una scelta concreta: Google Gemini 3.8 Flash, disponibile in generale dal 2 settembre, Anthropic Claude Opus 5.5, uscito il 22 settembre, e DeepSeek V4 Flash 0731, il modello open-weight pubblicato il 31 luglio. Ognuno risolve un problema diverso: velocità e multimodalità nativa per Gemini, punteggi di ragionamento e coding al vertice per Claude, costo quasi azzerato per DeepSeek. Questo confronto usa dati pubblici di BenchLM, Artificial Analysis e la documentazione ufficiale dei tre fornitori per capire quale modello scegliere in base al budget, al caso d’uso e ai vincoli normativi europei.

Perché confrontare questi tre modelli adesso

Nell’arco di sette settimane, tra il 31 luglio e il 22 settembre 2026, tre laboratori hanno rilasciato modelli che competono sullo stesso terreno: finestra di contesto da un milione di token, capacità agentiche avanzate e prezzi API pubblici e comparabili. Non è un caso isolato. Secondo il tracker di BenchLM, nella sola settimana dal 22 al 28 settembre sono arrivate altre otto release confermate, tra cui Claude Sonnet 5.5 e i modelli vocali Eleven v4. Il ritmo di uscita si è compresso e questo cambia il modo in cui un team tecnico deve valutare un fornitore: non basta più guardare il punteggio su un singolo benchmark, serve confrontare costo per attività, velocità di risposta e disponibilità regionale nello stesso momento.

Il taglio di questo articolo è pratico. Gemini 3.8 Flash punta su un pubblico ampio, con distribuzione su Google AI Studio, l’app Gemini, Vertex AI e persino Google Sheets. Claude Opus 5.5 si rivolge invece a chi automatizza compiti complessi, dal debug del codice alla gestione di agenti multi-step. DeepSeek V4 Flash 0731, pesi aperti e licenza permissiva, è la scelta di chi vuole eseguire il modello sulla propria infrastruttura o pagare una frazione del prezzo delle alternative proprietarie. Tre strade diverse, e qui si vede dove portano davvero, numeri alla mano.

Vale la pena chiarire subito un punto che spesso confonde chi legge un confronto tra modelli linguistici: un punteggio più alto non significa automaticamente “modello migliore per il tuo progetto”. Un team che costruisce un motore di ricerca interno per documenti aziendali ha esigenze diverse da uno che automatizza pull request su GitHub, e queste esigenze diverse spesso puntano verso modelli diversi anche a parità di budget. Per questo l’articolo procede per livelli: prima le specifiche tecniche pure, poi i benchmark incrociati su più fonti, poi il costo calcolato su carichi di lavoro realistici, e solo alla fine la raccomandazione per caso d’uso.

Gemini 3.8 Flash: cosa cambia rispetto alla generazione precedente

Gemini 3.8 Flash è diventato generalmente disponibile il 2 settembre 2026, secondo la documentazione ufficiale di Google AI for Developers. Il modello mantiene la finestra di contesto da 1.048.576 token già vista nella famiglia Gemini 3 e aggiunge un tetto di output fino a 65.536 token per risposta. La novità più rilevante riguarda gli input: testo, immagini, audio, video e PDF sono gestiti nativamente nello stesso endpoint, senza bisogno di pipeline separate per l’estrazione di testo dai documenti.

Sul fronte del punteggio, BenchLM assegna a Gemini 3.8 Flash 73,5 punti su 100, che vale il decimo posto su 209 modelli tracciati alla data del 28 settembre 2026. Il dato più interessante è la velocità: 262 token al secondo secondo BenchLM, confermata a 242,2 token al secondo da Artificial Analysis, che piazza il modello al quarto posto su 216 per rapidità di generazione. Il prezzo introduttivo, indicato come valido fino al 31 dicembre 2026, è 0,75 dollari per milione di token in input e 3,75 dollari per milione in output, con un tasso scontato di 0,075 dollari per i token letti dalla cache. È un prezzo pensato per volumi alti e per applicazioni che devono restare reattive, non per compiti di ragionamento profondo dove Gemini 3.8 Flash resta indietro rispetto agli altri due modelli di questo confronto.

Il modello supporta anche un livello di reasoning regolabile, che permette di alzare o abbassare la profondità di elaborazione in cambio di latenza e costo. È una leva utile quando lo stesso endpoint deve gestire sia domande semplici sia richieste che richiedono più passaggi logici, senza dover cambiare modello a metà applicazione.

Claude Opus 5.5: il nuovo riferimento di Anthropic

Claude Opus 5.5 è uscito il 22 settembre 2026 e ha già superato il precedente Claude Opus 5, rilasciato a luglio, che secondo BenchLM risulta ora “superseded” nella linea Anthropic. Il salto generazionale porta con sé anche un taglio di prezzo: Opus 5.5 costa 4 dollari per milione di token in input e 20 dollari in output, contro i 5 e 25 dollari del modello precedente, con l’input in cache sceso a 0,20 dollari per milione di token.

Il punteggio BenchLM è 87,1 su 100, secondo posto assoluto su 209 modelli tracciati, alle spalle solo del leader di categoria GPT-6 Astra, fermo a 88,5. Su Artificial Analysis Intelligence Index il quadro si ribalta: Claude Opus 5.5 è primo con 58 punti, davanti a tutti gli altri 216 modelli comparabili. La forza del modello sta nelle categorie agentiche: BenchLM lo colloca al primo posto su 117 modelli per compiti agentici (87,8 punti), primo su 142 per coding (83,1 punti) e primo su 168 per conoscenza generale (89,1 punti). Sono numeri che riflettono un modello costruito per orchestrare strumenti e portare a termine compiti multi-step senza supervisione continua.

Il rovescio della medaglia è la velocità. BenchLM misura 95 token al secondo, confermati a 92,8 da Artificial Analysis, che colloca il modello solo al 54° posto su 216 per rapidità. Claude Opus 5.5 privilegia la qualità della risposta rispetto al tempo di generazione, una scelta di design coerente con l’uso previsto: agenti che eseguono compiti complessi, non chatbot che devono rispondere in una manciata di millisecondi.

DeepSeek V4 Flash 0731: potenza open-weight a basso costo

DeepSeek V4 Flash 0731 è arrivato in beta pubblica il 31 luglio 2026, con architettura Mixture-of-Experts da 284 miliardi di parametri totali e 13 miliardi attivi per token, secondo i dati tecnici pubblicati da Artificial Analysis. La licenza è open weight (MIT secondo la stessa fonte), il che significa che il modello può essere scaricato ed eseguito su infrastruttura propria, oltre che consumato via API.

Il prezzo ufficiale, riportato da BenchLM e coerente con il listino ufficiale DeepSeek, è 0,14 dollari per milione di token in input e 0,28 dollari in output, con l’input in cache che scende a 0,0028 dollari per milione di token. Sono cifre che rendono DeepSeek V4 Flash 0731 il modello più economico dei tre per ampio margine. Artificial Analysis, che misura il costo effettivo in modalità di ragionamento esteso (“max effort”), riporta invece 0,44 dollari in input e 1,32 in output: la differenza tra le due fonti riflette il fatto che in modalità di reasoning il modello genera più token intermedi prima della risposta finale, alzando il costo reale per attività pur mantenendo invariato il prezzo per singolo token.

Sul piano dei benchmark, DeepSeek V4 Flash 0731 non ha ancora una posizione ufficiale nella classifica pubblica di BenchLM (42 righe di evidenza raccolte ma non sufficienti per un rango pubblico), mentre Artificial Analysis lo classifica 11° su 116 modelli open-weight con un Intelligence Index di 34 punti. Sui singoli test il modello si comporta bene: 91,6% su LiveCodeBench Pass@1-COT, un rating di 3.052 su Codeforces e 79% su SWE-bench Verified. Un dettaglio da non ignorare: DeepSeek ha già lanciato il successore V4.1 Flash il 10 settembre 2026, secondo il changelog ufficiale dell’API, e Artificial Analysis segnala esplicitamente che V4 Flash 0731 è da considerarsi superato. Chi legge questo confronto oggi dovrebbe verificare se V4.1 Flash offra condizioni migliori prima di fissare un contratto di lungo periodo.

Tabella comparativa delle specifiche tecniche

La tabella seguente riunisce le specifiche pubblicate dai tre fornitori e verificate incrociando la documentazione ufficiale con i dati di BenchLM e Artificial Analysis, aggiornati al 28 settembre 2026.

CaratteristicaGemini 3.8 FlashClaude Opus 5.5DeepSeek V4 Flash 0731
SviluppatoreGoogleAnthropicDeepSeek
Data di rilascio2 settembre 202622 settembre 202631 luglio 2026
LicenzaProprietariaProprietariaPesi aperti (MIT)
Finestra di contesto1.048.576 token1.000.000 token1.000.000 token
Output massimo documentato65.536 tokenNon pubblicato separatamenteNon pubblicato separatamente
Input supportatiTesto, immagine, audio, video, PDFTesto, immagineSolo testo
Parametri totali / attiviNon divulgatoNon divulgato284 miliardi / 13 miliardi (MoE)
Punteggio BenchLM (su 100)73,5 · #10 di 20987,1 · #2 di 209Non classificato pubblicamente
Artificial Analysis Intelligence Index41 · #43 di 21658 · #1 di 21634 · #11 di 116 (classe open-weight)
Velocità (BenchLM)262 token/s95 token/s230 token/s
Velocità (Artificial Analysis)242,2 token/s · #4 di 21692,8 token/s · #54 di 216221,7 token/s · #2 di 116
Canali di distribuzione ufficialiGemini API, AI Studio, Vertex AI, app Gemini, Android StudioAPI Anthropic diretta, AWS Bedrock, Google Cloud Vertex AIAPI DeepSeek, pesi scaricabili per self-hosting

Un dato salta subito all’occhio: tutti e tre i modelli dichiarano una finestra di contesto attorno al milione di token, quindi su questo fronte la scelta non fa la differenza. Cambiano invece radicalmente gli input accettati e la velocità di risposta, due variabili che pesano più del contesto massimo nella maggior parte delle applicazioni reali.

Benchmark a confronto: cosa dicono BenchLM e Artificial Analysis

Per evitare di basare il confronto su un solo aggregatore, questa sezione incrocia i dati di BenchLM, quelli di Artificial Analysis e, dove disponibili, i punteggi citati nella documentazione ufficiale di Anthropic e Google. Le tre fonti misurano cose leggermente diverse: BenchLM pubblica un punteggio composito su base BenchAlign v5.7, Artificial Analysis calcola un proprio Intelligence Index basato su un paniere di test pesati, i vendor riportano invece i benchmark grezzi che ritengono più rappresentativi del proprio modello.

Benchmark / categoriaGemini 3.8 FlashClaude Opus 5.5DeepSeek V4 Flash 0731Fonte
Agentic (BenchAlign v5.7)64,2 · #13/11787,8 · #1/117Non classificatoBenchLM
Coding (BenchAlign v5.7)64,1 · #10/14283,1 · #1/142Non classificatoBenchLM
Knowledge (BenchAlign v5.7)74,3 · #9/16889,1 · #1/168Non classificatoBenchLM
Reasoning70,6 · #15/2782,4 · #2/2757,0 (non classificato, 4 righe)BenchLM
Multimodal83,9 · #9/5088,8 · #3/50Non applicabile (solo testo)BenchLM
ARC-AGI-289,2%91,7%61,4%BenchLM
SWE-bench ProNon misurato in questo set89,9%52,6%BenchLM
SWE-bench (Vals)80,0%Non misurato in questo set88,8%BenchLM
LiveCodeBench (Vals)89,5%Non misurato in questo set87,3%BenchLM
Terminal-Bench 2.189,4%Non misurato in questo set82,7%BenchLM
Intelligence Index41 · #43/21658 · #1/21634 · #11/116Artificial Analysis
Costo medio per task Intelligence Index1,24 $5,98 $0,22 $Artificial Analysis

La lettura più onesta di questi numeri, ed è anche quella che BenchLM adotta esplicitamente nella propria metodologia, è che DeepSeek V4 Flash 0731 non ha ancora abbastanza copertura pubblica per un rango ufficiale in molte categorie. Sui singoli benchmark dove i dati esistono, però, il modello tiene testa a Gemini 3.8 Flash e in alcuni casi lo supera, come su SWE-bench (Vals), dove segna 88,8% contro l’80,0% di Gemini. Claude Opus 5.5 resta il modello più forte in assoluto su coding e compiti agentici, con margini che nella maggior parte dei casi non si sovrappongono nemmeno considerando l’intervallo di confidenza al 90%.

Perché due aggregatori danno punteggi diversi allo stesso modello

BenchLM e Artificial Analysis non litigano sui fatti, litigano sul metodo. BenchLM costruisce il proprio punteggio composito BenchAlign pesando le categorie in base a quanti benchmark pubblici “supportati” esistono per ciascun modello, e per questo penalizza DeepSeek V4 Flash 0731, che ha 42 righe di evidenza raccolte ma non abbastanza copertura verificata per un rango ufficiale. Artificial Analysis usa invece un paniere fisso di test eseguiti direttamente dalla piattaforma, indipendentemente da quanti benchmark il vendor abbia pubblicato, e per questo riesce a piazzare DeepSeek all’11° posto su 116 modelli open-weight nonostante l’assenza di un rango BenchLM. Nessuna delle due metodologie è sbagliata: misurano semplicemente cose diverse, ed è per questo che questo confronto le cita entrambe invece di sceglierne una sola come verità assoluta.

Prezzi API a confronto: la tabella dei costi

Il prezzo è probabilmente la variabile che cambia di più tra i tre modelli, con un rapporto che arriva a 71,4 volte tra l’output più economico e quello più caro. La tabella seguente riporta i prezzi di listino pubblicati dai tre fornitori al 28 settembre 2026.

Voce di costoGemini 3.8 FlashClaude Opus 5.5DeepSeek V4 Flash 0731
Prezzo input (per milione di token)0,75 $4,00 $0,14 $
Prezzo output (per milione di token)3,75 $20,00 $0,28 $
Input in cache (per milione di token)0,075 $0,20 $0,0028 $
Rapporto output vs il più economico dei tre13,4x71,4x1x (riferimento)
Validità del prezzo introduttivoFino al 31 dicembre 2026Non indicata scadenzaPrezzo di listino corrente

Il divario si spiega con il posizionamento dei tre modelli. Claude Opus 5.5 vende capacità di ragionamento e affidabilità su compiti agentici lunghi, dove un errore costa più del token risparmiato. Gemini 3.8 Flash si posiziona a metà strada, con un prezzo pensato per applicazioni multimodali ad alto volume. DeepSeek V4 Flash 0731 punta tutto sul volume e sulla possibilità di ospitare il modello in proprio, eliminando di fatto il costo per token per chi ha già l’hardware necessario.

Quanto costa davvero: 5 scenari reali di utilizzo

I prezzi di listino dicono poco senza un contesto d’uso. Ecco cinque scenari calcolati applicando le tariffe ufficiali ai tre carichi di lavoro standard usati da BenchLM per confrontare i modelli: un turno di chat (1.000 token di input freschi più 500 di output), una revisione di repository (50.000 token di input più 3.000 di output) e un ciclo agentico ad alto uso di cache (200.000 token in cache, 20.000 di input fresco, 10.000 di output).

  • Assistente clienti da 100.000 turni al mese. Con il preset chat, il costo mensile stimato è 28 dollari su DeepSeek V4 Flash 0731, 262,50 dollari su Gemini 3.8 Flash e 1.400 dollari su Claude Opus 5.5. Per un volume alto e ripetitivo, la differenza di budget tra il primo e l’ultimo modello supera i 1.370 dollari al mese.
  • Revisione automatica di 500 repository al mese. Il preset da 50.000 token in input e 3.000 in output costa 3,92 dollari su DeepSeek, 24,38 dollari su Gemini e 130 dollari su Claude Opus 5.5. Qui però il punteggio conta più del prezzo: Claude Opus 5.5 guida la categoria coding con 83,1 punti contro i 64,1 di Gemini, un margine che per un’azienda che vende software può giustificare la spesa aggiuntiva.
  • Agente con memoria a lungo termine, 10.000 sessioni al mese. Il ciclo cache-intensivo costa 61,60 dollari su DeepSeek, 675 dollari su Gemini e 3.200 dollari su Claude Opus 5.5. La cache riduce il divario relativo rispetto agli altri scenari, ma in valore assoluto resta enorme.
  • Startup con budget fisso di 500 dollari al mese in API. Con questo tetto, un team può eseguire circa 1,78 milioni di turni di chat su DeepSeek V4 Flash 0731, circa 190.000 su Gemini 3.8 Flash e circa 35.700 su Claude Opus 5.5. La scelta del modello, prima ancora della qualità, definisce quanta scala il prodotto può reggere con lo stesso budget.
  • Analisi documentale multimodale per uno studio legale. Solo Gemini 3.8 Flash, tra i tre, legge nativamente PDF e immagini nello stesso endpoint di testo. Un caso che richiede l’analisi di 200 pagine di documenti scansionati (circa 150.000 token equivalenti) più un riassunto di 2.000 token costa circa 0,12 dollari a documento, senza bisogno di un servizio di OCR separato a monte.

Il filo conduttore di questi cinque scenari è che il divario di prezzo non è lineare rispetto al valore prodotto. Nel caso del supporto clienti, dove ogni interazione è quasi identica alla precedente, pagare 71 volte in più per output marginalmente migliore raramente si traduce in un ritorno misurabile. Nel caso della revisione di codice, dove un singolo bug non intercettato può costare ore di debug in produzione, lo stesso rapporto di prezzo diventa secondario rispetto all’affidabilità del risultato.

Velocità e latenza: chi risponde più in fretta

La velocità di generazione cambia in modo netto tra i tre modelli e non segue lo stesso ordine del punteggio di qualità. Gemini 3.8 Flash è il più rapido con 262 token al secondo secondo BenchLM (242,2 secondo Artificial Analysis, quarto posto assoluto su 216 modelli comparabili). DeepSeek V4 Flash 0731 segue da vicino con 230 token al secondo (221,7 per Artificial Analysis, secondo posto su 116 modelli open-weight). Claude Opus 5.5 chiude la classifica con 95 token al secondo (92,8 per Artificial Analysis), meno di un terzo della velocità di Gemini.

Questo scarto non è un difetto di progettazione, è una scelta. Claude Opus 5.5 dedica più tempo di calcolo al ragionamento interno prima di produrre l’output finale, un comportamento coerente con il suo primato nelle categorie agentiche e di coding. Per un’interfaccia conversazionale che deve rispondere in tempo reale, come un assistente vocale o una live chat, la differenza tra 95 e 262 token al secondo si traduce in secondi di attesa percepibile dall’utente. Per un agente che lavora in background su un compito di più passaggi, la velocità pura conta meno della correttezza del risultato finale, ed è qui che Claude Opus 5.5 recupera terreno nonostante il costo per token più alto.

Un altro modo di leggere questi numeri è calcolare il tempo per completare un output standard. Una risposta di 1.000 token impiega circa 3,8 secondi su Gemini 3.8 Flash, circa 4,3 secondi su DeepSeek V4 Flash 0731 e circa 10,5 secondi su Claude Opus 5.5, sempre secondo la velocità di generazione misurata da BenchLM. Su un’applicazione che genera migliaia di risposte al giorno, questi secondi si sommano e possono determinare quante richieste simultanee un singolo team riesce a gestire con la stessa infrastruttura di code e retry.

GDPR, EU AI Act e residenza dei dati: cosa serve sapere in Italia

Per un team italiano o europeo, la scelta del modello non finisce con il confronto tecnico. L’EU AI Act non impone in generale che i prompt vengano elaborati fisicamente nell’Unione Europea: la questione della localizzazione dei dati resta principalmente disciplinata dal GDPR e dai meccanismi del capo V per i trasferimenti extra SEE, come le clausole contrattuali standard (SCC) o le decisioni di adeguatezza dove applicabili.

Google Cloud offre endpoint regionali e multiregionali su Vertex AI, ma un endpoint globale può instradare dinamicamente le richieste verso data center fuori dall’UE, quindi la garanzia di residenza va verificata regione per regione nel contratto, non data per scontata dal solo fatto che esista una regione europea. Anthropic non offre un endpoint API regionale europeo di prima parte: chi vuole una garanzia di elaborazione in territorio UE può accedere a Claude Opus 5.5 tramite AWS Bedrock o tramite Google Cloud Vertex AI, scegliendo una regione europea per entrambi i servizi.

Il caso più delicato per un’azienda italiana riguarda DeepSeek. Il Garante per la protezione dei dati personali ha imposto il 30 gennaio 2025 una limitazione urgente al trattamento dei dati degli utenti italiani da parte delle società cinesi collegate a DeepSeek, dopo aver rilevato che la privacy policy del servizio dichiarava la conservazione dei dati in Cina. Il provvedimento riguardava il servizio di chat diretto, non necessariamente ogni possibile deployment self-hosted dei pesi aperti, ma resta un precedente che qualunque responsabile privacy italiano deve valutare prima di collegare l’API DeepSeek a dati personali di clienti o dipendenti. Chi sceglie DeepSeek V4 Flash 0731 per motivi di costo dovrebbe verificare titolare del trattamento, localizzazione effettiva dei server, base giuridica del trasferimento e possibilità di disattivare la conservazione dei prompt per l’addestramento futuro del modello.

Un errore comune è pensare che questi vincoli riguardino solo il fornitore cinese. Anche Gemini 3.8 Flash e Claude Opus 5.5 richiedono una verifica contrattuale puntuale, perché la disponibilità di una regione europea nel pannello di configurazione non equivale automaticamente a una garanzia di residenza per ogni sottoprocesso collegato, dal supporto tecnico al monitoraggio antiabuso fino ai log di fatturazione. La differenza pratica è che per Google e Anthropic esiste una via contrattuale chiara per ottenere quella garanzia (Vertex AI in regione UE, AWS Bedrock in regione UE), mentre per DeepSeek, al momento della stesura di questo articolo, non risulta un’opzione equivalente di residenza europea offerta direttamente dal produttore.

5 casi d’uso: quale modello scegliere e quando

  1. Chatbot di supporto clienti ad alto volume. DeepSeek V4 Flash 0731, self-hosted o via API, per il costo per interazione più basso dei tre. Va verificata la compliance sui dati personali prima del lancio in produzione, specialmente per utenti italiani.
  2. Agenti di coding e revisione automatica del codice. Claude Opus 5.5, che guida sia la categoria coding (83,1 punti, primo su 142) sia quella agentica (87,8 punti, primo su 117), con margini che in gran parte non si sovrappongono con Gemini nemmeno considerando l’incertezza statistica.
  3. App di produttività multimodale con budget medio. Gemini 3.8 Flash, unico dei tre a leggere nativamente immagini, audio, video e PDF nello stesso endpoint, con un prezzo intermedio tra gli altri due modelli.
  4. Organizzazioni con vincoli di sovranità dei dati. Gemini 3.8 Flash o Claude Opus 5.5 tramite Vertex AI o AWS Bedrock in regione europea, evitando DeepSeek per i dati personali fino a quando non emergano garanzie contrattuali equivalenti a quelle richieste dal Garante italiano.
  5. Applicazioni in tempo reale a bassa latenza. Gemini 3.8 Flash (262 token/s) o DeepSeek V4 Flash 0731 (230 token/s), evitando Claude Opus 5.5 dove il tempo di risposta percepito conta più della profondità del ragionamento.
  6. Prototipazione rapida con budget limitato. DeepSeek V4 Flash 0731 o il suo successore V4.1 Flash per validare l’idea a costo quasi nullo, con un passaggio successivo a Claude Opus 5.5 solo sulle funzionalità che finiscono in produzione e richiedono affidabilità agentica dimostrata.

Guida alla migrazione tra le tre API

Passare da un modello all’altro richiede più di un cambio di endpoint. Le tre API condividono in larga parte lo schema di chiamata in stile OpenAI (DeepSeek è esplicitamente compatibile), ma differiscono su alcuni dettagli che rompono l’integrazione se ignorati.

Il punto dove la maggior parte delle migrazioni si inceppa è il posizionamento del prompt di sistema. Ecco come cambia la struttura minima di una richiesta tra i tre fornitori, schematizzata per evidenziare solo il campo che varia:

// Anthropic: system è un parametro top-level, separato dai messaggi
{ "model": "claude-opus-5-5", "system": "Sei un assistente tecnico.",
  "messages": [{ "role": "user", "content": "Analizza questo log." }] }

// Google Gemini: il prompt di sistema entra in systemInstruction
{ "model": "gemini-3.8-flash",
  "systemInstruction": { "parts": [{ "text": "Sei un assistente tecnico." }] },
  "contents": [{ "role": "user", "parts": [{ "text": "Analizza questo log." }] }] }

// DeepSeek: compatibile OpenAI, system è un messaggio come gli altri
{ "model": "deepseek-v4-flash",
  "messages": [
    { "role": "system", "content": "Sei un assistente tecnico." },
    { "role": "user", "content": "Analizza questo log." }
  ] }

Un middleware di traduzione che normalizza questi tre formati in un’unica interfaccia interna riduce drasticamente il tempo di integrazione quando si vuole testare più di un fornitore in parallelo, ed è la base di molti strumenti di astrazione oggi diffusi tra i team che gestiscono più provider contemporaneamente.

  1. Verifica il formato del system prompt. Anthropic tratta il prompt di sistema come parametro separato dai messaggi, Google usa il campo systemInstruction nella richiesta a Gemini, DeepSeek segue la convenzione OpenAI con un messaggio di ruolo system nell’array dei messaggi.
  2. Mappa l’autenticazione. Anthropic richiede l’header x-api-key, Google accetta una API key nella query string o l’autenticazione OAuth via Vertex AI, DeepSeek usa un Bearer token standard.
  3. Ricontrolla lo schema di function calling. Il formato dei tool e delle risposte delle funzioni cambia da fornitore a fornitore: testare ogni chiamata a strumenti esterni prima di spostare traffico in produzione evita errori silenziosi difficili da diagnosticare.
  4. Misura il costo reale, non quello di listino. Come mostra il caso di DeepSeek in modalità reasoning, il prezzo per token pubblicato non coincide sempre con il costo per attività completata. Calcola il costo su un campione reale di richieste prima di firmare un contratto annuale.
  5. Esegui un test A/B su una fetta di traffico. Instrada il 5-10% delle richieste al nuovo modello e confronta tasso di errore, latenza percepita e costo per sessione per almeno due settimane prima del passaggio completo.
  6. Prepara un piano di rollback. Mantieni attiva la configurazione precedente per almeno un ciclo di fatturazione, in modo da poter tornare indietro rapidamente se il nuovo modello introduce regressioni non previste nei test.

Chi gestisce più fornitori contemporaneamente può valutare un livello di astrazione come quelli discussi nel confronto tra Ollama, LM Studio e vLLM, utile anche per capire come instradare il traffico tra modelli proprietari e modelli open-weight come DeepSeek senza duplicare il codice applicativo.

Vantaggi e svantaggi di ciascun modello

Gemini 3.8 Flash

Vantaggi: input multimodale nativo (testo, immagine, audio, video, PDF), velocità di generazione più alta dei tre (262 token/s), distribuzione capillare su tutto lo stack Google, prezzo intermedio con sconto in cache aggressivo. Svantaggi: punteggio agentico e di coding più basso degli altri due (64,2 e 64,1 su BenchLM), nessuna garanzia di residenza UE sull’endpoint globale senza configurazione esplicita della regione.

Claude Opus 5.5

Vantaggi: primo posto assoluto su Artificial Analysis Intelligence Index (58 punti), leader netto su coding e compiti agentici, accesso via Vertex AI o AWS Bedrock in regione europea. Svantaggi: il più caro dei tre di ampio margine (20 dollari per milione di token in output), il più lento (95 token/s), nessun input video o audio nativo.

DeepSeek V4 Flash 0731

Vantaggi: costo per token più basso di ampio margine, pesi aperti per il self-hosting, buoni risultati su benchmark di coding come LiveCodeBench (91,6%) e SWE-bench Verified (79%). Svantaggi: già superato dal successore V4.1 Flash uscito il 10 settembre 2026, nessun rango pubblico ufficiale su BenchLM, solo input testuale, precedente normativo italiano da valutare con attenzione prima di trattare dati personali.

Verdetto finale: chi vince davanti ai dati

Non esiste un vincitore assoluto, e i dati raccolti lo confermano più di quanto lo smentiscano. Se il criterio è la qualità pura del ragionamento e la capacità agentica, Claude Opus 5.5 vince con margini che nella maggior parte delle categorie non si sovrappongono nemmeno considerando l’incertezza statistica: primo su Intelligence Index, primo su coding, primo su compiti agentici. Se il criterio è il costo per attività completata, DeepSeek V4 Flash 0731 vince con un margine di 71,4 volte sull’output rispetto a Claude Opus 5.5, pur scontando l’assenza di un rango pubblico consolidato e un precedente normativo italiano da non ignorare. Se il criterio è la copertura multimodale e la velocità, Gemini 3.8 Flash resta l’unica opzione che legge nativamente immagini, audio, video e PDF nello stesso endpoint, con la risposta più rapida dei tre.

Per un team europeo che deve prendere una decisione operativa oggi, la raccomandazione pratica è questa: usa Claude Opus 5.5 dove l’errore costa più del token, usa Gemini 3.8 Flash dove serve leggere contenuti multimodali a bassa latenza, e riserva DeepSeek V4 Flash 0731, o meglio, valuta subito il suo successore V4.1 Flash, ai carichi di lavoro ad alto volume dove il costo per token pesa più di ogni altra variabile, verificando prima la compliance sui dati personali.

Domande frequenti

Quale dei tre modelli costa meno per milione di token?

DeepSeek V4 Flash 0731, con 0,14 dollari per milione di token in input e 0,28 in output secondo il listino ufficiale riportato da BenchLM, contro 0,75/3,75 dollari di Gemini 3.8 Flash e 4/20 dollari di Claude Opus 5.5.

Claude Opus 5.5 è davvero il modello con il punteggio più alto?

Su Artificial Analysis Intelligence Index sì, con 58 punti e primo posto su 216 modelli comparabili. Su BenchLM è secondo con 87,1 punti su 209 modelli, dietro solo al modello leader di categoria GPT-6 Astra (88,5 punti).

Posso usare DeepSeek V4 Flash 0731 con dati personali di utenti italiani?

Serve cautela. Il Garante per la protezione dei dati personali ha imposto una limitazione urgente al trattamento dei dati italiani da parte delle società cinesi collegate a DeepSeek il 30 gennaio 2025, dopo aver rilevato che la privacy policy dichiarava la conservazione dei dati in Cina. Prima di collegare dati personali all’API va verificata la base giuridica del trasferimento e la possibilità di disattivare la conservazione dei prompt.

DeepSeek V4 Flash 0731 è ancora il modello più recente di DeepSeek?

No. DeepSeek ha rilasciato il successore, V4.1 Flash, il 10 settembre 2026 secondo il changelog ufficiale dell’API. Artificial Analysis segnala che V4 Flash 0731 è da considerarsi superato e consiglia di valutare la nuova versione.

Quale modello ha la finestra di contesto più ampia?

Nessuno dei tre si distacca in modo significativo. Gemini 3.8 Flash dichiara 1.048.576 token, Claude Opus 5.5 e DeepSeek V4 Flash 0731 dichiarano entrambi 1.000.000 di token. La differenza pratica è minima.

Quale modello scegliere per un’applicazione che analizza immagini e video?

Gemini 3.8 Flash è l’unico dei tre con supporto nativo a immagini, audio e video nello stesso endpoint di testo. Claude Opus 5.5 accetta solo testo e immagini, DeepSeek V4 Flash 0731 accetta solo testo.

Claude Opus 5.5 è disponibile in Europa con garanzie di residenza dei dati?

Anthropic non offre un endpoint API regionale europeo di prima parte. Per una garanzia di elaborazione in territorio UE serve passare tramite AWS Bedrock o Google Cloud Vertex AI, scegliendo esplicitamente una regione europea in entrambi i servizi.

I punteggi di BenchLM e Artificial Analysis coincidono?

No, e la differenza è normale. Le due piattaforme usano panieri di benchmark e pesi diversi. Su BenchLM, Claude Opus 5.5 è secondo su 209 modelli con 87,1 punti. Su Artificial Analysis è primo su 216 con 58 punti. Il ranking relativo tra i tre modelli di questo confronto, però, resta lo stesso su entrambe le fonti: Claude Opus 5.5 davanti, Gemini 3.8 Flash a metà, DeepSeek V4 Flash 0731 senza un rango pubblico consolidato ma con buoni risultati sui singoli test disponibili.