Chi deve scegliere un modello linguistico per un prodotto vero, non per curiosità, prima o poi finisce su una classifica. Il problema è che oggi le classifiche più citate raccontano tre storie diverse, e una delle tre è già chiusa. Hugging Face ha ritirato ufficialmente il suo Open LLM Leaderboard il 13 marzo 2025, dopo averlo già sostituito una prima volta nel giugno 2024. Restano in campo due contendenti con filosofie opposte: Arena (ex LMArena, ex Chatbot Arena) che misura le preferenze umane voto dopo voto, e Artificial Analysis che calcola un indice composito di intelligenza, prezzo e velocità. Questo confronto mette a fianco i tre sistemi, spiega perché quello di Hugging Face è morto e aiuta chi lavora con l’AI a capire quale numero guardare prima di firmare un contratto API.

Non è un dettaglio da addetti ai lavori. Ogni settimana escono nuovi modelli da OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba e Mistral, e ogni volta qualcuno in azienda chiede “ma è meglio di quello che usiamo adesso?”. La risposta cambia a seconda di dove si guarda, e capire perché cambia è più utile che memorizzare il nome del modello primo in classifica questa settimana.

Cos’è una classifica LLM e perché conta per chi sviluppa software

Una classifica LLM (large language model) è un sistema che ordina i modelli linguistici in base a una metrica misurabile: punteggio su benchmark accademici, preferenza espressa da utenti reali, oppure un indice sintetico che combina più fattori. Serve perché nessuna azienda può testare da sola decine di modelli nuovi ogni mese: OpenAI, Anthropic, Google, xAI, DeepSeek, Alibaba (famiglia Qwen) e Mistral rilasciano aggiornamenti con un ritmo che a ottobre 2026 supera ormai una nuova versione rilevante a settimana.

Il punto debole di ogni classifica è la metodologia. Un punteggio alto su un benchmark accademico non garantisce che il modello scriva codice leggibile, risponda in modo utile a un cliente o costi poco per milione di token. Per questo motivo i tre sistemi che analizziamo misurano cose diverse: Arena chiede agli umani quale risposta preferiscono, Artificial Analysis calcola un indice numerico basato su test propri più prezzo e velocità, Hugging Face (quando era attivo) eseguiva sei benchmark standardizzati su modelli open-weight. Capire questa differenza evita l’errore più comune: scegliere un modello solo perché è primo in una tabella, senza sapere cosa quella tabella sta davvero misurando.

C’è anche un problema pratico che riguarda chi scrive software: molte guide tecniche online, anche recenti, citano ancora i vecchi punteggi dell’Open LLM Leaderboard come se fossero aggiornati. Un team che basa una decisione di procurement su un dato fermo da un anno e mezzo rischia di scegliere un modello già superato da almeno tre generazioni successive. Verificare la data dell’ultimo aggiornamento di una classifica dovrebbe essere il primo passo, prima ancora di guardare il punteggio.

Arena (LMArena): la classifica basata sul voto umano

Arena nasce il 24 aprile 2023 come Chatbot Arena, progetto di ricerca del laboratorio LMSYS all’Università di Berkeley, fondato da Wei-Lin Chiang, Anastasios Angelopoulos e dal professore Ion Stoica, secondo quanto riporta la voce Wikipedia dedicata al progetto. Nel 2025 il team ha fondato Arena Intelligence Inc., raccogliendo capitali da Andreessen Horowitz e dall’Università della California, come confermato dalla pagina ufficiale Arena.ai About Us.

Il meccanismo è semplice da spiegare e complesso da calcolare: un utente scrive un prompt, riceve due risposte da modelli anonimi e vota quella che preferisce. I voti si accumulano in un ranking calcolato oggi con un modello Bradley-Terry, non più con il semplice Elo delle scacchiere, come descritto nel changelog ufficiale della piattaforma. Il passaggio dal bootstrap al calcolo degli intervalli di confidenza tramite il teorema del limite centrale per M-estimatori non è un dettaglio accademico: riduce drasticamente il tempo di calcolo necessario a stabilizzare un ranking ogni volta che arrivano nuovi voti, permettendo aggiornamenti più frequenti.

Il changelog racconta anche gli aggiustamenti più recenti. Il 30 settembre 2025 è stato ricalcolato lo Steerability Score sull’Agent Arena, premiando i modelli che sbagliano meno al primo tentativo invece di quelli che si limitano a correggersi quando vengono ripresi dall’utente. Il 12 maggio 2026 i voti raccolti nella modalità “Direct” (chat dirette, non più solo battaglie alla cieca) hanno iniziato a contare per il ranking pubblico, ampliando il volume di dati giornaliero e includendo prompt più lunghi e complessi rispetto alle brevi domande tipiche delle battaglie casuali.

Arena applica anche filtri tecnici per evitare che il voto venga manipolato o distorto. Rimuove circa il 10% dei voti per deduplicazione di prompt ad alta frequenza e rilevamento di identity leak, cioè i casi in cui un modello rivela involontariamente la propria identità nella risposta, influenzando il giudizio dell’utente. Corregge inoltre il bias di posizione, la tendenza statistica a preferire la risposta mostrata per prima nell’interfaccia, e il bias organizzativo nelle battaglie che includono contesto conversazionale esteso. Queste correzioni, documentate pubblicamente nel changelog dal 17 settembre 2025 in poi con l’aggiunta di un filtro per pattern di voto statisticamente anomali, sono ciò che distingue Arena da un semplice sondaggio online.

A ottobre 2026 la Text Arena generalista vede in testa GPT-6.1 Sol (Max), seguito da Claude Sonnet 5.5-xhigh e DeepSeek V4.1 Flash. Nell’Agent Arena, la categoria che misura capacità operative come uso di strumenti ed esecuzione di compiti multi-step, comanda invece Claude Opus 5.5 (Max), con GPT-6.1 Sol (Max) in seconda posizione. Nella categoria Code/WebDev il podio ricalca quasi esattamente quello dell’Agent Arena: gpt-6-sol-max, claude-opus-5.5-max e deepseek-v4.1-flash-max. Arena gestisce anche arene dedicate alla generazione di immagini, dove a ottobre 2026 compaiono in testa grok-imagine-image-2.0, ideogram-4.5 e recraft-v4.1. L’accesso al sito pubblico resta gratuito, anche se Arena si riserva per contratto la possibilità di introdurre tariffe in futuro per servizi aggiuntivi.

Artificial Analysis: l’indice che unisce intelligenza, prezzo e velocità

Artificial Analysis nasce nel 2023 dall’idea di Micah Hill-Smith, oggi CEO, e George Cameron, oggi Chief Product Officer. Secondo un profilo pubblicato su LinkedIn, i due avrebbero iniziato il progetto in uno scantinato a Sydney mentre Hill-Smith sviluppava un servizio di ricerca legale basato su AI e si scontrava quotidianamente con la mancanza di dati comparabili e aggiornati su modelli diversi. L’azienda, oggi con base a San Francisco, non si limita a riportare i numeri dichiarati dai produttori: esegue test propri su ogni modello che entra nel suo catalogo, misurando capacità, prezzo per milione di token e velocità di risposta osservata direttamente sulle API dei provider.

Il cuore del sistema è l’Intelligence Index, un punteggio composito che la pagina ufficiale Artificial Analysis LLM Leaderboard descrive come derivato da intelligenza, prezzo, performance e velocità, quest’ultima misurata sia come token al secondo in output sia come latenza TTFT (time to first token, il tempo che intercorre tra l’invio della richiesta e la prima parola di risposta), oltre alla dimensione della finestra di contesto e altri parametri tecnici. A ottobre 2026 il modello in testa è Claude Opus 5.5 (max con fallback) di Anthropic, con un punteggio Intelligence Index di 58, calcolato su un catalogo che la stessa pagina descrive come composto da oltre 250 modelli AI monitorati attivamente.

L’accesso al sito e alla API gratuita è libero, ma con un limite dichiarato di 100 richieste ogni 24 ore per uso esplorativo e interno, secondo la pagina ufficiale dei prezzi. Per chi ha bisogno di integrare questi dati in un prodotto o in un processo di procurement continuo, esistono due livelli superiori: il piano Pro, pensato per singoli professionisti o piccole organizzazioni, e il piano Enterprise, rivolto esplicitamente ad aziende con almeno 150 dipendenti.

A differenza di Arena, Artificial Analysis non si basa sul voto umano ma su benchmark eseguiti direttamente dal team, uniti a dati di prezzo e velocità raccolti osservando le API dei provider in tempo reale, giorno dopo giorno. Questo lo rende più adatto a chi deve prendere decisioni di procurement, cioè capire quale modello costa meno per lo stesso livello di qualità dichiarata, piuttosto che a chi vuole capire quale modello “piace di più” in una conversazione aperta con un utente finale.

Hugging Face Open LLM Leaderboard: la classifica che non c’è più

Qui sta la parte della storia che molte guide online ancora raccontano male. L’Open LLM Leaderboard di Hugging Face, lo strumento che per anni ha fatto da riferimento gratuito per i modelli open-weight, non esiste più come classifica aggiornata. La prima versione, la v1, è stata archiviata nel giugno 2024 e sostituita da una v2 basata su sei benchmark automatici. IFEval misura la capacità di seguire istruzioni esplicite, come includere una parola chiave o rispettare un formato richiesto. BBH è l’abbreviazione di Big-Bench Hard, MATH Level 5 è il livello più difficile del benchmark matematico MATH, e GPQA raccoglie quesiti di livello da dottorato di ricerca, pensati per essere difficili anche per i laureati nella materia. Completano il gruppo MuSR, che valuta il ragionamento multi-step, e MMLU-Pro, versione ampliata e più impegnativa del classico benchmark MMLU, con dieci opzioni di risposta invece di quattro. La documentazione di questa seconda versione si trova ancora nella pagina ufficiale Open LLM Leaderboard v1 – Hugging Face.

Ma anche la v2 ha avuto vita breve rispetto alle aspettative della community. Il 13 marzo 2025 il team ha pubblicato un annuncio nella pagina di discussione ufficiale dello spazio, con un titolo informale che gioca sull’affetto accumulato dagli utenti nel tempo, seguito dall’ammissione esplicita che “la classifica sta ufficialmente andando in pensione”, come si legge nella discussione archiviata su Hugging Face. I risultati storici restano consultabili in una collezione congelata, la Archived Open LLM Leaderboard 2024-2025, ma nessun nuovo modello viene aggiunto dal marzo 2025 in avanti.

Al posto di una classifica unica, Hugging Face oggi indirizza gli sviluppatori verso un ecosistema più frammentato di valutazioni specifiche per compito, documentato nella pagina Leaderboards and Evaluations. La logica è cambiata radicalmente rispetto all’impostazione originale: non più “questo modello è il migliore in assoluto”, ma “questo modello è il migliore per questo specifico tipo di compito”, lasciando a sviluppatori e ricercatori la responsabilità di scegliere quale sotto-benchmark sia più rilevante per il proprio progetto. Per chi ha costruito negli anni un flusso di lavoro basato sui vecchi punteggi IFEval o GPQA dell’Open LLM Leaderboard, questo significa dover migrare la propria strategia di valutazione altrove: la sezione dedicata più avanti spiega come farlo senza perdere continuità storica nei propri confronti.

Vale la pena notare un limite strutturale che l’Open LLM Leaderboard ha sempre avuto, anche nei suoi anni migliori: copriva soltanto modelli open-weight, cioè con pesi scaricabili pubblicamente. I modelli proprietari dei grandi laboratori, da GPT a Claude a Gemini, non sono mai comparsi in quella classifica. Questo la rendeva utile per confrontare tra loro le famiglie Llama, Mistral, Qwen o Gemma, ma inutile per chi doveva scegliere tra un’API proprietaria e un modello open-weight da ospitare in casa.

Tabella comparativa: Arena vs Artificial Analysis vs Hugging Face

CaratteristicaArena (LMArena)Artificial AnalysisHugging Face Open LLM Leaderboard
Anno di fondazione2023 (Chatbot Arena)20232023 (v1), v2 da giugno 2024
Stato a ottobre 2026AttivoAttivoRitirato dal 13 marzo 2025
MetodologiaVoto umano alla cieca, modello Bradley-TerryBenchmark proprietari + prezzo/velocità osservati6 benchmark automatici (IFEval, BBH, MATH L5, GPQA, MuSR, MMLU-Pro)
OrganizzazioneArena Intelligence Inc. (ex LMSYS/UC Berkeley)Artificial Analysis Inc.Hugging Face
Modello in testa (dove applicabile)GPT-6.1 Sol Max (Text Arena), Claude Opus 5.5 Max (Agent Arena)Claude Opus 5.5 (Intelligence Index 58)Congelato a marzo 2025
Numero modelli tracciatiDecine per singola arena specificaOltre 250Centinaia (solo archivio storico)
Copre modelli proprietari (closed-weight)SìSìNo, solo open-weight
Copre modelli open-weightSìSìSì (unico focus)
Accesso gratuitoSì, sito pubblicoSì, con limite di 100 richieste/24h via APISì, dati storici archiviati
Livello a pagamentoServizio custom “AI Evaluations” per aziendePro a 417-499 $/mese, Enterprise customNon disponibile
Frequenza di aggiornamentoContinua, voti in tempo realeContinua, nuovi modelli entro giorni dal rilascioFerma dal marzo 2025
Trasparenza della metodologiaChangelog pubblico con correzioni statistiche documentateMetodologia descritta ma test eseguiti internamenteBenchmark pubblici e riproducibili
Adatto perValutare l’esperienza utente percepitaDecisioni di procurement e costo/qualitàSolo consultazione storica

Pricing: cosa costa davvero usare ciascuna piattaforma

Nessuna delle tre piattaforme chiede un pagamento per consultare la classifica pubblica sul web, ma le differenze emergono appena si vuole automatizzare l’accesso ai dati o ottenere valutazioni su misura per un caso d’uso specifico. Artificial Analysis ha il modello di monetizzazione più strutturato e pubblicamente listato: secondo la pagina pricing ufficiale, il piano Free offre l’API pubblica con un tetto di 100 richieste ogni 24 ore per uso esplorativo e interno, il piano Pro costa 417 dollari al mese con fatturazione annuale (oppure 499 dollari al mese senza impegno) e sblocca dati a livello di singolo modello, un builder di grafici personalizzabili, download di dati grezzi e report trimestrali sullo stato del mercato, mentre il livello Enterprise è a prezzo personalizzato ed è pensato per organizzazioni con almeno 150 dipendenti, con limiti di richieste API più alti, accesso a dati sul mercato del calcolo con previsioni e consulenza strategica inclusa nel pacchetto.

Arena monetizza in modo diverso e meno trasparente sul listino pubblico: non vende un’API dati a prezzo fisso pubblicato, ma un servizio chiamato “AI Evaluations”, descritto nel blog ufficiale della piattaforma, rivolto ad aziende, laboratori di modelli e sviluppatori che vogliono valutazioni più approfondite basate su feedback umano reale raccolto direttamente sulla piattaforma. Il prezzo non è listato pubblicamente ed è negoziato caso per caso, anche se l’azienda dichiara di mantenere condizioni agevolate e flessibili per modelli open-weight e istituzioni no-profit, un dettaglio che conta per chi lavora in ambito accademico o in progetti open source con budget limitati.

PiattaformaPiano gratuitoPiano a pagamentoPrezzo indicativo
Arena (LMArena)Sito pubblico, voto e consultazione classifica illimitatiAI Evaluations per aziende e laboratoriSu richiesta, nessun listino pubblico
Artificial AnalysisLeaderboard web completa + API con 100 richieste/24hPro / Enterprise417-499 $/mese (Pro), prezzo custom (Enterprise, 150+ dipendenti)
Hugging Face Open LLM LeaderboardArchivio storico consultabile gratuitamenteNon disponibile (servizio ritirato dal 2025)N/A

Benchmark a confronto: come cambia il podio a seconda della fonte

La prova più utile per chi legge classifiche senza fidarsi ciecamente è confrontare lo stesso periodo su fonti diverse e vedere quanto cambia il vincitore. Su Artificial Analysis, a ottobre 2026, l’Intelligence Index colloca Claude Opus 5.5 al primo posto assoluto con punteggio 58. Su Arena, nello stesso periodo, la Text Arena generalista premia invece GPT-6.1 Sol (Max), mentre è Claude Opus 5.5 a guidare l’Agent Arena, la categoria che misura capacità operative come l’uso di strumenti esterni e l’esecuzione di compiti su più passaggi senza supervisione continua. Nella categoria Code/WebDev di Arena il podio si ripete quasi identico a quello dell’Agent Arena, con gpt-6-sol-max e claude-opus-5.5-max ai primi due posti e deepseek-v4.1-flash-max al terzo, segno che il comportamento di un modello cambia in modo misurabile a seconda del compito specifico assegnato.

Questa non coincidenza totale tra le due classifiche attive non è un difetto di progettazione, è la prova che stanno misurando cose diverse per natura. Artificial Analysis premia il modello più efficiente nel rapporto tra capacità dichiarata, prezzo e velocità di risposta misurata in laboratorio su richieste standardizzate. Arena premia il modello che, messo alla prova in una conversazione reale e giudicato da un umano in cieco senza sapere quale azienda lo ha prodotto, convince di più nel momento specifico del confronto. Un modello può essere tecnicamente più capace su un benchmark sintetico e risultare meno gradito in una chat dal vivo, magari per un tono percepito come più freddo, risposte più lunghe del necessario o un formato meno leggibile su schermo.

Chi sceglie un modello solo guardando una classifica, qualunque essa sia, rischia di ottimizzare per la metrica sbagliata rispetto al proprio caso d’uso reale. Un modello primo in classifica su un benchmark di matematica avanzata non è automaticamente la scelta giusta per un chatbot di assistenza clienti, così come un modello che vince per preferenza umana in conversazioni brevi non è detto che regga bene su un flusso agentico lungo con decine di chiamate a strumenti esterni in sequenza.

ModelloPosizione Artificial Analysis (Intelligence Index)Posizione Arena TextPosizione Arena Agent
Claude Opus 5.5#1 (58)Tra i primi 5#1
GPT-6.1 Sol (Max)Tra i primi 5#1#2
Claude Sonnet 5.5Tra i primi 10#2 (xhigh)Tra i primi 10
DeepSeek V4.1 FlashTra i primi 20#3Presente in Code/WebDev

La tabella sopra riassume in modo visivo quanto detto finora: nessun modello domina tutte le classifiche contemporaneamente, e la posizione cambia a seconda che si guardi al rapporto qualità/prezzo di Artificial Analysis o alla preferenza umana diretta misurata da Arena nelle sue diverse arene specializzate.

Cinque casi d’uso reali: quale classifica guardare

Più che cercare un vincitore assoluto, ha senso individuare quale sistema serve meglio ogni tipo di decisione. Ecco cinque scenari concreti che si incontrano spesso lavorando con l’intelligenza artificiale in un contesto aziendale europeo.

  • Startup che costruisce un chatbot di assistenza clienti. Qui conta soprattutto la percezione dell’utente finale: tono, utilità e naturalezza delle risposte contano più di un punteggio astratto su un benchmark accademico. La Text Arena di Arena, basata su voto umano cieco, è la fonte più indicata perché riproduce esattamente il tipo di giudizio che daranno i clienti reali davanti a uno schermo.
  • Team che deve scegliere un modello per generare codice a volumi alti, per esempio in una pipeline di revisione automatica. Il costo per milione di token e la velocità di risposta diventano decisivi quanto la qualità del codice generato, perché moltiplicati per migliaia di richieste al giorno. L’Intelligence Index di Artificial Analysis, che integra prezzo e velocità direttamente nel punteggio finale, offre un quadro più utile per un confronto costo/beneficio rispetto alla sola Code Arena di Arena.
  • Agenzia digitale che deve giustificare a un cliente la scelta di un modello specifico per un progetto. Avere un numero pubblico, verificabile e aggiornato, come l’Intelligence Index o il ranking Arena, rende la decisione difendibile in una proposta commerciale scritta, a differenza di un giudizio soggettivo interno difficile da motivare su carta.
  • Ricercatore universitario che cita classifiche in un paper o in una tesi. Qui la provenienza accademica conta davvero: Arena nasce da un laboratorio di Berkeley e pubblica la propria metodologia statistica, incluso il modello Bradley-Terry e le correzioni di bias, in modo trasparente e verificabile, un requisito spesso necessario per superare la revisione paritaria.
  • Azienda che tre anni fa aveva costruito il proprio processo interno di selezione modelli attorno all’Open LLM Leaderboard di Hugging Face. Questo è il caso più delicato di tutti: il sistema di riferimento è sparito senza un sostituto diretto, e serve una migrazione pianificata con attenzione, che trattiamo nel dettaglio nella sezione successiva.

Guida alla migrazione: lasciare l’Open LLM Leaderboard di Hugging Face

Chi ha ancora un flusso di lavoro, uno script di procurement interno o anche solo un’abitudine di controllo basata sui vecchi punteggi IFEval, BBH o GPQA dell’Open LLM Leaderboard deve affrontare una transizione vera e propria, non solo un cambio di segnalibro nel browser. Ecco i passaggi concreti per farlo senza perdere continuità storica nei propri confronti.

  1. Verificare se i modelli che si usano oggi hanno ancora un punteggio nella collezione archiviata su Hugging Face: serve solo come riferimento storico per confronti con modelli dello stesso periodo, non va più usato per confrontare un modello vecchio con uno rilasciato di recente.
  2. Smettere di eseguire query automatizzate contro lo spazio open-llm-leaderboard all’interno di script o pipeline di CI/CD: non riceve più aggiornamenti dal marzo 2025 e qualunque automazione collegata restituirà dati congelati senza alcun avviso di errore.
  3. Per modelli open-weight come Llama, Qwen, Mistral, Gemma o DeepSeek, migrare il confronto di capacità verso Artificial Analysis, che copre sia modelli proprietari sia open-weight nello stesso Intelligence Index, rendendo il confronto diretto tra le due categorie molto più semplice di prima.
  4. Per valutare la qualità percepita in conversazione reale, aggiungere Arena come seconda fonte di verifica: a differenza del vecchio sistema Hugging Face, che usava benchmark statici eseguiti una tantum, Arena riflette il comportamento reale degli utenti aggiornato ogni giorno con nuovi voti.
  5. Se il proprio processo interno richiedeva specificamente benchmark come IFEval o GPQA, verificare se il produttore del modello li pubblica singolarmente nella propria scheda tecnica (model card): molti laboratori, incluso DeepSeek e Alibaba per la famiglia Qwen, continuano a riportare questi punteggi anche dopo la chiusura della classifica aggregata di Hugging Face.
  6. Documentare nel proprio processo interno quale fonte si usa per quale tipo di decisione, invece di affidarsi a un singolo numero o a una singola piattaforma: la lezione della chiusura di Hugging Face è che anche le fonti più consolidate e citate del settore possono smettere di aggiornarsi in pochi mesi senza preavviso prolungato.

Pro e contro di ciascuna piattaforma

Arena (LMArena): pro e contro

  • Pro: giudizio basato su persone reali, non solo su test sintetici eseguiti in laboratorio.
  • Pro: filtri tecnici contro manipolazione del voto e bias di posizione, documentati pubblicamente nel changelog.
  • Pro: copre sia modelli di chat generalisti sia agenti e generazione di codice in arene separate e specializzate.
  • Contro: il voto umano può premiare risposte più lunghe o più “piacevoli” invece che più corrette o più concise.
  • Contro: nessun listino pubblico per i servizi enterprise, ogni trattativa va negoziata caso per caso senza un punto di partenza chiaro.

Artificial Analysis: pro e contro

  • Pro: unico indice che integra intelligenza, prezzo e velocità in un solo numero facile da confrontare.
  • Pro: copertura molto ampia, oltre 250 modelli monitorati secondo la pagina ufficiale, inclusi provider meno noti.
  • Pro: aggiornamento rapido sui modelli appena rilasciati, spesso entro pochi giorni, utile per chi segue il mercato da vicino.
  • Contro: l’API gratuita è limitata a 100 richieste ogni 24 ore, decisamente insufficiente per un uso in produzione continua.
  • Contro: il piano Pro a 417-499 dollari al mese è un costo non banale per piccoli team o sviluppatori indipendenti.

Hugging Face Open LLM Leaderboard: pro e contro

  • Pro: i dati storici restano gratuiti e consultabili nella collezione archiviata, utile per ricerche retrospettive.
  • Pro: la metodologia a sei benchmark resta un buon riferimento didattico per capire cosa misurano concretamente IFEval, GPQA o MMLU-Pro.
  • Contro: nessun aggiornamento dal 13 marzo 2025, quindi del tutto inutile per confrontare modelli recenti.
  • Contro: copriva solo modelli open-weight, escludendo da sempre i modelli proprietari dei grandi laboratori come OpenAI o Anthropic.

Dal 2023 a oggi: come si è evoluto il panorama delle classifiche

Il 2023 è stato l’anno di partenza per entrambi i progetti ancora vivi: Chatbot Arena nasce il 24 aprile come esperimento accademico di Berkeley, mentre Artificial Analysis prende forma qualche mese dopo come side project di due persone che volevano semplicemente capire quale modello conveniva usare per il proprio lavoro quotidiano. Nello stesso periodo Hugging Face lanciava la prima versione del proprio Open LLM Leaderboard, pensata per dare alla comunità open source uno strumento gratuito e riproducibile per confrontare i modelli scaricabili liberamente, in un momento in cui il mercato era dominato quasi solo da OpenAI e pochi altri.

Il 2024 segna il primo scossone: Hugging Face archivia la v1 a giugno e la sostituisce con una v2 più severa, basata su benchmark pensati per essere più difficili da “saturare”, cioè più resistenti al fenomeno per cui i punteggi di tutti i modelli finiscono per avvicinarsi troppo e perdere capacità discriminante. Nello stesso anno Chatbot Arena cambia nome in LMArena e si trasferisce su un dominio proprio, segnale di una crescita che va oltre il progetto di ricerca iniziale.

Il 2025 è l’anno della svolta commerciale e, in parallelo, della prima chiusura definitiva. A marzo Hugging Face ritira la v2 senza un sostituto diretto. Poco dopo, LMArena diventa Arena Intelligence Inc., una vera società con capitali di venture capital alle spalle, e inizia a offrire servizi di valutazione a pagamento per le aziende. Il 2026, infine, è l’anno in cui le due piattaforme superstiti rifiniscono la propria metodologia: Arena introduce il conteggio dei voti dalle chat dirette e ricalcola lo Steerability Score, mentre Artificial Analysis consolida il proprio Intelligence Index come riferimento citato sempre più spesso in confronti di settore, arrivando a coprire oltre 250 modelli attivi.

Limiti metodologici: i punti deboli che poche guide raccontano

Ogni sistema di misurazione ha un punto cieco, ed è onesto nominarlo invece di presentare questi strumenti come oracoli infallibili. Il limite più discusso di Arena riguarda la natura stessa del voto umano: chi vota in pochi secondi tende a premiare risposte più lunghe, più formattate con elenchi puntati, o semplicemente più rassicuranti nel tono, indipendentemente dalla correttezza fattuale del contenuto. È per questo che il team ha dovuto introdurre correzioni per il bias di posizione e per la deduplicazione dei prompt più comuni: senza quei filtri, un modello potrebbe scalare la classifica semplicemente imparando lo “stile” che piace ai votanti, non migliorando davvero la propria capacità di ragionamento.

Il limite di Artificial Analysis è diverso ma altrettanto concreto: i benchmark sono eseguiti dal team stesso, con metodologie proprie che non sono sempre riproducibili da terzi nello stesso modo in cui lo erano i sei test pubblici di Hugging Face. Questo non significa che i numeri siano inaffidabili, ma significa che un’azienda che vuole replicare esattamente un punteggio pubblicato deve fidarsi della metodologia dichiarata senza poterla rieseguire in autonomia riga per riga, a differenza di un benchmark open source come IFEval o GPQA, che chiunque può scaricare ed eseguire sul proprio hardware.

Il limite di Hugging Face, con il senno di poi, è stato quello più strutturale: mantenere aggiornata una classifica che ricalcola centinaia di modelli su sei benchmark richiede un’infrastruttura di calcolo costante e costosa, sostenibile per un’organizzazione no-profit solo fino a un certo punto. La chiusura del marzo 2025 ha mostrato che la riproducibilità scientifica, per quanto preziosa, non basta da sola a garantire la sopravvivenza economica di un progetto che non genera ricavi diretti.

Verdetto: quale classifica usare nel 2026

Non esiste un vincitore unico perché Arena e Artificial Analysis rispondono a domande diverse, e Hugging Face ormai non risponde a nessuna domanda corrente. Per chi deve decidere quale modello comprare in base al rapporto tra qualità, prezzo e velocità, Artificial Analysis resta il riferimento più diretto, con l’Intelligence Index che a ottobre 2026 premia Claude Opus 5.5 con punteggio 58 su un catalogo di oltre 250 modelli monitorati attivamente. Per chi vuole sapere come un modello si comporterà davvero in una conversazione con un utente umano, Arena resta la fonte più solida, con GPT-6.1 Sol (Max) in testa alla Text Arena generalista e Claude Opus 5.5 (Max) al primo posto nell’Agent Arena dedicata ai compiti operativi più complessi.

La vera lezione del 2026, però, riguarda la fragilità di questi sistemi più che il nome del modello vincitore del mese. Hugging Face aveva costruito uno degli strumenti più citati del settore, ripreso in centinaia di articoli, tesi e documentazioni interne, e lo ha chiuso nel giro di nove mesi dalla sostituzione della prima versione con la seconda. Chi costruisce processi aziendali attorno a una singola classifica dovrebbe sempre avere un piano B pronto all’uso, perché la storia recente dimostra che anche le fonti più autorevoli del settore possono sparire senza un preavviso lungo o un sostituto diretto pronto all’uso.

In pratica, la combinazione più solida per un team che lavora seriamente con modelli linguistici è usare entrambe le piattaforme attive insieme: Artificial Analysis per la fase di selezione iniziale basata su costo e capacità dichiarata, Arena per una verifica finale sulla qualità percepita prima di mettere un modello in produzione davanti a utenti reali. Nessuna delle due sostituisce un test interno sul proprio caso d’uso specifico, ma insieme riducono di molto il rischio di scegliere alla cieca.

Un’ultima considerazione pratica per i team europei: nessuna delle due piattaforme nasconde i modelli di laboratori non statunitensi o cinesi, quindi Mistral, Qwen e DeepSeek compaiono negli stessi ranking di GPT, Claude e Gemini, con la stessa metodologia applicata a tutti senza trattamenti differenziati. Questo rende entrambe le fonti utilizzabili senza riserve anche da chi, per policy aziendale o per vincoli di sovranità del dato, deve valutare alternative ai modelli dei grandi laboratori americani.

Domande frequenti

Qual è la classifica LLM più affidabile nel 2026?

Non esiste una risposta unica: Arena è più affidabile per valutare la qualità percepita in conversazione reale, Artificial Analysis lo è per decisioni di costo e velocità. Usarle insieme riduce il rischio di scegliere un modello basandosi su una sola metrica isolata.

L’Open LLM Leaderboard di Hugging Face è ancora aggiornato?

No. È stato ritirato ufficialmente il 13 marzo 2025, dopo che la prima versione era già stata archiviata nel giugno 2024. I dati restano consultabili solo come archivio storico, senza nuovi modelli aggiunti da allora.

Arena e LMArena sono la stessa cosa?

Sì. Il progetto è nato nel 2023 come Chatbot Arena, è diventato LMArena nel 2024 con un dominio proprio, e dal 2025, dopo la costituzione di Arena Intelligence Inc., si presenta semplicemente come Arena.

Quanto costa usare Artificial Analysis per un uso professionale?

Il piano Free resta gratuito ma limitato a 100 richieste API ogni 24 ore. Il piano Pro costa 417 dollari al mese con fatturazione annuale, oppure 499 dollari al mese senza impegno annuale, mentre il piano Enterprise ha prezzo personalizzato ed è rivolto a organizzazioni con almeno 150 dipendenti.

Perché due classifiche attive oggi non sono d’accordo su quale sia il modello migliore?

Perché misurano cose diverse per costruzione. Arena misura la preferenza umana in cieco su conversazioni reali, Artificial Analysis misura un indice combinato di capacità, prezzo e velocità calcolato con benchmark propri eseguiti in laboratorio. Un modello può vincere su una metrica e arrivare secondo sull’altra senza che nessuna delle due sia sbagliata o inaffidabile.

Le classifiche LLM coprono anche i modelli europei come Mistral?

Sì, sia Arena sia Artificial Analysis includono i modelli Mistral nei rispettivi ranking, accanto ai modelli di OpenAI, Anthropic, Google, xAI, DeepSeek e Alibaba (famiglia Qwen), senza distinzioni di provenienza geografica nella metodologia di valutazione.

Conviene costruire un processo di selezione modelli basato su una sola classifica?

No. La chiusura dell’Open LLM Leaderboard di Hugging Face nel marzo 2025 dimostra che anche le fonti più consolidate del settore possono smettere di essere aggiornate senza preavviso. È più prudente combinare almeno due fonti con metodologie diverse e documentare internamente quale fonte guida quale tipo di decisione, in modo da non dipendere da un singolo punto di fallimento.

Esistono alternative italiane o europee a queste classifiche?

A ottobre 2026 non esiste una piattaforma europea con la stessa copertura e lo stesso volume di dati di Arena o Artificial Analysis. I laboratori europei come Mistral pubblicano i propri benchmark nelle schede tecniche dei modelli, ma per un confronto indipendente tra provider diversi restano di riferimento le due piattaforme analizzate in questo articolo.