Chi deve fare il fine-tuning di un modello open source nel 2026 si scontra presto con un problema che non riguarda la qualità del modello, ma la piattaforma su cui farlo girare. Together AI, Fireworks AI, Replicate e Modal promettono tutte la stessa cosa, addestrare e servire modelli aperti senza comprare GPU proprie, ma i listini prezzi, i limiti tecnici e il modo di fatturare cambiano parecchio da un provider all’altro. Il risultato pratico è che la stessa pipeline di fine-tuning può costare cifre molto diverse a seconda di dove la si esegue, e la differenza non si vede finché non si arriva alla fattura.
In questo confronto analizziamo i quattro provider più citati per il fine-tuning e l’hosting di modelli AI open source: prezzi aggiornati a ottobre 2026, limiti tecnici, use case concreti e una guida pratica per chi vuole migrare da una piattaforma all’altra senza perdere settimane di lavoro. I numeri che leggerete vengono dalle pagine prezzi ufficiali e da analisi indipendenti pubblicate nelle ultime settimane, non da stime a occhio.
Perché il confronto tra piattaforme di fine-tuning conta ora
Fino a poco tempo fa la scelta era quasi scontata: o si addestrava un modello proprietario chiuso tramite l’API del fornitore, oppure si affittava una GPU e si faceva tutto da sé. Oggi la situazione è diversa. I modelli open-weight (Llama, Qwen, DeepSeek, GLM, Kimi) hanno raggiunto prestazioni paragonabili a quelle dei modelli chiusi su molti compiti, e questo ha spinto decine di aziende a costruire piattaforme intermedie che offrono fine-tuning, hosting e inferenza senza richiedere la gestione diretta dell’infrastruttura GPU.
Together AI, Fireworks AI, Replicate e Modal sono finite al centro di questa corsa perché coprono bisogni diversi: Together AI punta su una pipeline integrata che va dal training al serving, Fireworks AI si concentra sul servire modelli fine-tuned allo stesso prezzo del modello base, Replicate offre un catalogo pubblico enorme pensato per la prototipazione rapida, mentre Modal propone un’infrastruttura serverless e programmabile pensata per team tecnici che vogliono controllare ogni riga di codice. Nessuna delle quattro è “la migliore” in assoluto: la scelta dipende dal tipo di modello, dal volume di token da addestrare e dalla frequenza con cui bisogna aggiornare l’inferenza in produzione.
Per un team europeo, e italiano in particolare, il confronto ha anche un risvolto pratico legato ai costi in euro e alla pianificazione del budget: tutte le tariffe pubblicate da questi provider sono in dollari, quindi oltre al confronto tra piattaforme bisogna tenere conto del cambio valutario quando si stima la spesa mensile. Un progetto che prevede fine-tuning ricorrente su base settimanale, per esempio, può vedere il costo finale oscillare in modo non trascurabile solo per effetto del tasso di cambio, a parità di tariffa in dollari pubblicata dal provider.
Together AI, Fireworks AI, Replicate e Modal: cosa fanno davvero
Together AI nasce come piattaforma di inferenza e training per modelli open-weight, con un catalogo che copre decine di famiglie di modelli e una pipeline di fine-tuning che supporta sia LoRA (Low-Rank Adaptation) sia il full fine-tuning. La pagina prezzi ufficiale, aggiornata il 9 ottobre 2026, elenca tariffe specifiche per modello: ad esempio il fine-tuning supervisionato di Qwen3.5 0.8B costa 0,34 dollari, la Direct Preference Optimization 0,84 dollari, con un addebito minimo di 4 dollari per job.
Fireworks AI segue una logica simile ma con una differenza operativa che pesa parecchio nel calcolo dei costi a lungo termine: una volta completato il fine-tuning, il modello risultante viene servito allo stesso prezzo del modello base, senza sovrapprezzo per il fatto di essere personalizzato. È un dettaglio che cambia i conti per chi deve mantenere decine di varianti fine-tuned in produzione contemporaneamente.
Replicate si distingue per il catalogo pubblico di modelli pronti all’uso e per il deployment tramite container Cog, lo standard open source che la stessa azienda ha contribuito a diffondere. La fatturazione è legata al tempo di esecuzione effettivo della macchina, il che la rende comoda per chi prototipa spesso ma meno prevedibile per carichi costanti ad alto volume.
Modal adotta un approccio radicalmente diverso: niente catalogo di modelli pronti, ma un’infrastruttura serverless e code-first pensata per chi scrive la propria pipeline di training o inferenza in Python e vuole che scali automaticamente. La fatturazione è calcolata al secondo, con moltiplicatori che dipendono dal tipo di workload e dalla GPU richiesta.
Tabella comparativa: specifiche tecniche a confronto
Prima di entrare nei dettagli di prezzo vale la pena vedere fianco a fianco le caratteristiche tecniche delle quattro piattaforme. La tabella seguente riassume gli elementi che contano più spesso quando si valuta dove fare fine-tuning di un modello open source.
| Caratteristica | Together AI | Fireworks AI | Replicate | Modal |
|---|---|---|---|---|
| Modello di business principale | Training + inferenza integrati | Serving e tuning open model | Hosting modelli via container | Serverless programmabile |
| Catalogo modelli pronti | Ampio, decine di famiglie | Ampio, focus open-weight | Molto ampio, pubblico | Nessuno, code-first |
| Supporto LoRA fine-tuning | Sì | Sì | Parziale, via container | Sì (configurazione manuale) |
| Supporto full fine-tuning | Sì | Sì | Limitato | Sì (configurazione manuale) |
| Serving fine-tuned a prezzo base | No, tariffa dedicata | Sì | Fatturazione solo ad attività | Non applicabile |
| Unità di fatturazione fine-tuning | Per milione di token | Per milione di token | Per tempo di esecuzione | Per secondo + moltiplicatori |
| Addebito minimo per job | 4 dollari (su alcune fasce) | Non specificato pubblicamente | Non applicabile | Non applicabile |
| GPU dedicate on demand | Sì, cluster self-serve | Sì | Sì, a consumo | Sì, autoscale |
| Deployment container standard | Proprietario | Proprietario | Cog (open source) | Proprietario |
| Adatto a prototipazione rapida | Media | Media | Alta | Bassa, richiede codice |
| Adatto a produzione enterprise | Alta | Alta | Media | Alta per team tecnici |
| Controllo infrastrutturale per lo sviluppatore | Medio | Medio | Basso | Molto alto |
Il quadro che emerge è chiaro: Together AI e Fireworks AI sono le scelte più equilibrate per chi vuole una pipeline completa senza scrivere troppa infrastruttura, Replicate vince su velocità di prototipazione e varietà di modelli pronti, Modal vince quando serve il massimo controllo tecnico e un’architettura serverless su misura.
Prezzi del fine-tuning: LoRA contro full fine-tuning
La voce di costo che pesa di più nella scelta di una piattaforma è quella del fine-tuning vero e proprio, e qui le differenze tra Together AI e Fireworks AI sono misurabili con precisione perché entrambe pubblicano tariffe per milione di token di training. Su Together AI il LoRA supervised fine-tuning costa circa 0,48 dollari per milione di token per modelli fino a 16 miliardi di parametri, cifra che sale a 1,50 dollari per la fascia 17-69 miliardi e a 2,90 dollari per la fascia 70-100 miliardi. Il full fine-tuning, che aggiorna tutti i pesi del modello invece di un sottoinsieme ridotto, costa indicativamente 2,5 volte la tariffa LoRA in ogni fascia, secondo l’analisi pubblicata da Onrup e confermata da HatchWorks.
Fireworks AI applica una struttura simile ma con numeri leggermente diversi: il LoRA supervised fine-tuning per modelli fino a 16 miliardi di parametri costa circa 0,50 dollari per milione di token, una cifra quasi identica a quella di Together AI. La differenza emerge nella fascia successiva: per i modelli tra 16,1 e 80 miliardi di parametri Fireworks AI arriva a circa 3 dollari per milione di token, un prezzo leggermente più alto rispetto alla fascia equivalente di Together AI. Chi lavora con modelli di dimensioni medio-grandi, quindi, paga quasi lo stesso per entrare ma un po’ di più a crescere.
| Fascia di parametri | Together AI (LoRA, $/M token) | Fireworks AI (LoRA, $/M token) | Note |
|---|---|---|---|
| Fino a 16B | 0,48 $ | 0,50 $ | Prezzi quasi identici in questa fascia |
| 17B – 69B / 16,1B – 80B | 1,50 $ | 3,00 $ | Fireworks più caro nella fascia media |
| 70B – 100B | 2,90 $ | Non pubblicato | Together pubblica la fascia alta |
| Full fine-tuning | ~2,5x la tariffa LoRA | Variabile per modello | Moltiplicatore riportato da Onrup e HatchWorks |
| Addebito minimo | 4 $ per job (alcune fasce) | Non specificato | Rilevante per dataset piccoli |
Un dettaglio spesso sottovalutato riguarda l’addebito minimo. Su Together AI alcune fasce di fine-tuning prevedono un minimo di 4 dollari per job, il che significa che un test rapido su un dataset piccolo costa comunque quella cifra anche se il calcolo dei token effettivi sarebbe inferiore. Per chi fa molti esperimenti brevi, questo minimo si accumula più in fretta di quanto ci si aspetti.
Costo delle GPU all’ora: H100, H200 e B200 a confronto
Oltre al fine-tuning a consumo per token, tutte le piattaforme offrono capacità GPU dedicata fatturata all’ora o al secondo, utile per chi fa training continuativo o serve traffico costante. Qui le cifre raccolte da fonti diverse non sono sempre identiche, segno che i prezzi GPU cambiano spesso e dipendono dal tipo di impegno (on demand contro riservato), ma l’ordine di grandezza è consistente tra le fonti.
| Piattaforma | H100 on demand | Modello di fatturazione | Fonte |
|---|---|---|---|
| Together AI | 3,99 $ – 5,49 $ /ora | Per ora, cluster self-serve | RunPod, Onrup |
| Fireworks AI | Variabile per tier | Per ora o serverless a token | Developers Digest |
| Replicate | 5,49 $ /ora | Per secondo, legato all’attività | RunPod |
| Modal | 3,95 $ /ora | Per secondo, con moltiplicatori | RunPod |
Le analisi più recenti di RunPod aggiungono un ulteriore livello di complessità: con GPU di nuova generazione come H200 e B200, i prezzi on demand salgono a circa 5,99 dollari l’ora per H200 e 8,19 dollari per B200, mentre chi si impegna su contratti a lungo termine può portare il costo di un H100 fino a circa 3,19 dollari l’ora. Questo significa che il confronto “prezzo per ora” cambia molto in base a quanto tempo si è disposti a impegnarsi con un singolo fornitore, e che inserire H200 o B200 nel calcolo può far lievitare il budget più della scelta della piattaforma in sé.
La differenza tra prezzo on demand e prezzo riservato conta più di quanto sembri a un primo sguardo. Chi fa un singolo ciclo di fine-tuning al mese su un dataset ridotto non ha alcun motivo di impegnarsi su un contratto a lungo termine: il prezzo on demand, pur più alto all’ora, resta comunque la scelta più economica perché evita di pagare per capacità inutilizzata nei giorni in cui non si fa training. Chi invece deve addestrare e riaddestrare un modello su base settimanale o giornaliera, magari per adattarlo continuamente a nuovi dati di prodotto, recupera il costo di un impegno riservato in poche settimane, perché il prezzo per ora scende in modo sensibile rispetto alla tariffa on demand. La scelta tra i due regimi, quindi, dipende dalla frequenza del workload più che dal provider scelto.
Benchmark di costo per l’inferenza: cosa dicono tre fonti indipendenti
Il fine-tuning è solo metà del conto. Una volta addestrato il modello, bisogna servirlo, e qui le piattaforme competono soprattutto sul prezzo per milione di token in produzione. CloudZero ha pubblicato un’analisi comparativa su più di 16 provider di inferenza, posizionando Together AI intorno a 1,04 dollari come benchmark di costo per outcome, un dato che la colloca nella fascia alta tra i provider di inferenza, non perché sia la più cara in assoluto ma perché quel prezzo compra profondità della piattaforma (catalogo, strumenti, fine-tuning integrato) piuttosto che il semplice prezzo più basso possibile.
Un secondo punto di vista arriva da Infrabase.ai, che ha confrontato 119 API di inferenza AI e, in una rilevazione datata 25 settembre 2026, ha riportato Together AI a 0,15 dollari di input e 0,60 dollari di output per milione di token su alcuni modelli serverless, una cifra decisamente più bassa di quella riportata da CloudZero. La discrepanza non è un errore: dipende dal modello specifico misurato, dal tipo di endpoint (serverless condiviso contro capacità dedicata) e dal momento della rilevazione, visto che questi prezzi vengono aggiornati con una certa frequenza.
Il terzo riferimento è la guida di RunPod sulle alternative a Together AI, che confronta otto piattaforme concorrenti includendo Modal, Replicate, Lambda, CoreWeave, Baseten e fal.ai, con tabelle di prezzo orario per GPU aggiornate al 18 agosto 2026. Mettendo insieme le tre fonti, il messaggio che emerge è coerente: non esiste un prezzo “vero” unico per ciascuna piattaforma, perché il costo finale dipende da modello, volume, tipo di endpoint e durata dell’impegno. Chi valuta solo il numero più basso trovato su un blog rischia di scegliere in base a un caso d’uso diverso dal proprio.
Modelli open source supportati dalle quattro piattaforme
La scelta della piattaforma dipende molto anche da quali famiglie di modelli open-weight si vogliono usare. Together AI e Fireworks AI aggiornano i propri cataloghi quasi in tempo reale quando esce un nuovo modello: entrambe hanno aggiunto rapidamente il supporto per famiglie come Qwen3.5, DeepSeek V4.1 Flash, GLM-5.3 e Kimi K3 nelle settimane successive al rilascio di ciascun modello. La guida di Hokai sul confronto Fireworks contro Together osserva che il prezzo di listino, ormai, non è più il fattore che distingue davvero le due piattaforme: quello che cambia è la rapidità di adozione dei nuovi modelli e il costo di cambiare fornitore una volta impostata una pipeline.
Replicate punta tutto sulla quantità: il suo catalogo pubblico contiene migliaia di modelli caricati dalla community, il che lo rende utile per provare rapidamente varianti diverse di uno stesso modello, ma meno indicato se si cerca una garanzia di qualità uniforme o un supporto enterprise formale su ogni singolo modello del catalogo. Modal, non avendo un catalogo proprio, lascia allo sviluppatore la responsabilità di scaricare i pesi del modello (tipicamente da Hugging Face) e di scriverne la pipeline di inferenza: più lavoro iniziale, ma zero vincoli sul modello scelto.
Un dato interessante arriva dalla guida di Developers Digest sui provider di accesso a Kimi K3: sia Fireworks AI sia Modal vengono riportati con lo stesso schema di prezzo per quel modello, 3 dollari per milione di token in input, 0,30 dollari per l’input in cache e 15 dollari in output, segno che per alcuni modelli di punta i prezzi tra provider concorrenti convergono quasi esattamente, lasciando che altri fattori (latenza, supporto, strumenti di fine-tuning) facciano la differenza reale.
Piattaforma intermedia o API diretta del creatore del modello?
Una domanda che molti team si pongono solo dopo aver già scelto Together AI, Fireworks AI o un concorrente è se non sarebbe più conveniente saltare l’intermediario e rivolgersi direttamente all’azienda che pubblica il modello. La risposta, dai dati raccolti, è che dipende dal modello e dal volume. Per GLM-5.3, ad esempio, l’API diretta di Z.ai (l’azienda dietro il modello) applica 1,40 dollari di input e 4,40 dollari di output per milione di token sulla versione completa, scendendo a 0,15 dollari di input e 0,50 dollari di output sulla variante Flash più leggera. Sono cifre pubblicate direttamente dal creatore del modello, senza passare da un marketplace di inferenza.
Confrontando questi numeri con quanto riportato da Infrabase.ai per Together AI su alcuni modelli serverless, 0,15 dollari di input e 0,60 dollari di output per milione di token, emerge che in certi casi la piattaforma intermedia riesce a essere competitiva o persino più economica della fonte diretta, grazie al volume aggregato che gestisce su più clienti e più modelli contemporaneamente. Per DeepSeek V4.1 Flash, un altro modello molto richiesto nelle ultime settimane, Together AI viene riportata a 0,30 dollari di input e 1,20 dollari di output per milione di token, un prezzo che si inserisce nella fascia media rispetto ad altri canali di accesso allo stesso modello.
Il vantaggio di passare da una piattaforma come Together AI, Fireworks AI o Modal, quindi, non è sempre e solo il prezzo per token. È la possibilità di gestire fine-tuning, inferenza e switch tra modelli diversi (open source o proprietari) con un’unica fatturazione e un’unica API, invece di dover integrare separatamente l’API di ogni singola azienda che pubblica un modello. Per un team che usa solo un modello e non ha bisogno di fine-tuning, l’API diretta del creatore resta spesso l’opzione più semplice. Per chi invece sperimenta con più famiglie di modelli open source contemporaneamente, il costo di gestire cinque integrazioni API diverse supera rapidamente il margine che si risparmierebbe evitando l’intermediario.
Cinque scenari reali: chi usa cosa e perché
Per capire davvero le differenze tra le piattaforme aiuta guardare a casi d’uso concreti, quelli che si vedono più spesso tra i team che lavorano con modelli open source in produzione.
- Startup fintech che personalizza un assistente clienti. Un team che parte da un modello Llama di dimensioni medie e deve fare fine-tuning su migliaia di conversazioni di supporto storiche sceglie spesso Together AI, perché la pipeline di SFT e DPO integrata evita di dover orchestrare manualmente training e deployment separati.
- SaaS enterprise con decine di varianti fine-tuned. Un’azienda che deve mantenere in produzione molte versioni personalizzate dello stesso modello base, una per ogni cliente enterprise, trova in Fireworks AI un vantaggio concreto: servire ogni variante fine-tuned allo stesso prezzo del modello base evita che i costi di hosting crescano linearmente con il numero di clienti.
- Team di ricerca universitario con budget limitato. Chi deve eseguire job di training brevi e irregolari, senza bisogno di infrastruttura sempre attiva, si orienta su Modal per la fatturazione al secondo e lo scaling automatico, evitando di pagare per capacità GPU inutilizzata tra un esperimento e l’altro.
- Agenzia creativa che prototipa rapidamente. Un piccolo studio che deve testare in poche ore dieci modelli diversi per un progetto cliente si appoggia a Replicate, sfruttando il catalogo pubblico e il deployment via container Cog per non dover configurare nulla da zero.
- Azienda multi-cloud che combina più provider. Diverse organizzazioni più mature, infine, non scelgono un solo fornitore: usano Together AI per il training iniziale, dove l’integrazione fine-tuning più inferenza riduce l’attrito, e Modal per gestire i picchi di traffico in inferenza con scaling serverless, mantenendo così sotto controllo sia i costi di addestramento sia quelli di picco.
Quando scegliere Together AI, Fireworks AI, Replicate o Modal
Mettendo insieme prezzi, specifiche tecniche e casi d’uso, emergono alcune indicazioni pratiche su quale piattaforma valutare in base alla situazione.
- Scegliete Together AI se avete bisogno di una pipeline unica che copra fine-tuning (SFT e DPO), hosting e inferenza senza integrare più fornitori, soprattutto se lavorate con modelli fino a 69 miliardi di parametri dove i prezzi LoRA restano contenuti.
- Scegliete Fireworks AI se dovete mantenere molte varianti fine-tuned in parallelo e il sovrapprezzo per servirle sarebbe un problema economico: qui il prezzo “fine-tuned uguale a base” è il vantaggio competitivo più concreto.
- Scegliete Replicate se la priorità è sperimentare velocemente con tanti modelli diversi, magari ancora prima di decidere quale fine-tunare, grazie al catalogo pubblico e al deployment standardizzato via Cog.
- Scegliete Modal se il vostro team ha competenze di infrastruttura solide e preferisce scrivere la propria pipeline in codice piuttosto che adattarsi alle convenzioni di un catalogo di modelli altrui, soprattutto per workload irregolari che beneficiano della fatturazione al secondo.
- Valutate un approccio multi-piattaforma se il volume di traffico in produzione varia molto nel tempo: usare un provider per il training e uno diverso per l’inferenza di picco spesso costa meno che forzare tutto su un unico fornitore pensato per un solo tipo di carico.
- Prestate attenzione all’addebito minimo per job se fate molti esperimenti di fine-tuning di piccole dimensioni: su alcune fasce di Together AI il minimo di 4 dollari per job può pesare più del costo per token su dataset piccoli.
Guida alla migrazione tra piattaforme di fine-tuning
Cambiare piattaforma dopo aver già impostato una pipeline di fine-tuning non è immediato, ma nemmeno impossibile se si seguono alcuni passaggi in ordine. Ecco il percorso che riduce il rischio di interrompere un servizio già in produzione.
- Esportate gli adapter LoRA (o i pesi completi, in caso di full fine-tuning) dalla piattaforma di origine in un formato standard, tipicamente compatibile con Hugging Face Transformers, prima di avviare qualsiasi migrazione.
- Verificate che il modello base usato per il fine-tuning sia disponibile anche sulla piattaforma di destinazione: se avete fatto fine-tuning di una variante specifica (per esempio una quantizzazione particolare), controllate che esista l’equivalente, altrimenti dovrete rifare il training da capo.
- Ricaricate il dataset di training originale sulla nuova piattaforma e lanciate un job di fine-tuning di prova su un sottoinsieme ridotto, per verificare che i costi stimati per token coincidano con quanto previsto nel nuovo listino prezzi.
- Confrontate l’output del nuovo modello fine-tuned con quello originale usando lo stesso set di prompt di validazione, perché differenze nell’implementazione di LoRA o nei default di training tra piattaforme possono produrre risultati leggermente diversi anche a partire dallo stesso dataset.
- Mantenete attivo il vecchio endpoint in parallelo al nuovo per un periodo di transizione, instradando una quota minima di traffico reale verso la nuova piattaforma prima di spegnere completamente quella precedente.
- Aggiornate la fatturazione e il monitoraggio dei costi non appena il traffico si sposta: i modelli di fatturazione differiscono (per token, per ora, per secondo), quindi i dashboard di costo configurati per la vecchia piattaforma vanno riadattati, non semplicemente duplicati.
Il punto più sottovalutato in questo processo è il terzo passaggio: molti team scoprono solo dopo aver lanciato il job di prova che il costo reale per il loro dataset specifico, con la sua distribuzione di lunghezza dei token, è diverso da quanto stimato guardando solo il prezzo di listino per milione di token.
Pro e contro di ciascuna piattaforma
Nessuna delle quattro piattaforme è priva di compromessi, e gran parte delle recensioni negative che si leggono online nasce da aspettative sbagliate più che da problemi reali del servizio: chi si aspetta un catalogo pronto da Modal, o un full fine-tuning nativo e maturo da Replicate, finisce deluso non perché la piattaforma sia scadente, ma perché non corrisponde al suo caso d’uso. Ecco un riepilogo dei principali vantaggi e limiti di ciascuna, utile per fare l’ultima verifica prima di impegnarsi.
- Together AI – Pro: pipeline integrata fine-tuning più inferenza, prezzi LoRA competitivi fino a 69 miliardi di parametri, catalogo aggiornato rapidamente sui nuovi modelli. Contro: addebito minimo di 4 dollari per job su alcune fasce, prezzo di inferenza riportato come relativamente alto da alcune analisi indipendenti come CloudZero.
- Fireworks AI – Pro: serving dei modelli fine-tuned allo stesso prezzo del modello base, prezzi LoRA quasi identici a Together AI nella fascia bassa. Contro: tariffe pubbliche meno dettagliate per la fascia di modelli più grandi, meno trasparenza sui costi minimi per job.
- Replicate – Pro: catalogo pubblico enorme, deployment standardizzato con Cog, ottimo per prototipazione. Contro: supporto limitato al full fine-tuning nativo, fatturazione legata al tempo di esecuzione che può diventare meno prevedibile su carichi costanti.
- Modal – Pro: massimo controllo infrastrutturale, fatturazione al secondo che evita sprechi su workload irregolari, nessun vincolo di catalogo. Contro: nessun modello pronto all’uso, richiede competenze di infrastruttura più solide per essere sfruttato davvero.
Cosa dicono i protagonisti del settore
Al di là dei listini prezzi, vale la pena ascoltare chi queste piattaforme le costruisce ogni giorno. Jamie de Guerre, Founding SVP Product di Together AI, ha spiegato in un’intervista al blog di Stack Overflow la logica dietro la nascita dell’azienda: “Together AI was really founded on the premise that in the future there wouldn’t really be one big model to rule them all” (Stack Overflow Blog), una visione che oggi si traduce in un catalogo con decine di famiglie di modelli invece di puntare su un unico modello dominante.
De Guerre ha aggiunto un’osservazione che spiega perché il mercato del fine-tuning open source sia cresciuto così in fretta: “And I think that we’re seeing that today, you know, in the last few months you’ve had a tremendous number of open-source models released that are by and large at the same level as the leading closed-source models” (Stack Overflow Blog). Secondo lui, inoltre, il valore dell’apertura va oltre il semplice risparmio economico: “One of the values of openness is really around research learning” (Stack Overflow Blog), un punto che spiega perché molte aziende scelgano l’open source anche quando il costo non sarebbe l’unico fattore decisivo.
We firmly believe in the power of open science and it will in the long run.
Lin Qiao, CEO e co-fondatrice di Fireworks AI, in un’intervista pubblicata da SuperDataScience
La posizione di Lin Qiao è coerente con la strategia prodotto di Fireworks AI: investire sul serving di modelli open-weight a condizioni di prezzo competitive invece di puntare solo su un modello proprietario chiuso. È una visione che, unita alla scelta di non far pagare di più i modelli fine-tuned rispetto a quelli base, aiuta a capire perché Fireworks AI sia diventata un riferimento per chi deve gestire molte varianti personalizzate in produzione.
Verdetto: quale piattaforma conviene davvero nel 2026
Se dovessimo riassumere il confronto in un solo numero, sarebbe questo: il full fine-tuning costa circa 2,5 volte il LoRA su Together AI, un moltiplicatore confermato sia da Onrup sia da HatchWorks, e rappresenta probabilmente il dato più utile per fare un preventivo rapido prima di lanciare un job di training su un dataset nuovo. Per i team che lavorano principalmente con LoRA su modelli fino a 16 miliardi di parametri, Together AI e Fireworks AI restano quasi indistinguibili sul prezzo, 0,48 contro 0,50 dollari per milione di token, quindi la scelta tra le due si decide su altri fattori: la gestione dei costi di serving per chi ha tante varianti (vantaggio Fireworks) o l’integrazione training più inferenza in un’unica pipeline (vantaggio Together AI).
Per chi invece deve prototipare rapidamente senza impegnarsi su un’infrastruttura dedicata, Replicate resta la scelta più pratica grazie al catalogo pubblico e al formato Cog. Modal, dall’altra parte dello spettro, conviene solo a chi ha le competenze per scrivere la propria pipeline serverless, ma in quel caso il risparmio sulla fatturazione al secondo per workload irregolari (circa 3,95 dollari l’ora per H100, il prezzo più basso tra i quattro nella rilevazione RunPod) può essere significativo nel tempo. Nessuna delle quattro piattaforme vince su tutti i fronti: la decisione corretta dipende dal volume di token da addestrare, dal numero di varianti fine-tuned da mantenere in produzione e dal livello di competenza infrastrutturale del team.
Un ultimo elemento da tenere a mente riguarda la velocità con cui queste piattaforme aggiornano i listini e i cataloghi. Nel 2026 l’uscita di un nuovo modello open-weight di punta, come è successo con Qwen3.5, GLM-5.3 o Kimi K3, porta quasi sempre a un adeguamento dei prezzi entro poche settimane su Together AI e Fireworks AI, mentre Replicate e Modal seguono tempi diversi perché il supporto dipende rispettivamente dalla community che carica il modello nel catalogo pubblico o dal team interno che scrive la pipeline personalizzata. Chi pianifica un progetto a lungo termine dovrebbe quindi rivedere questo confronto almeno ogni trimestre, non limitarsi a decidere una volta e dare per scontato che le condizioni resteranno identiche nei mesi successivi.
Domande frequenti
Qual è la differenza principale tra LoRA e full fine-tuning in termini di costo?
Il full fine-tuning aggiorna tutti i pesi del modello e costa indicativamente 2,5 volte la tariffa del LoRA fine-tuning su Together AI, secondo i dati raccolti da Onrup e HatchWorks. Il LoRA aggiorna solo un sottoinsieme ridotto di parametri, quindi richiede meno calcolo e costa meno, ma può offrire risultati leggermente inferiori su task molto specifici.
Together AI o Fireworks AI, quale costa meno per il fine-tuning?
Per modelli fino a 16 miliardi di parametri i prezzi sono quasi identici, 0,48 dollari contro 0,50 dollari per milione di token con LoRA. Nella fascia media (17-80 miliardi, a seconda della piattaforma) Fireworks AI risulta più caro, circa 3 dollari contro 1,50 dollari per milione di token su Together AI.
Replicate supporta il fine-tuning completo dei modelli?
Il supporto nativo al full fine-tuning è limitato: Replicate è pensata soprattutto per il deployment e l’hosting di modelli tramite container Cog, non come piattaforma di training principale. Chi deve fare fine-tuning esteso in genere lo esegue altrove e poi carica il risultato su Replicate per il serving.
Modal ha un catalogo di modelli open source pronti all’uso?
No. Modal è una piattaforma serverless e code-first: non offre un catalogo di modelli come Together AI, Fireworks AI o Replicate, quindi lo sviluppatore deve scaricare i pesi del modello scelto, tipicamente da Hugging Face, e scrivere la propria pipeline di inferenza o training.
Quanto costa affittare una GPU H100 su queste piattaforme?
Le cifre variano in base alla fonte e al tipo di impegno: Modal viene riportata a circa 3,95 dollari l’ora, Together AI tra 3,99 e 5,49 dollari l’ora a seconda del tipo di contratto, e Replicate a circa 5,49 dollari l’ora, secondo l’analisi di RunPod sulle alternative a Together AI.
Perché l’addebito minimo per job è importante da considerare?
Su alcune fasce di Together AI esiste un addebito minimo di 4 dollari per job di fine-tuning, indipendentemente dal volume reale di token del dataset. Per chi esegue molti test brevi e frequenti, questo minimo può far salire il costo complessivo più di quanto suggerisca il prezzo per token pubblicato in homepage.
Conviene usare più piattaforme insieme per lo stesso progetto?
Sì, è una pratica comune tra i team più maturi: usare una piattaforma per il training (dove l’integrazione fine-tuning più inferenza riduce l’attrito) e un’altra per gestire i picchi di traffico in produzione (dove la fatturazione al secondo di Modal evita sprechi) spesso costa meno che forzare tutto il carico su un unico fornitore pensato per un solo tipo di workload.
I prezzi riportati in questo articolo sono definitivi?
No, vanno considerati come prezzi verificati a ottobre 2026. I listini di queste piattaforme cambiano con una certa frequenza, soprattutto quando escono nuove generazioni di GPU o nuove famiglie di modelli open source, quindi è sempre consigliabile controllare la pagina prezzi ufficiale del provider scelto prima di impegnarsi su un budget.
Meglio affidarsi a una piattaforma come Together AI o all’API diretta del creatore del modello?
Dipende dal numero di modelli che si usa e dalla necessità di fine-tuning. Per un solo modello già pronto, senza bisogno di personalizzazione, l’API diretta del creatore (per esempio Z.ai per GLM-5.3) è spesso più semplice da integrare. Per chi lavora con più famiglie di modelli open source e ha bisogno di fine-tuning, fatturazione unificata e switch rapido tra modelli diversi, una piattaforma come Together AI o Fireworks AI riduce il lavoro di integrazione, anche quando il prezzo per token non è il più basso in assoluto sul mercato.




