4 min di lettura
Vuoi un LLM enorme che gira sul tuo hardware? Ecco quanto costa davvero
Per anni la risposta alla domanda “posso far girare un modello grande a casa mia?” era sempre la stessa: “non conviene”. Troppa VRAM necessaria, troppo costosa, troppo specializzata. Poi il mercato delle GPU consumer ha cambiato passo, i modelli open-weight hanno fatto passi enormi, e a luglio 2026 James O’Beirne ha pubblicato su GitHub quella che probabilmente è la guida hardware più completa mai scritta per chi vuole fare sul serio con i modelli linguistici locali.
La guida confronta due scenari reali agli antipodi: una build “entry level” da circa $2.000 e una build estrema da $46.000 con quattro schede video professionali. Il gap sembra abissale, ma entrambe sono documentate con specifiche precise e benchmark reali. Non teoria: numeri concreti da chi ha montato e testato i sistemi. In un mercato dove i modelli locali di qualità si moltiplicano ogni trimestre, per chi ha esigenze professionali di privacy, latenza zero, o vuole smettere di dipendere da abbonamenti cloud che cambiano pricing ogni sei mesi, il self-hosting è diventato un’opzione concreta.
Il concetto da tenere in testa è uno solo: i modelli linguistici grandi hanno bisogno di VRAM per girare fluidamente. La VRAM è la memoria delle schede video, e l’intera rete neurale del modello deve starci dentro tutta intera. Se non ci sta, il modello rallenta in modo catastrofico oppure si appoggia alla RAM di sistema, che per questo tipo di carico è circa dieci volte più lenta. La VRAM è il collo di bottiglia assoluto, e tutto il resto del sistema si costruisce attorno a questa variabile.
“Un punto di riferimento essenziale per i professionisti del self-hosting.”
Guida di James O’Beirne su GitHub, luglio 2026
Cosa ottieni a ogni fascia di budget
La build base da $2.000 è progettata per far girare Qwen 3.6-27B su singola GPU. Un modello da 27 miliardi di parametri che nella fascia open-weight è già molto capace per writing complesso, analisi, sintesi di documenti e coding. Velocità di risposta utilizzabile nel lavoro quotidiano senza frustrazioni.
La build estrema da $46.000 monta quattro schede NVIDIA RTX PRO 6000 Blackwell in configurazione parallela, per un totale di 384 GB di VRAM. Su questa macchina gira GLM-5.2-Int8Mix (594B), un modello da 594 miliardi di parametri, a 80 token al secondo con una finestra di contesto da 240.000 token. In pratica: puoi dargli in input un romanzo intero e lui ci ragiona su tutto, in una sola sessione.
I numeri chiave della guida
- $2.000 per far girare un modello da 27 miliardi di parametri su GPU singola
- $46.000 per scalare a 594 miliardi di parametri su quattro GPU in parallelo
- 384 GB di VRAM totali nella build estrema (come avere un server mid-range in salotto)
- 80 token/secondo la velocità del modello più grande, ben sopra la velocità di lettura umana
- 240.000 token di context window: circa 180.000 parole, o 600 pagine di documento, in un colpo solo
Un caso concreto
Pensa a un workflow creativo intensivo: hai 200 pagine di brief clienti, feedback di casting, note di produzione, reference di stile, email con l’agenzia. Con 240.000 token di contesto puoi caricare tutto in una sola sessione e chiedere al modello di ragionare sull’intero corpus. Confrontare brief diversi, trovare contraddizioni, proporre soluzioni coerenti con lo storico.
Tutto questo senza cloud. Nessun dato che esce dalla tua rete locale. I tuoi clienti, i tuoi brief, i tuoi processi rimangono tuoi, su hardware che controlli fisicamente. Per chi lavora con dati sensibili o clienti con clausole di riservatezza rigide, questa non è comodità: è una necessità concreta.
“La guida copre l’intero spettro, dalla build accessibile per il professionista autonomo fino alla configurazione da laboratorio con quattro GPU Blackwell in parallelo.”
James O’Beirne, README della guida su GitHub
Tre cose che mi porto via
- Il self-hosting di LLM seri è diventato tecnicamente fattibile anche senza budget enterprise, ma richiede un investimento deliberato e documentato.
- La fascia da $2.000 è già interessante per professionisti che vogliono indipendenza dal cloud per dati sensibili, workflow ripetitivi, o semplicemente autonomia operativa completa.
- La build da $46.000 non è per tutti, ma fissa il benchmark attuale: sapere cosa è possibile aiuta a capire dove si trova il tuo setup rispetto alla frontiera.
Comprare un obiettivo professionale richiede prima di capire cosa ti manca con quello che hai. Questa guida fa la stessa cosa per l’hardware AI: ti dà le coordinate precise per sapere dove sei e dove potresti arrivare. Vale la pena tenerla come riferimento fisso, anche se oggi non hai intenzione di spendere un centesimo.
Fonte: Guida di James O’Beirne su GitHub
✍️ Articolo firmato da “La Redazione”: sistema editoriale multi-agente (AI) orchestrato con Claude Code e supervisionato da Luca Cazzaniga · lucacazzaniga.it
Creatività Aumentata
Analisi di approfondimento direttamente nella tua casella di posta.