Quanta memoria serve per una LLM locale: RAM, VRAM e contesto
Neaptide · 20 settembre 2026 · 8 min di lettura
Stima la memoria di una LLM locale: pesi, quantizzazione, cache KV, RAM e VRAM, con formule e metodo di misura.
In questo articolo

Le dimensioni del file del modello non coincidono con tutta la memoria necessaria. Anche contesto, dati intermedi e motore occupano spazio. Affermare che un modello da 8 GB entra in qualsiasi memoria da 8 GB non basta quindi per scegliere un computer.
Definisci prima modello e quantizzazione, lunghezza del contesto richiesta e numero di richieste simultanee. Senza questi dati, la domanda sulla RAM necessaria resta troppo generica.
Che cosa occupa memoria
| Componente | Da che cosa dipende |
|---|---|
| Pesi del modello | Numero di parametri e formato |
| Cache KV | Architettura, contesto, precisione e numero di sequenze |
| Buffer di lavoro | Motore e parametri di avvio |
| Altre applicazioni | Sistema, editor, browser e processi in background |
La cache KV conserva dati intermedi dell'attenzione per evitare di ricalcolarli tutti a ogni token generato. La strategia scelta influisce sulla memoria. Spiegazione di Hugging Face.
In pratica, lo stesso modello può richiedere molta più memoria con un contesto lungo rispetto a uno breve.
Stimare la memoria dei pesi
Una prima approssimazione:
byte dei pesi ≈ numero di parametri × bit per parametro / 8La tabella è un calcolo per modelli ipotetici, non una misurazione di file reali né un requisito hardware. Usa GB decimali: un miliardo di byte. B indica un miliardo di parametri.
| Parametri | 16 bit | 8 bit | 4 bit |
|---|---|---|---|
| 3B | 6 GB | 3 GB | 1.5 GB |
| 7B | 14 GB | 7 GB | 3.5 GB |
| 14B | 28 GB | 14 GB | 7 GB |
| 32B | 64 GB | 32 GB | 16 GB |
I formati reali includono metadati e possono usare precisioni diverse per componenti differenti. La tabella indica l'ordine di grandezza, ma non sostituisce la scheda del file e una prova pratica.
Per convertire byte in GiB, dividi per 1 073 741 824. Non confondere GB e GiB nei confronti.
Differenza tra RAM e VRAM
La RAM è memoria di sistema; la VRAM appartiene alla GPU dedicata. Il posizionamento dipende da hardware e motore. Nei sistemi con memoria unificata, CPU e GPU condividono una risorsa che serve anche al sistema operativo.
Non puoi sommare 16 GB di RAM e 8 GB di VRAM e considerarli sempre equivalenti a una scheda video da 24 GB. Suddivisione del lavoro e costi di trasferimento dipendono dalla configurazione.
In Ollama, `ollama ps` mostra la distribuzione del modello tra CPU e GPU. Interpretare il risultato.
L'effetto del contesto
Per una normale cache KV completa, la stima è:
byte della cache ≈ 2 × livelli × teste KV × dimensione della testa
× token × byte per elemento × sequenzeIl fattore 2 rappresenta chiavi e valori. È una semplificazione per le architetture appropriate, non un calcolatore universale. Attenzione scorrevole, compressione e altre implementazioni cambiano il calcolo. Strategie di cache.
Confronta configurazioni con lo stesso contesto impostato. Se una riceve una funzione breve e l'altra un intero repository, la differenza di memoria da sola dice poco.
Ollama permette di cambiare la lunghezza del contesto; aumentarla richiede memoria aggiuntiva. Controlla distribuzione e contesto con `ollama ps`. Configurazione del contesto.
Verificare il proprio computer
Annota modello, tag esatto, quantizzazione, motore e versione. Esegui lo stesso compito con un input breve e uno più lungo. Registra:
- Contesto configurato e richieste simultanee.
- Memoria occupata prima e durante l'esecuzione.
- Distribuzione CPU/GPU.
- Tempo alla prima risposta e durata totale.
- Qualità rispetto a condizioni definite in anticipo.
Ripeti la prova per distinguere il caricamento dal funzionamento a regime. Se la memoria finisce, riduci prima un solo parametro senza cambiare tutto insieme.
Che cosa provare con 16 o 32 GB
Non esiste un elenco garantito indipendente dall'hardware. Con poca memoria, parti da un piccolo modello quantizzato e un compito breve, come nella guida Ollama. Lascia spazio a sistema e applicazioni.
Se il modello si carica ma è troppo lento, controlla distribuzione e contesto. Il caricamento riuscito non basta a rendere una configurazione adatta al lavoro quotidiano.