Salta al contenuto
Neaptidestudio
blog

Quanta memoria serve per una LLM locale: RAM, VRAM e contesto

Neaptide · 20 settembre 2026 · 8 min di lettura

Stima la memoria di una LLM locale: pesi, quantizzazione, cache KV, RAM e VRAM, con formule e metodo di misura.

In questo articolo
Pesi, contesto espandibile e spazio operativo in un vassoio di memoria.

Le dimensioni del file del modello non coincidono con tutta la memoria necessaria. Anche contesto, dati intermedi e motore occupano spazio. Affermare che un modello da 8 GB entra in qualsiasi memoria da 8 GB non basta quindi per scegliere un computer.

Definisci prima modello e quantizzazione, lunghezza del contesto richiesta e numero di richieste simultanee. Senza questi dati, la domanda sulla RAM necessaria resta troppo generica.

Che cosa occupa memoria

Componente
ComponenteDa che cosa dipende
Pesi del modelloNumero di parametri e formato
Cache KVArchitettura, contesto, precisione e numero di sequenze
Buffer di lavoroMotore e parametri di avvio
Altre applicazioniSistema, editor, browser e processi in background

La cache KV conserva dati intermedi dell'attenzione per evitare di ricalcolarli tutti a ogni token generato. La strategia scelta influisce sulla memoria. Spiegazione di Hugging Face.

In pratica, lo stesso modello può richiedere molta più memoria con un contesto lungo rispetto a uno breve.

Stimare la memoria dei pesi

Una prima approssimazione:

byte dei pesi ≈ numero di parametri × bit per parametro / 8

La tabella è un calcolo per modelli ipotetici, non una misurazione di file reali né un requisito hardware. Usa GB decimali: un miliardo di byte. B indica un miliardo di parametri.

Parametri
Parametri16 bit8 bit4 bit
3B6 GB3 GB1.5 GB
7B14 GB7 GB3.5 GB
14B28 GB14 GB7 GB
32B64 GB32 GB16 GB

I formati reali includono metadati e possono usare precisioni diverse per componenti differenti. La tabella indica l'ordine di grandezza, ma non sostituisce la scheda del file e una prova pratica.

Per convertire byte in GiB, dividi per 1 073 741 824. Non confondere GB e GiB nei confronti.

Differenza tra RAM e VRAM

La RAM è memoria di sistema; la VRAM appartiene alla GPU dedicata. Il posizionamento dipende da hardware e motore. Nei sistemi con memoria unificata, CPU e GPU condividono una risorsa che serve anche al sistema operativo.

Non puoi sommare 16 GB di RAM e 8 GB di VRAM e considerarli sempre equivalenti a una scheda video da 24 GB. Suddivisione del lavoro e costi di trasferimento dipendono dalla configurazione.

In Ollama, `ollama ps` mostra la distribuzione del modello tra CPU e GPU. Interpretare il risultato.

L'effetto del contesto

Per una normale cache KV completa, la stima è:

byte della cache ≈ 2 × livelli × teste KV × dimensione della testa
                   × token × byte per elemento × sequenze

Il fattore 2 rappresenta chiavi e valori. È una semplificazione per le architetture appropriate, non un calcolatore universale. Attenzione scorrevole, compressione e altre implementazioni cambiano il calcolo. Strategie di cache.

Confronta configurazioni con lo stesso contesto impostato. Se una riceve una funzione breve e l'altra un intero repository, la differenza di memoria da sola dice poco.

Ollama permette di cambiare la lunghezza del contesto; aumentarla richiede memoria aggiuntiva. Controlla distribuzione e contesto con `ollama ps`. Configurazione del contesto.

Verificare il proprio computer

Annota modello, tag esatto, quantizzazione, motore e versione. Esegui lo stesso compito con un input breve e uno più lungo. Registra:

  1. Contesto configurato e richieste simultanee.
  2. Memoria occupata prima e durante l'esecuzione.
  3. Distribuzione CPU/GPU.
  4. Tempo alla prima risposta e durata totale.
  5. Qualità rispetto a condizioni definite in anticipo.

Ripeti la prova per distinguere il caricamento dal funzionamento a regime. Se la memoria finisce, riduci prima un solo parametro senza cambiare tutto insieme.

Che cosa provare con 16 o 32 GB

Non esiste un elenco garantito indipendente dall'hardware. Con poca memoria, parti da un piccolo modello quantizzato e un compito breve, come nella guida Ollama. Lascia spazio a sistema e applicazioni.

Se il modello si carica ma è troppo lento, controlla distribuzione e contesto. Il caricamento riuscito non basta a rendere una configurazione adatta al lavoro quotidiano.

faq

L'essenziale in breve

Una precisione inferiore è sempre migliore?

Il risparmio di memoria è soltanto un criterio. Confronta la qualità: più correzioni manuali possono annullare il vantaggio di risorse.

Va attivato sempre il contesto massimo?

Sceglilo in base al lavoro reale. Una richiesta breve non rende obbligatoria l'impostazione massima.

Quando acquistare nuovo hardware?

Dopo aver misurato un limite sui compiti necessari e provato alternative più compatte. L'acquisto deve risolvere un problema osservato, non inseguire un numero astratto di parametri.