Quelle mémoire pour une LLM locale ? RAM, VRAM et contexte
Neaptide · 20 septembre 2026 · 8 min de lecture
Estimez la mémoire d'une LLM locale : poids, quantification, cache KV, RAM et VRAM, avec formules et méthode de mesure.
Dans cet article

La taille du fichier d'un modèle n'est pas sa consommation totale de mémoire. Le contexte, les données intermédiaires et le moteur d'exécution occupent aussi de la place. Affirmer qu'un modèle de 8 Go tient dans n'importe quelle mémoire de 8 Go ne suffit donc pas pour choisir un ordinateur.
Précisez d'abord le modèle et sa quantification, la longueur de contexte nécessaire et le nombre de requêtes simultanées. Sans ces éléments, la question de la RAM reste trop générale.
Ce qui occupe la mémoire
| Élément | Principaux facteurs |
|---|---|
| Poids du modèle | Nombre de paramètres et format |
| Cache KV | Architecture, contexte, précision du cache et nombre de séquences |
| Buffers de travail | Moteur et paramètres de lancement |
| Autres applications | Système, éditeur, navigateur et processus en arrière-plan |
Le cache KV conserve des données intermédiaires d'attention pour éviter de tout recalculer à chaque nouveau token. Sa stratégie influence la consommation de mémoire. Explication de Hugging Face.
En pratique, un même modèle peut demander nettement plus de mémoire avec un contexte long qu'avec un contexte court.
Estimer la mémoire des poids
Une première approximation :
octets des poids ≈ nombre de paramètres × bits par paramètre / 8Le tableau ci-dessous est un calcul pour des modèles hypothétiques. Ce ne sont ni des mesures de fichiers réels ni des exigences matérielles. Les GB sont décimaux : un milliard d'octets. B désigne un milliard de paramètres.
| Paramètres | 16 bits | 8 bits | 4 bits |
|---|---|---|---|
| 3B | 6 GB | 3 GB | 1.5 GB |
| 7B | 14 GB | 7 GB | 3.5 GB |
| 14B | 28 GB | 14 GB | 7 GB |
| 32B | 64 GB | 32 GB | 16 GB |
Les formats réels de quantification contiennent des métadonnées et peuvent employer des précisions différentes selon les composants. Le tableau donne un ordre de grandeur ; consultez aussi la fiche du fichier et faites un essai.
Pour convertir des octets en GiB, divisez par 1 073 741 824. Ne confondez pas GB et GiB dans les comparaisons.
RAM et VRAM : la différence
La RAM est la mémoire système ; la VRAM appartient au GPU dédié. Le placement dépend du matériel et du moteur. Avec une mémoire unifiée, CPU et GPU partagent une ressource dont le système d'exploitation a également besoin.
On ne peut pas additionner 16 Go de RAM et 8 Go de VRAM pour en faire un équivalent universel d'une carte graphique de 24 Go. La répartition du travail et le coût des transferts dépendent de la configuration.
Dans Ollama, `ollama ps` affiche le placement du modèle entre CPU et GPU. Lire le résultat.
L'effet du contexte
Pour un cache KV complet classique, l'estimation est :
octets du cache ≈ 2 × couches × têtes KV × dimension d'une tête
× tokens × octets par élément × séquencesLe facteur 2 représente les clés et les valeurs. Cette approximation convient aux architectures concernées, pas à toutes les LLM. L'attention glissante, la compression et d'autres implémentations modifient le calcul. Stratégies de cache.
Comparez les configurations avec le même contexte paramétré. Donner une petite fonction à l'une et tout un dépôt à l'autre rend la différence de mémoire peu concluante.
Ollama permet de régler le contexte ; l'augmenter nécessite davantage de mémoire. Vérifiez le placement et le contexte actuels avec `ollama ps`. Configuration du contexte.
Tester votre ordinateur
Notez le modèle, son tag exact, la quantification, le moteur et sa version. Exécutez la même tâche avec une entrée courte, puis plus longue. Consignez :
- Le contexte configuré et les requêtes simultanées.
- La mémoire occupée avant et pendant l'exécution.
- Le placement CPU/GPU.
- Le délai avant la première réponse et la durée totale.
- La qualité selon des critères définis à l'avance.
Répétez l'essai pour distinguer le chargement du fonctionnement établi. En cas de manque de mémoire, réduisez un paramètre à la fois.
Que tenter avec 16 ou 32 Go ?
Il n'existe pas de liste garantie indépendamment du matériel. Commencez par un petit modèle quantifié et une tâche courte, comme dans le guide Ollama. Gardez une marge pour le système et les applications.
Si le modèle se charge mais reste trop lent, examinez le placement et le contexte. Un chargement réussi ne garantit pas un usage quotidien confortable.