Aller au contenu
Neaptidestudio
blog

Quelle mémoire pour une LLM locale ? RAM, VRAM et contexte

Neaptide · 20 septembre 2026 · 8 min de lecture

Estimez la mémoire d'une LLM locale : poids, quantification, cache KV, RAM et VRAM, avec formules et méthode de mesure.

Dans cet article
Poids, contexte extensible et espace de travail dans un plateau mémoire.

La taille du fichier d'un modèle n'est pas sa consommation totale de mémoire. Le contexte, les données intermédiaires et le moteur d'exécution occupent aussi de la place. Affirmer qu'un modèle de 8 Go tient dans n'importe quelle mémoire de 8 Go ne suffit donc pas pour choisir un ordinateur.

Précisez d'abord le modèle et sa quantification, la longueur de contexte nécessaire et le nombre de requêtes simultanées. Sans ces éléments, la question de la RAM reste trop générale.

Ce qui occupe la mémoire

Élément
ÉlémentPrincipaux facteurs
Poids du modèleNombre de paramètres et format
Cache KVArchitecture, contexte, précision du cache et nombre de séquences
Buffers de travailMoteur et paramètres de lancement
Autres applicationsSystème, éditeur, navigateur et processus en arrière-plan

Le cache KV conserve des données intermédiaires d'attention pour éviter de tout recalculer à chaque nouveau token. Sa stratégie influence la consommation de mémoire. Explication de Hugging Face.

En pratique, un même modèle peut demander nettement plus de mémoire avec un contexte long qu'avec un contexte court.

Estimer la mémoire des poids

Une première approximation :

octets des poids ≈ nombre de paramètres × bits par paramètre / 8

Le tableau ci-dessous est un calcul pour des modèles hypothétiques. Ce ne sont ni des mesures de fichiers réels ni des exigences matérielles. Les GB sont décimaux : un milliard d'octets. B désigne un milliard de paramètres.

Paramètres
Paramètres16 bits8 bits4 bits
3B6 GB3 GB1.5 GB
7B14 GB7 GB3.5 GB
14B28 GB14 GB7 GB
32B64 GB32 GB16 GB

Les formats réels de quantification contiennent des métadonnées et peuvent employer des précisions différentes selon les composants. Le tableau donne un ordre de grandeur ; consultez aussi la fiche du fichier et faites un essai.

Pour convertir des octets en GiB, divisez par 1 073 741 824. Ne confondez pas GB et GiB dans les comparaisons.

RAM et VRAM : la différence

La RAM est la mémoire système ; la VRAM appartient au GPU dédié. Le placement dépend du matériel et du moteur. Avec une mémoire unifiée, CPU et GPU partagent une ressource dont le système d'exploitation a également besoin.

On ne peut pas additionner 16 Go de RAM et 8 Go de VRAM pour en faire un équivalent universel d'une carte graphique de 24 Go. La répartition du travail et le coût des transferts dépendent de la configuration.

Dans Ollama, `ollama ps` affiche le placement du modèle entre CPU et GPU. Lire le résultat.

L'effet du contexte

Pour un cache KV complet classique, l'estimation est :

octets du cache ≈ 2 × couches × têtes KV × dimension d'une tête
                  × tokens × octets par élément × séquences

Le facteur 2 représente les clés et les valeurs. Cette approximation convient aux architectures concernées, pas à toutes les LLM. L'attention glissante, la compression et d'autres implémentations modifient le calcul. Stratégies de cache.

Comparez les configurations avec le même contexte paramétré. Donner une petite fonction à l'une et tout un dépôt à l'autre rend la différence de mémoire peu concluante.

Ollama permet de régler le contexte ; l'augmenter nécessite davantage de mémoire. Vérifiez le placement et le contexte actuels avec `ollama ps`. Configuration du contexte.

Tester votre ordinateur

Notez le modèle, son tag exact, la quantification, le moteur et sa version. Exécutez la même tâche avec une entrée courte, puis plus longue. Consignez :

  1. Le contexte configuré et les requêtes simultanées.
  2. La mémoire occupée avant et pendant l'exécution.
  3. Le placement CPU/GPU.
  4. Le délai avant la première réponse et la durée totale.
  5. La qualité selon des critères définis à l'avance.

Répétez l'essai pour distinguer le chargement du fonctionnement établi. En cas de manque de mémoire, réduisez un paramètre à la fois.

Que tenter avec 16 ou 32 Go ?

Il n'existe pas de liste garantie indépendamment du matériel. Commencez par un petit modèle quantifié et une tâche courte, comme dans le guide Ollama. Gardez une marge pour le système et les applications.

Si le modèle se charge mais reste trop lent, examinez le placement et le contexte. Un chargement réussi ne garantit pas un usage quotidien confortable.

faq

L'essentiel en bref

Une précision plus faible est-elle toujours préférable ?

L'économie de mémoire n'est qu'un critère. Comparez la qualité : les corrections manuelles supplémentaires peuvent annuler le gain de ressources.

Faut-il toujours activer le contexte maximal ?

Adaptez-le au travail réel. Une demande courte ne nécessite pas automatiquement le réglage maximal.

Quand acheter du matériel ?

Après avoir mesuré une limite sur les tâches utiles et essayé des options plus compactes. L'achat doit résoudre un problème observé, pas répondre à un nombre abstrait de paramètres.