Cuánta memoria necesita una LLM local: RAM, VRAM y contexto
Neaptide · 20 de septiembre de 2026 · 8 min de lectura
Calcula la memoria de una LLM local: pesos, cuantización, caché KV, RAM y VRAM, con fórmulas y un método de medición.
En este artículo

El tamaño del archivo del modelo no equivale a toda la memoria necesaria. El contexto, los datos intermedios y el motor también ocupan espacio. Por eso, «un modelo de 8 GB cabe en cualquier memoria de 8 GB» es una mala base para elegir ordenador.
Define primero el modelo y su cuantización, la longitud de contexto necesaria y el número de peticiones simultáneas. Sin eso, la pregunta sobre cuánta RAM necesita una IA resulta demasiado general.
Qué ocupa memoria
| Componente | De qué depende |
|---|---|
| Pesos del modelo | Número de parámetros y formato |
| Caché KV | Arquitectura, contexto, precisión y número de secuencias |
| Búferes de trabajo | Motor y parámetros de ejecución |
| Otras aplicaciones | Sistema, editor, navegador y procesos en segundo plano |
La caché KV conserva datos intermedios de atención para no recalcularlos por completo con cada token generado. Su estrategia afecta al uso de memoria. Explicación de Hugging Face.
En la práctica, el mismo modelo puede necesitar bastante más memoria con un contexto largo que con uno corto.
Estimar la memoria de los pesos
Como primera aproximación:
bytes de pesos ≈ número de parámetros × bits por parámetro / 8Esta tabla es un cálculo para modelos hipotéticos, no una medición de archivos concretos ni requisitos de hardware. Utiliza GB decimales: mil millones de bytes. B representa mil millones de parámetros.
| Parámetros | 16 bits | 8 bits | 4 bits |
|---|---|---|---|
| 3B | 6 GB | 3 GB | 1.5 GB |
| 7B | 14 GB | 7 GB | 3.5 GB |
| 14B | 28 GB | 14 GB | 7 GB |
| 32B | 64 GB | 32 GB | 16 GB |
Los formatos reales incluyen metadatos y pueden usar distintas precisiones para diferentes partes del modelo. La tabla orienta sobre la magnitud, pero no sustituye la ficha del archivo ni una prueba.
Para convertir bytes a GiB, divide entre 1 073 741 824. No mezcles GB y GiB al comparar tamaños.
Diferencia entre RAM y VRAM
La RAM es memoria del sistema; la VRAM pertenece a la GPU dedicada. La ubicación del modelo depende del hardware y del motor. En sistemas de memoria unificada, CPU y GPU comparten un recurso que también necesita el sistema operativo.
No basta con sumar 16 GB de RAM y 8 GB de VRAM para obtener el equivalente universal de una tarjeta de 24 GB. El reparto del trabajo y el coste de transferir datos dependen de la configuración.
En Ollama, `ollama ps` muestra cómo se reparte el modelo entre CPU y GPU. Interpretar el resultado.
Cómo influye el contexto
Para una caché KV completa convencional, la aproximación es:
bytes de caché ≈ 2 × capas × cabezas KV × dimensión de cabeza
× tokens × bytes por elemento × secuenciasEl factor 2 corresponde a claves y valores. Es una simplificación para las arquitecturas pertinentes, no una calculadora universal. La atención deslizante, la compresión y otras implementaciones cambian el cálculo. Estrategias de caché.
Compara configuraciones con el mismo contexto configurado. Si una recibe una función corta y otra un repositorio completo, la diferencia de memoria por sí sola demuestra poco.
Ollama permite cambiar la longitud de contexto; aumentarla requiere memoria adicional. Comprueba el contexto y la distribución con `ollama ps`. Configurar el contexto.
Comprobar tu ordenador
Registra modelo, etiqueta exacta, cuantización, motor y versión. Ejecuta la misma tarea con una entrada corta y otra más larga. Anota:
- Contexto configurado y peticiones simultáneas.
- Memoria ocupada antes y durante la ejecución.
- Distribución entre CPU y GPU.
- Tiempo hasta la primera respuesta y duración total.
- Calidad según criterios definidos previamente.
Repite la ejecución para separar la carga del modelo del funcionamiento estable. Si falta memoria, reduce primero un parámetro, sin cambiarlo todo a la vez.
Qué probar con 16 o 32 GB
No existe una lista garantizada independiente del hardware. Con memoria limitada, empieza por un modelo cuantizado pequeño y una tarea corta, como en la guía de Ollama. Reserva espacio para el sistema y las aplicaciones.
Si el modelo carga pero resulta demasiado lento, revisa su distribución y el contexto. Poder cargarlo no significa que sea práctico para trabajar a diario.