Сколько памяти нужно для локальной LLM: RAM, VRAM и контекст
Neaptide · 20 сентября 2026 г. · 8 мин чтения
Оценка памяти локальной LLM: веса, квантование, KV-кэш, RAM и VRAM. Формулы, таблица размеров и порядок проверки компьютера.
В этой статье

Размер файла модели не равен памяти, необходимой для работы. Помимо весов, место занимают контекст, промежуточные данные и сама среда выполнения. Поэтому обещание «модель на 8 ГБ поместится в любые 8 ГБ памяти» — плохая основа для выбора компьютера.
Начните с трёх условий: конкретная модель и квантование, длина нужного контекста и число одновременных запросов. Без них ответ «сколько RAM нужно для нейросети» остаётся слишком общим.
Что занимает память
| Составляющая | От чего зависит |
|---|---|
| Веса модели | Число параметров и формат хранения |
| KV-кэш | Архитектура, контекст, точность кэша, число последовательностей |
| Рабочие буферы | Реализация движка и параметры запуска |
| Другие приложения | Система, редактор, браузер и фоновые процессы |
KV-кэш сохраняет промежуточные данные внимания, чтобы не пересчитывать их целиком при генерации каждого следующего токена. Его стратегия влияет на использование памяти. Объяснение Hugging Face.
Для пользователя это означает простой компромисс: та же модель с длинным контекстом может потребовать заметно больше памяти, чем с коротким.
Грубая оценка памяти весов
Для первого приближения используйте формулу:
байты весов ≈ число параметров × бит на параметр / 8Ниже — арифметический пример для условных моделей. Это не измерения конкретных файлов и не требования к компьютеру. Используются десятичные GB: миллиард байт.
| Параметры | 16 бит | 8 бит | 4 бита |
|---|---|---|---|
| 3 млрд | 6 GB | 3 GB | 1,5 GB |
| 7 млрд | 14 GB | 7 GB | 3,5 GB |
| 14 млрд | 28 GB | 14 GB | 7 GB |
| 32 млрд | 64 GB | 32 GB | 16 GB |
Реальные форматы квантования содержат служебные данные и могут хранить разные части модели с разной точностью. Поэтому таблица помогает понять порядок величин, но не заменяет карточку конкретного файла и пробный запуск.
Для перевода байтов в GiB разделите их на 1 073 741 824. Не смешивайте GB и GiB при сравнении размеров.
Чем RAM отличается от VRAM
RAM — системная память, VRAM — память дискретного графического процессора. Размещение модели зависит от оборудования и движка. В системах с общей памятью CPU и GPU используют общий ресурс, из которого место требуется и операционной системе.
Нельзя просто сложить, например, 16 ГБ RAM и 8 ГБ VRAM и считать результат универсальным эквивалентом видеокарты на 24 ГБ. Возможность разделить работу и цена передачи данных зависят от конкретной связки.
В Ollama команда `ollama ps` показывает размещение загруженной модели между CPU и GPU. Как читать этот результат.
Как влияет контекст
Для обычного полного KV-кэша грубая оценка имеет вид:
байты кэша ≈ 2 × слои × KV-головы × размер головы
× токены × байты элемента × последовательностиКоэффициент 2 учитывает ключи и значения. Формула — упрощённая модель для соответствующей архитектуры, а не универсальный калькулятор всех LLM. Скользящее внимание, сжатие и другие реализации меняют расчёт. Стратегии кэширования.
Поэтому сравнивайте две конфигурации при одинаковом заданном контексте. Если одной модели вы дали короткую функцию, а другой — весь репозиторий, разница в потреблении памяти сама по себе ничего не доказывает.
Ollama позволяет менять длину контекста; увеличение требует дополнительной памяти. Текущее распределение и контекст проверяйте через `ollama ps`. Настройка контекста.
Как проверить свой компьютер
Запишите модель, точный тег, квантование, движок и его версию. Затем выполните одну и ту же задачу с коротким и более длинным входом. Сохраните:
- Заданный контекст и число одновременных запросов.
- Занятую память до запуска и во время работы.
- Размещение модели на CPU/GPU.
- Время до первого ответа и общую длительность.
- Качество результата по заранее известным условиям.
Повторите запуск, чтобы отделить загрузку модели от устойчивого режима. Если память закончилась, уменьшайте сначала один параметр, а не меняйте одновременно модель, контекст и все настройки.
Что пробовать на 16 или 32 ГБ
Фиксированного списка «гарантированно работает» без учёта оборудования нет. На ограниченной памяти начните с небольшой квантованной модели и короткой задачи, как в инструкции Ollama. Оставьте запас для системы и приложений.
Если модель запускается, но работает неудобно медленно, проверьте размещение и контекст. Успешная загрузка ещё не означает, что конфигурация годится для вашего рабочего дня.