Перейти к контенту
Neaptidestudio
блог

Сколько памяти нужно для локальной LLM: RAM, VRAM и контекст

Neaptide · 20 сентября 2026 г. · 8 мин чтения

Оценка памяти локальной LLM: веса, квантование, KV-кэш, RAM и VRAM. Формулы, таблица размеров и порядок проверки компьютера.

В этой статье
Блоки весов, расширяющийся контекст и рабочий запас в одном лотке памяти.

Размер файла модели не равен памяти, необходимой для работы. Помимо весов, место занимают контекст, промежуточные данные и сама среда выполнения. Поэтому обещание «модель на 8 ГБ поместится в любые 8 ГБ памяти» — плохая основа для выбора компьютера.

Начните с трёх условий: конкретная модель и квантование, длина нужного контекста и число одновременных запросов. Без них ответ «сколько RAM нужно для нейросети» остаётся слишком общим.

Что занимает память

Составляющая
СоставляющаяОт чего зависит
Веса моделиЧисло параметров и формат хранения
KV-кэшАрхитектура, контекст, точность кэша, число последовательностей
Рабочие буферыРеализация движка и параметры запуска
Другие приложенияСистема, редактор, браузер и фоновые процессы

KV-кэш сохраняет промежуточные данные внимания, чтобы не пересчитывать их целиком при генерации каждого следующего токена. Его стратегия влияет на использование памяти. Объяснение Hugging Face.

Для пользователя это означает простой компромисс: та же модель с длинным контекстом может потребовать заметно больше памяти, чем с коротким.

Грубая оценка памяти весов

Для первого приближения используйте формулу:

байты весов ≈ число параметров × бит на параметр / 8

Ниже — арифметический пример для условных моделей. Это не измерения конкретных файлов и не требования к компьютеру. Используются десятичные GB: миллиард байт.

Параметры
Параметры16 бит8 бит4 бита
3 млрд6 GB3 GB1,5 GB
7 млрд14 GB7 GB3,5 GB
14 млрд28 GB14 GB7 GB
32 млрд64 GB32 GB16 GB

Реальные форматы квантования содержат служебные данные и могут хранить разные части модели с разной точностью. Поэтому таблица помогает понять порядок величин, но не заменяет карточку конкретного файла и пробный запуск.

Для перевода байтов в GiB разделите их на 1 073 741 824. Не смешивайте GB и GiB при сравнении размеров.

Чем RAM отличается от VRAM

RAM — системная память, VRAM — память дискретного графического процессора. Размещение модели зависит от оборудования и движка. В системах с общей памятью CPU и GPU используют общий ресурс, из которого место требуется и операционной системе.

Нельзя просто сложить, например, 16 ГБ RAM и 8 ГБ VRAM и считать результат универсальным эквивалентом видеокарты на 24 ГБ. Возможность разделить работу и цена передачи данных зависят от конкретной связки.

В Ollama команда `ollama ps` показывает размещение загруженной модели между CPU и GPU. Как читать этот результат.

Как влияет контекст

Для обычного полного KV-кэша грубая оценка имеет вид:

байты кэша ≈ 2 × слои × KV-головы × размер головы
             × токены × байты элемента × последовательности

Коэффициент 2 учитывает ключи и значения. Формула — упрощённая модель для соответствующей архитектуры, а не универсальный калькулятор всех LLM. Скользящее внимание, сжатие и другие реализации меняют расчёт. Стратегии кэширования.

Поэтому сравнивайте две конфигурации при одинаковом заданном контексте. Если одной модели вы дали короткую функцию, а другой — весь репозиторий, разница в потреблении памяти сама по себе ничего не доказывает.

Ollama позволяет менять длину контекста; увеличение требует дополнительной памяти. Текущее распределение и контекст проверяйте через `ollama ps`. Настройка контекста.

Как проверить свой компьютер

Запишите модель, точный тег, квантование, движок и его версию. Затем выполните одну и ту же задачу с коротким и более длинным входом. Сохраните:

  1. Заданный контекст и число одновременных запросов.
  2. Занятую память до запуска и во время работы.
  3. Размещение модели на CPU/GPU.
  4. Время до первого ответа и общую длительность.
  5. Качество результата по заранее известным условиям.

Повторите запуск, чтобы отделить загрузку модели от устойчивого режима. Если память закончилась, уменьшайте сначала один параметр, а не меняйте одновременно модель, контекст и все настройки.

Что пробовать на 16 или 32 ГБ

Фиксированного списка «гарантированно работает» без учёта оборудования нет. На ограниченной памяти начните с небольшой квантованной модели и короткой задачи, как в инструкции Ollama. Оставьте запас для системы и приложений.

Если модель запускается, но работает неудобно медленно, проверьте размещение и контекст. Успешная загрузка ещё не означает, что конфигурация годится для вашего рабочего дня.

частые вопросы

Коротко о главном

Чем ниже точность, тем лучше?

Меньше памяти — только одна сторона выбора. Сравните качество на своей задаче: дополнительное ручное исправление может перевесить экономию ресурсов.

Максимальный контекст нужно включать всегда?

Выбирайте его под реальный объём работы. Для короткого запроса нет смысла считать максимальную настройку обязательным условием.

Когда покупать новое оборудование?

Когда зафиксировали ограничение на нужных задачах и проверили более компактные варианты. Покупка должна решать наблюдаемую проблему, а не соответствовать абстрактному числу параметров.