跳到正文
Neaptide工作室
博客

本地大模型需要多少内存:RAM、显存与上下文

Neaptide · 2026年9月20日 · 8 分钟阅读

估算本地大模型内存:权重、量化、KV 缓存、RAM 与显存,附公式、容量表和电脑测试步骤。

本文目录
同一内存托盘中的权重块、可扩展上下文与工作空间。

模型文件大小不等于运行时所需的全部内存。除了权重,上下文、中间数据和运行环境也会占用空间。因此,不能根据“8 GB 模型能装进任意 8 GB 内存”来选电脑。

先明确三个条件:具体模型及量化方式、所需上下文长度、同时处理多少个请求。缺少这些条件,“AI 需要多少内存”就过于笼统。

哪些部分占用内存

组成部分
组成部分主要影响因素
模型权重参数数量与存储格式
KV 缓存架构、上下文、缓存精度与序列数量
工作缓冲区推理引擎与启动设置
其他应用操作系统、编辑器、浏览器及后台进程

KV 缓存保留注意力计算的中间数据,避免生成每个新 token 时都从头计算。缓存策略会影响内存用量。Hugging Face 说明。

实际取舍很直接:同一个模型使用长上下文时,可能比短上下文需要明显更多的内存。

粗略估算权重占用

初步估算公式:

权重字节数 ≈ 参数数量 × 每参数位数 / 8

下表只是对假设模型的算术计算,不是具体文件的实测结果,也不是电脑配置要求。GB 采用十进制,即十亿字节;B 表示十亿个参数。

参数规模
参数规模16 位8 位4 位
3B6 GB3 GB1.5 GB
7B14 GB7 GB3.5 GB
14B28 GB14 GB7 GB
32B64 GB32 GB16 GB

真实量化格式包含元数据,不同模型部分也可能使用不同精度。表格只能说明数量级,不能替代具体文件的说明和实际试运行。

将字节换算成 GiB,要除以 1,073,741,824。比较大小时不要混用 GB 与 GiB。

RAM 与显存有什么区别

RAM 是系统内存,VRAM 是独立 GPU 的显存。模型放在哪里,取决于硬件和引擎。在统一内存系统中,CPU 和 GPU 共享同一资源,操作系统也需要使用它。

不能直接把 16 GB RAM 与 8 GB 显存相加,就视为在所有场景下等同于一张 24 GB 显卡。能否拆分执行,以及数据传输成本,取决于具体组合。

Ollama 的 `ollama ps` 可以显示已加载模型在 CPU 与 GPU 之间的分配。如何理解输出。

上下文如何影响内存

对于常规的完整 KV 缓存,可以粗略计算:

缓存字节数 ≈ 2 × 层数 × KV 头数 × 头维度
             × token 数 × 每元素字节数 × 序列数

系数 2 对应键和值。这是适用于相应架构的简化模型,不是所有 LLM 通用的计算器。滑动注意力、压缩等实现会改变计算方式。缓存策略。

比较两种配置时,应设置相同的上下文。如果一个模型只接收短函数,另一个却接收整个仓库,仅凭内存差异无法得出有用结论。

Ollama 可以调整上下文长度,增加长度需要更多内存。用 `ollama ps` 查看当前分配与上下文。上下文设置。

怎样测试自己的电脑

记录模型、准确标签、量化方式、引擎及版本。用短输入和较长输入执行同一项任务,保存:

  1. 配置的上下文长度与并发请求数。
  2. 启动前及运行中的内存占用。
  3. CPU/GPU 分配情况。
  4. 首次响应等待时间与总耗时。
  5. 按预先设定条件检查的结果质量。

重复运行,区分模型加载与稳定运行阶段。如果内存不足,先只减少一个参数,不要同时更换模型、上下文和所有设置。

16 GB 或 32 GB 可以尝试什么

脱离硬件条件,没有一份“保证能运行”的固定清单。内存有限时,从小型量化模型和短任务开始,例如 Ollama 入门指南中的示例,并为系统和应用留出余量。

如果模型能加载却慢得影响使用,检查运行位置和上下文。成功加载并不等于配置适合日常工作。

常见问题

要点速览

精度越低越好吗?

省内存只是一个因素。应比较实际任务的质量;额外的人工修正可能抵消资源节省。

是否应该始终开启最大上下文?

按实际工作量选择。简短请求并不要求把上下文设到最大。

什么时候购买新硬件?

先在必要任务中记录具体限制,并尝试更紧凑的方案。购买应解决已观察到的问题,而不是追求抽象的参数数量。