没人谈内存:本地跑大模型的后悔都是内存问题
来源:dev.to — 2026-09-19
📋 概述
本地大模型的讨论都在比 GPU、显存和显卡型号,作者认为真正决定模型能不能跑起来的是内存。他在 Ryzen 加 32 GB 内存加 RTX 3060(12 GB 显存)的机器上拉取 llama3.1:8b 实测:下载页标称 4.9 GB,实际预留了 7.0 GB、占用 7963 MiB 显存。按底层实现的公式,总内存等于权重加 KV cache 加计算缓冲,只有第一项是常数,后两项随上下文长度和批大小增长。
🔑 核心要点
- 标称 4.9 GB 的模型在 32000 token 上下文下实际预留 7.0 GB,等于 43% 的上下文税。
- 显存占用达到 7963 MiB 中的 12288 MiB,留给其他程序的余量比想象中少得多。
- 内存公式是 权重加 KV cache 加计算缓冲,只有权重恒定,KV cache 随上下文长度线性增长。
- 量化不是信仰而是算术:Q4 存在的意义就是让内存算术落在硬件预算之内。
💡 金句
显存卖的是梦想,内存决定模型到底能不能启动,以及启动之后还能留住多少上下文。
👍 0
👎 0
← 返回 dev.to 首页