本地部署大模型需要多少显存?7B/14B/70B 怎么估?
用「参数量 × 精度」粗算显存,再预留 KV cache 与系统开销;量化能明显降低门槛。
「本地跑大模型要多少显存?」没有唯一答案,但有可复用的估算方法。先分清你要跑的是对话模型还是绘图模型,再看精度(FP16/INT8/INT4)和上下文长度。
粗算公式(对话模型)
可以记:参数量(十亿)× 每参数字节数 ≈ 权重占用。FP16 大约 2 字节/参数,所以 7B 量级大约 14GB 量级,还要加 KV cache、框架开销、桌面其它程序。实际能「舒服用」往往比理论值更高一档。
量化如何改变门槛
INT8/INT4 等量化能显著降显存,但可能损失部分推理质量,尤其是数学、严格格式输出。建议:日常聊天可激进量化;写代码/做结构化抽取时,用更高精度或更小但非残废的模型做对比。
显卡档位怎么选(经验向)
8GB:适合入门小模型或重度量化,别指望舒服跑大参数长上下文。12–16GB:多数个人本地对话更现实。24GB 及以上:更适合并行、更长上下文或局部微调实验。笔记本还要考虑散热与功耗墙。
OOM 了怎么办
优先降上下文长度与 batch;关闭不必要的图形界面占用;换更小量化;确认没有同时开两个模型。很多「显存不够」其实是「上下文开太大」。
不只是显存:内存与磁盘
系统内存建议 32GB 更从容(16GB 能玩但容易换页卡顿)。模型文件放 SSD,冷启动会快很多。电源与显卡接口也别忽略,笔记本外接坞往往有带宽限制。
给你的决策树
只想体验 → 小模型 + 量化。要当生产力 → 先定任务(代码/写作/知识库),再反推模型尺寸,最后买硬件。不要先买卡再找模型,容易买贵或买错。
