直接答案
RTX 4090 的 24GB 显存适合运行经过量化的中小规模模型,但能否装下不能只看参数量。权重精度、KV Cache、上下文长度、并发数和推理框架都会占用显存,大模型通常需要 CPU 或多卡卸载。
先记住这四点
- 预留 KV Cache 和运行时开销
- 量化越激进越需验证质量
- 长上下文会明显增加显存
- 生产并发不能按单请求显存估算
显存预算包含什么
模型权重只是第一部分。还要为 KV Cache、计算缓冲区、框架开销和输入上下文留出空间。刚好能加载不代表能够稳定生成,建议保留安全余量并用真实最长请求做压力测试。
量化与卸载怎么选
较低位宽量化能显著降低权重占用,但不同任务的质量损失不一致。若模型超出单卡容量,可以使用 CPU 内存卸载或多卡切分,不过延迟会受 PCIe、内存带宽和框架实现影响。
常见问题
24GB 显存等于能加载 24GB 权重吗?
不是。运行时还需要额外空间,权重占满显存通常会导致生成失败或性能不稳定。
本地运行一定比 API 便宜吗?
不一定。还要计算硬件折旧、电费、运维时间和实际利用率,低频业务常常更适合 API。