课程 339 / 365
93%
正文已完成
L339显存、统一内存和磁盘承担不同职责
区分模型文件存储、运行中权重、上下文缓存和系统余量,建立硬件容量直觉。
模型文件保存在磁盘上,推理时权重与缓存必须进入可供计算设备访问的内存。独立GPU使用显存,统一内存架构由CPU与GPU共享池;无论哪种,都要与系统和其他进程争用容量。
能解释磁盘能放下模型为何不代表内存能运行模型。
核心概念
先把关键判断说清楚
磁盘解决持久存储
文件能下载只证明存储空间足够,加载仍需要运行内存和支持的计算后端。
显存或统一内存承载工作集
权重、KV cache和临时张量组成运行工作集,峰值而非文件大小决定稳定性。
带宽影响吞吐
本地推理经常受内存带宽影响;容量相同的设备也可能有明显速度差异。
案例拆解
40GB磁盘空间救不了16GB运行内存
用户看到模型文件只有12GB且磁盘剩余40GB,认为16GB设备一定能运行长上下文。
- 01
区分12GB文件与加载后的权重、缓存、框架和系统占用。
- 02
关闭无关进程后测基础可用内存,再用目标上下文逐级加载。
- 03
若峰值超安全余量,选择更小量化、缩短上下文或分层卸载,并重新测速度。
案例结果
容量判断基于运行峰值,而不是把磁盘剩余误当成显存。
提交前练习
现在轮到你
为一台设备画出本地推理的四层资源预算。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
磁盘预留模型文件2倍空间用于下载与回滚;运行内存含5GB权重、3GB上下文缓存、1GB框架;系统至少保留8GB;在目标后端测首Token和tokens/s。
评分标准
- 磁盘与运行内存没有混淆
- 预算包含上下文和系统余量
- 容量之外还验证计算速度
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- llama.cpp↗official-docs · 核对日期 2026-08-23
- Transformers Quantization Overview↗official-docs · 核对日期 2026-08-23