课程 333 / 365
91%
正文已完成
L333参数量只描述模型尺寸的一部分
区分参数、精度、上下文缓存和运行开销,避免用一个 B 数字估算全部资源。
“7B 模型需要多少内存”没有唯一答案。权重占用取决于存储精度与量化格式,长上下文还会增加 KV cache,推理框架和临时缓冲也占资源。参数量是起点,不是最终硬件结论。
能解释参数量、权重精度与上下文长度如何分别影响本地运行资源。
核心概念
先把关键判断说清楚
参数量近似权重规模
在同一架构和精度下,参数更多通常需要更多权重存储与计算,但不能直接代表质量。
每参数位数改变体积
16-bit、8-bit、4-bit 等表示会显著改变权重占用,同时可能引入额外元数据和质量差异。
上下文缓存随序列增长
输入和已生成 Token 增加时,KV cache 与运行内存上升,能加载权重不代表能运行目标上下文。
案例拆解
模型能加载却在长文档时崩溃
一台机器成功加载量化模型,短问题正常,但输入长文档后内存不足。
- 01
分开记录权重文件、模型加载后基础内存和不同上下文的峰值。
- 02
用目标的1k、4k、16k Token 样本逐级测量,不直接跑最大值。
- 03
根据峰值减少上下文、选择更低占用格式或调整卸载,而不是只看参数量。
案例结果
容量估算从“模型能否加载”升级为“目标上下文能否稳定运行”。
提交前练习
现在轮到你
为一个候选模型列出完整资源组成,而不只写参数量。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
候选8B、Q4格式约5GB;目标4k输入+1k输出;另计KV cache、运行时和30%系统余量;用1k/4k/8k上下文测加载后内存、峰值、首Token与吞吐。
评分标准
- 参数与格式同时记录
- 上下文目标对应真实任务
- 测量包含峰值和安全余量
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- Transformers Quantization Overview↗official-docs · 核对日期 2026-08-23
- llama.cpp↗official-docs · 核对日期 2026-08-23
- Attention Is All You Need↗paper · 核对日期 2026-08-23