课程 333 / 365
91%
开源模型与本地部署·理解·10 分钟
正文已完成

参数量只描述模型尺寸的一部分

区分参数、精度、上下文缓存和运行开销,避免用一个 B 数字估算全部资源。

L333

“7B 模型需要多少内存”没有唯一答案。权重占用取决于存储精度与量化格式,长上下文还会增加 KV cache,推理框架和临时缓冲也占资源。参数量是起点,不是最终硬件结论。

这一课的结果

能解释参数量、权重精度与上下文长度如何分别影响本地运行资源。

核心概念

先把关键判断说清楚

01

参数量近似权重规模

在同一架构和精度下,参数更多通常需要更多权重存储与计算,但不能直接代表质量。

02

每参数位数改变体积

16-bit、8-bit、4-bit 等表示会显著改变权重占用,同时可能引入额外元数据和质量差异。

03

上下文缓存随序列增长

输入和已生成 Token 增加时,KV cache 与运行内存上升,能加载权重不代表能运行目标上下文。

案例拆解

模型能加载却在长文档时崩溃

一台机器成功加载量化模型,短问题正常,但输入长文档后内存不足。

  1. 01

    分开记录权重文件、模型加载后基础内存和不同上下文的峰值。

  2. 02

    用目标的1k、4k、16k Token 样本逐级测量,不直接跑最大值。

  3. 03

    根据峰值减少上下文、选择更低占用格式或调整卸载,而不是只看参数量。

案例结果

容量估算从“模型能否加载”升级为“目标上下文能否稳定运行”。

提交前练习

现在轮到你

为一个候选模型列出完整资源组成,而不只写参数量。

内容会自动保存在当前设备
查看参考答案与评分标准

参考答案

候选8B、Q4格式约5GB;目标4k输入+1k输出;另计KV cache、运行时和30%系统余量;用1k/4k/8k上下文测加载后内存、峰值、首Token与吞吐。

评分标准

  • 参数与格式同时记录
  • 上下文目标对应真实任务
  • 测量包含峰值和安全余量

本课收口 · 学习证据

完成,不等于随手打一个勾。

确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。

0 / 3
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
模型权重已成功加载,为什么长上下文仍可能内存不足?
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。

资料来源

继续核对与延伸阅读

本课内容最近更新于