课程 336 / 365
92%
开源模型与本地部署·理解·10 分钟
正文已完成

量化是在精度、体积与速度之间重新编码

理解低位表示如何压缩权重,以及校准、格式与运行后端为何影响结果。

L336

量化把原本较高精度的数值映射到更少位数的表示,以减少权重体积和内存带宽。它不是简单压缩包是量化方法、位宽、分组、校准数据和运行后端都会影响质量与速度。

这一课的结果

能解释量化降低资源占用的原理边界,并指出需要实测的变量。

核心概念

先把关键判断说清楚

01

位宽降低存储需求

每个权重使用更少位通常能减少文件和内存占用,但还存在缩放因子等元数据。

02

误差分布并不均匀

不同层和任务对精度敏感度不同,同样4-bit格式在不同模型上损失可能不同。

03

后端支持决定实际收益

硬件和推理框架是否有优化内核,决定更小格式能否加快运行,内存节省只是其中一项收益。

案例拆解

16-bit模型装不下,4-bit版本可运行

团队的目标模型在设备上无法完整加载,准备直接采用任意4-bit文件。

  1. 01

    核对量化方法、文件来源、基础模型版本与哈希,排除错版。

  2. 02

    先验证权重占用和目标上下文峰值,再运行质量样本。

  3. 03

    记录后端是否原生支持该格式,比较首Token和吞吐,而不是假设更小一定更快。

案例结果

量化选择同时通过身份、容量、质量和速度验证。

提交前练习

现在轮到你

为一个量化候选写出从文件身份到运行验证的检查单。

内容会自动保存在当前设备
查看参考答案与评分标准

参考答案

基础模型v2、Q4_K_M、SHA256已记录;测文件5GB、加载6.2GB、8k上下文峰值9GB;用数学、中文抽取和长文事实30条;在目标llama.cpp版本测TTFT与tokens/s。

评分标准

  • 量化文件可精确复现
  • 容量包含上下文峰值
  • 质量与速度都在目标后端实测

本课收口 · 学习证据

完成,不等于随手打一个勾。

确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。

0 / 3
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
为什么不能仅凭“4-bit”标签判断量化质量?
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。

资料来源

继续核对与延伸阅读

本课内容最近更新于