课程 338 / 365
93%
正文已完成
L338交付一份量化格式选择报告
把容量、质量、速度、能耗和兼容性合成可复查的量化决策。
量化选型应同时回答“装得下、答得对、跑得快、后端支持、出了问题能回退”。本课用一张统一表比较至少三种格式,并把结论绑定到具体设备和任务。
能用同机实验选择目标量化格式,并记录不适用范围与回退方案。
核心概念
先把关键判断说清楚
先淘汰不兼容格式
目标后端无法稳定加载或缺少优化内核的格式,无需仅凭理论体积进入最终候选。
容量要留运行余量
峰值恰好占满设备会导致系统抖动,应为操作系统、上下文增长和并发预留空间。
结论注明适用环境
同一格式在GPU、CPU或不同芯片上表现可能不同,报告不能泛化为全平台最佳。
案例拆解
Q4、Q5、Q8三档本地选型
团队在同一设备比较三档模型,希望兼顾中文质量、8k上下文和每秒输出。
- 01
固定模型哈希、框架版本和50条任务,分别记录加载、峰值、TTFT、吞吐与功耗。
- 02
以数字准确100%、中文rubric≥4/5和峰值不超设备70%作为门槛。
- 03
Q5通过全部门槛且速度可接受,Q4用于低风险批量,Q8保留回归基线。
案例结果
最终采用三档分工,每一档都有明确职责。
提交前练习
现在轮到你
为三种量化格式完成一份同机比较设计。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
候选Q4/Q5/Q8同一模型;测100条任务、1k/8k上下文和并发1/2;数字与Schema100%、峰值≤70%统一内存;Q5主选、Q4离线草稿、Q8回归基线,代码生成不用Q4。
评分标准
- 候选文件与环境可复现
- 测量覆盖质量和系统指标
- 结论含场景边界与回退
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- Transformers Quantization Overview↗official-docs · 核对日期 2026-08-23
- llama.cpp↗official-docs · 核对日期 2026-08-23
- Evals↗official-docs · 核对日期 2026-08-23