课程 338 / 365
93%
开源模型与本地部署·练习·18 分钟
正文已完成

交付一份量化格式选择报告

把容量、质量、速度、能耗和兼容性合成可复查的量化决策。

L338

量化选型应同时回答“装得下、答得对、跑得快、后端支持、出了问题能回退”。本课用一张统一表比较至少三种格式,并把结论绑定到具体设备和任务。

这一课的结果

能用同机实验选择目标量化格式,并记录不适用范围与回退方案。

核心概念

先把关键判断说清楚

01

先淘汰不兼容格式

目标后端无法稳定加载或缺少优化内核的格式,无需仅凭理论体积进入最终候选。

02

容量要留运行余量

峰值恰好占满设备会导致系统抖动,应为操作系统、上下文增长和并发预留空间。

03

结论注明适用环境

同一格式在GPU、CPU或不同芯片上表现可能不同,报告不能泛化为全平台最佳。

案例拆解

Q4、Q5、Q8三档本地选型

团队在同一设备比较三档模型,希望兼顾中文质量、8k上下文和每秒输出。

  1. 01

    固定模型哈希、框架版本和50条任务,分别记录加载、峰值、TTFT、吞吐与功耗。

  2. 02

    以数字准确100%、中文rubric≥4/5和峰值不超设备70%作为门槛。

  3. 03

    Q5通过全部门槛且速度可接受,Q4用于低风险批量,Q8保留回归基线。

案例结果

最终采用三档分工,每一档都有明确职责。

提交前练习

现在轮到你

为三种量化格式完成一份同机比较设计。

内容会自动保存在当前设备
查看参考答案与评分标准

参考答案

候选Q4/Q5/Q8同一模型;测100条任务、1k/8k上下文和并发1/2;数字与Schema100%、峰值≤70%统一内存;Q5主选、Q4离线草稿、Q8回归基线,代码生成不用Q4。

评分标准

  • 候选文件与环境可复现
  • 测量覆盖质量和系统指标
  • 结论含场景边界与回退

本课收口 · 学习证据

完成,不等于随手打一个勾。

确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。

0 / 3
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
为什么量化选型要给设备内存留安全余量?
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。

资料来源

继续核对与延伸阅读

本课内容最近更新于