课程 337 / 365
92%
正文已完成
L337量化损失要在关键任务上找,不要只看平均分
判断事实保持、格式遵循、长上下文和边界样本中的量化风险。
量化损失可能只集中在少数敏感能力上。总体分数下降很小,也可能在数字、代码、低频语言或长上下文中出现不可接受错误;评测应按任务风险分层。
能为量化模型设计针对关键失败的质量比较,而非只看总体平均。
核心概念
先把关键判断说清楚
基线必须是同一基础模型
比较量化影响时,应让未量化或高精度版本、提示和生成参数一致。
关键失败单独计数
JSON无效、数字改写和引用丢失不能被其他简单样本的高分抵消。
量化选择可按场景路由
低风险摘要可用更小格式,高风险抽取保留更高精度或人工复核,不必一档覆盖全部。
案例拆解
平均相近但财务数字错误上升
Q4与Q8摘要总分只差1%,但Q4在20条财务文本中多次改动小数点。
- 01
把数字保持设为硬门槛,与语言流畅度分开评分。
- 02
复查相同基础模型、提示和随机参数,确认错误可重复。
- 03
普通内部摘要使用Q4,含金额任务路由Q8并保留数字自动比对。
案例结果
选型不再被平均分掩盖,资源节省只用于风险可接受的场景。
提交前练习
现在轮到你
为高精度与量化版本设计分层质量比较。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
同一模型Q8对Q4,固定温度0和提示;100条分普通/长文/数字/Schema;数字准确与JSON有效率必须100%;Q4仅用于普通摘要,抽取走Q8,失败转人工。
评分标准
- 对照只改变量化条件
- 关键类别单独报告
- 采用范围对应实测风险
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- Transformers Quantization Overview↗official-docs · 核对日期 2026-08-23
- Evals↗official-docs · 核对日期 2026-08-23