课程 337 / 365
92%
开源模型与本地部署·判断·13 分钟
正文已完成

量化损失要在关键任务上找,不要只看平均分

判断事实保持、格式遵循、长上下文和边界样本中的量化风险。

L337

量化损失可能只集中在少数敏感能力上。总体分数下降很小,也可能在数字、代码、低频语言或长上下文中出现不可接受错误;评测应按任务风险分层。

这一课的结果

能为量化模型设计针对关键失败的质量比较,而非只看总体平均。

核心概念

先把关键判断说清楚

01

基线必须是同一基础模型

比较量化影响时,应让未量化或高精度版本、提示和生成参数一致。

02

关键失败单独计数

JSON无效、数字改写和引用丢失不能被其他简单样本的高分抵消。

03

量化选择可按场景路由

低风险摘要可用更小格式,高风险抽取保留更高精度或人工复核,不必一档覆盖全部。

案例拆解

平均相近但财务数字错误上升

Q4与Q8摘要总分只差1%,但Q4在20条财务文本中多次改动小数点。

  1. 01

    把数字保持设为硬门槛,与语言流畅度分开评分。

  2. 02

    复查相同基础模型、提示和随机参数,确认错误可重复。

  3. 03

    普通内部摘要使用Q4,含金额任务路由Q8并保留数字自动比对。

案例结果

选型不再被平均分掩盖,资源节省只用于风险可接受的场景。

提交前练习

现在轮到你

为高精度与量化版本设计分层质量比较。

内容会自动保存在当前设备
查看参考答案与评分标准

参考答案

同一模型Q8对Q4,固定温度0和提示;100条分普通/长文/数字/Schema;数字准确与JSON有效率必须100%;Q4仅用于普通摘要,抽取走Q8,失败转人工。

评分标准

  • 对照只改变量化条件
  • 关键类别单独报告
  • 采用范围对应实测风险

本课收口 · 学习证据

完成,不等于随手打一个勾。

确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。

0 / 3
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
评估量化损失时,最合理的基线是什么?
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。

资料来源

继续核对与延伸阅读

本课内容最近更新于