课程 334 / 365
92%
开源模型与本地部署·判断·13 分钟
正文已完成

模型更大不等于任务更合适

从质量门槛、延迟、并发、成本和可部署性判断模型尺寸。

L334

更大模型可能在某些复杂任务上表现更好,也通常需要更多资源、等待和运营成本。选型应先设任务通过门槛,再在通过者中比较延迟、吞吐、隐私和部署约束。

这一课的结果

能用业务样本比较不同尺寸模型,而不是默认选择参数最多者。

核心概念

先把关键判断说清楚

01

先设最低质量门槛

没有达到事实、格式或安全要求的模型不能仅因更快而入选。

02

平均分会掩盖关键失败

应单列高风险样本、长输入和中文边界,不让简单题高分抵消关键任务失败。

03

并发决定真实容量

单请求速度不错不代表多人可用;应在目标并发下测队列等待和资源饱和。

案例拆解

客服分类选择较小模型

团队比较8B与更大模型,后者平均准确率高2个百分点,但延迟和内存显著增加。

  1. 01

    用200条脱敏工单设关键类别召回≥95%、格式通过率100%的门槛。

  2. 02

    两模型都通过关键门槛,差异集中在低风险模糊类别。

  3. 03

    在目标并发8下,小模型p95更低且可单机运行,因此入选,模糊样本转人工。

案例结果

选择基于任务门槛与系统容量,不把更大当作自动更好。

提交前练习

现在轮到你

为两个不同尺寸模型写同口径选型条件。

内容会自动保存在当前设备
查看参考答案与评分标准

参考答案

任务是合同字段抽取;关键字段召回≥98%、JSON 100%有效;并发4下p95≤8秒、内存≤24GB;要求离线升级可回滚;选满足门槛的最小模型,不确定条款标人工复核。

评分标准

  • 质量门槛先于性能比较
  • 测试使用目标并发
  • 选择包含失败兜底

本课收口 · 学习证据

完成,不等于随手打一个勾。

确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。

0 / 3
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
两个模型都通过关键质量门槛后,下一步最合理的比较是什么?
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。

资料来源

继续核对与延伸阅读

本课内容最近更新于