课程 334 / 365
92%
正文已完成
L334模型更大不等于任务更合适
从质量门槛、延迟、并发、成本和可部署性判断模型尺寸。
更大模型可能在某些复杂任务上表现更好,也通常需要更多资源、等待和运营成本。选型应先设任务通过门槛,再在通过者中比较延迟、吞吐、隐私和部署约束。
能用业务样本比较不同尺寸模型,而不是默认选择参数最多者。
核心概念
先把关键判断说清楚
先设最低质量门槛
没有达到事实、格式或安全要求的模型不能仅因更快而入选。
平均分会掩盖关键失败
应单列高风险样本、长输入和中文边界,不让简单题高分抵消关键任务失败。
并发决定真实容量
单请求速度不错不代表多人可用;应在目标并发下测队列等待和资源饱和。
案例拆解
客服分类选择较小模型
团队比较8B与更大模型,后者平均准确率高2个百分点,但延迟和内存显著增加。
- 01
用200条脱敏工单设关键类别召回≥95%、格式通过率100%的门槛。
- 02
两模型都通过关键门槛,差异集中在低风险模糊类别。
- 03
在目标并发8下,小模型p95更低且可单机运行,因此入选,模糊样本转人工。
案例结果
选择基于任务门槛与系统容量,不把更大当作自动更好。
提交前练习
现在轮到你
为两个不同尺寸模型写同口径选型条件。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
任务是合同字段抽取;关键字段召回≥98%、JSON 100%有效;并发4下p95≤8秒、内存≤24GB;要求离线升级可回滚;选满足门槛的最小模型,不确定条款标人工复核。
评分标准
- 质量门槛先于性能比较
- 测试使用目标并发
- 选择包含失败兜底
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- Evals↗official-docs · 核对日期 2026-08-23
- Transformers Quantization Overview↗official-docs · 核对日期 2026-08-23
- llama.cpp↗official-docs · 核对日期 2026-08-23