课程 335 / 365
92%
正文已完成
L335完成一次模型尺寸的同机对照测试
交付固定任务集、运行参数、质量、延迟、内存和选型结论的基准报告。
从不同排行榜抄两个分数不能支持本地选型。对照测试要固定硬件、推理框架、量化格式、上下文、采样参数和任务集,并同时记录质量与系统指标。
能在同一硬件和同一生成设置下比较两个模型尺寸并保留可复现证据。
核心概念
先把关键判断说清楚
控制变量保证可比
一次只改变模型尺寸等目标变量,其他格式、提示、参数和硬件保持一致。
预热与重复减少偶然
首次加载与缓存会影响速度,每个样本重复运行并报告中位数和分位数。
原始结果支持复核
保存提示、模型哈希、输出、评分理由和系统指标,结论才能被他人重算。
案例拆解
8B与14B中文摘要对照
团队准备在一台48GB统一内存设备上选择本地模型,网上基准与任务差异较大。
- 01
固定同一推理框架和量化等级,记录模型文件哈希与系统版本。
- 02
用30篇真实脱敏文章,固定提示、上下文和温度,每个模型预热后运行三次。
- 03
记录事实错误、要点覆盖、首Token、吞吐、峰值内存和功耗,再按门槛决策。
案例结果
选型结果对应真实中文任务和具体设备,而不是依赖异构排行榜。
提交前练习
现在轮到你
设计一份两个模型尺寸的同机基准实验。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
固定Mac型号、llama.cpp版本、Q4格式、4k上下文、温度0;50条中文任务含10条高风险;记录人工rubric、TTFT、tokens/s、峰值内存;保存模型SHA、提示、全部输出与评分表。
评分标准
- 除模型尺寸外主要变量固定
- 样本覆盖真实与高风险任务
- 原始产物足以独立复算
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- Evals↗official-docs · 核对日期 2026-08-23
- llama.cpp↗official-docs · 核对日期 2026-08-23
- Transformers Quantization Overview↗official-docs · 核对日期 2026-08-23