课程 341 / 365
93%
正文已完成
L341交付一份本地模型硬件预算
把任务、模型、上下文、并发、容量、速度、能耗和升级路径合成采购前证据。
硬件预算应从任务倒推。先确定具体模型文件、上下文长度、并发人数和延迟目标,再给出最低可运行、推荐稳定和压力增长三档,让决策者看见余量与升级条件。
能基于目标工作负载提出硬件最低、推荐与压力档预算,而不是凭模型标签采购。
核心概念
先把关键判断说清楚
任务基准先于采购规格
没有真实样本和延迟目标,显存或内存数字无法转成可用性结论。
三档预算展示风险
最低档证明能跑,推荐档满足峰值与余量,压力档覆盖增长并说明额外成本。
升级路径减少一次下注
可换模型、量化、加机器或切云端的路线,比假设未来需求固定更稳健。
案例拆解
两人团队的本地编码助手预算
团队希望离线运行代码模型,但尚未确定上下文、并发和响应目标,准备按最大参数量采购。
- 01
用真实仓库任务设16k上下文、并发2、首Token<5秒的目标。
- 02
在现有设备测Q4与Q5模型,记录峰值、吞吐和任务通过率。
- 03
给出最低单用户档、推荐双并发档和未来四并发扩展方案,并保留云端峰值兜底。
案例结果
采购讨论围绕可验证工作负载,而不是参数量竞赛。
提交前练习
现在轮到你
制作一份包含最低、推荐和压力档的本地硬件预算。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
工作负载是14B Q5、8k、并发2、p95首Token<4秒;最低档24GB单并发,推荐48GB双并发留30%余量,压力档多节点四并发;请求翻倍或p95超目标时评估云混合。
评分标准
- 规格绑定具体模型与负载
- 三档差异有实测依据
- 升级触发条件可以监控
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- llama.cpp↗official-docs · 核对日期 2026-08-23
- Transformers Quantization Overview↗official-docs · 核对日期 2026-08-23
- Evals↗official-docs · 核对日期 2026-08-23