课程 308 / 365
84%
正文已完成
L308为关键路径写一份降级与恢复预案
交付触发条件、降级动作、用户沟通、数据保护和恢复放量的完整预案。
故障中才讨论“关什么”会浪费最宝贵的时间。预案应在平时固定触发信号、执行权限、数据处理、用户文案和恢复顺序,并通过演练确认开关真的有效。
能把降级从临时决定变成可演练、可恢复的运行契约。
核心概念
先把关键判断说清楚
触发与退出条件成对
进入降级和恢复正常都要有持续窗口,避免指标在阈值附近反复抖动。
开关需可审计可回滚
功能开关的修改人、原因、时间和目标范围要记录,默认提供一键回到上一状态。
排队数据有生命周期
降级期间保存的任务要定义容量、过期、去重、处理顺序和恢复后的补偿。
案例拆解
搜索故障时切换到分类导航
全文检索集群故障后,课程目录搜索持续超时;团队有分类数据但从未演练切换。
- 01
触发条件设为搜索 p95>3秒且错误率>20%持续5分钟。
- 02
开关关闭搜索框并展示篇章分类导航,保留用户关键词到本地以便恢复后重试。
- 03
集群健康15分钟后先恢复10%流量,逐级放量并核对错误预算。
案例结果
用户仍能通过分类找到课程,恢复过程也不会瞬间再次压垮集群。
提交前练习
现在轮到你
为一条关键用户路径完成降级与恢复预案。
内容会自动保存在当前设备
查看参考答案与评分标准
参考答案
触发是模型错误率>30%持续3分钟;关闭即时生成、保留课程和草稿;问题按用户+内容哈希去重,24小时过期;恢复需错误率<2%持续10分钟,按5%/25%/100%放量,每档观察15分钟。
评分标准
- 进入与退出条件不对称防抖
- 核心价值和数据边界明确
- 恢复含分档与回退条件
本课收口 · 学习证据
完成,不等于随手打一个勾。
确认阅读、保存练习,再用 30 秒检查和一句话总结留下真实学习证据。
02完成本课练习0 / 4 项必填内容已填写
03通过理解检查约 30 秒
你现在更接近哪一种状态?
完成上面三项后,才能把本课记为已验证。
资料来源
继续核对与延伸阅读
本课内容最近更新于 。
- Monitoring Distributed Systems↗reference · 核对日期 2026-08-23
- OpenTelemetry Signals↗official-docs · 核对日期 2026-08-23
- NIST AI Risk Management Framework↗standard · 核对日期 2026-08-23