SRE 运维场景题
核心定位 本文整理 SRE 面试中的通用运维场景题,重点关注故障响应、可用性保障、容量评估、监控告警、变更风险和复盘机制。
1. 线上服务突然不可用怎么处理
1.1. 参考答案
处理顺序:
- 确认故障范围:单实例、单机房、全站或部分接口。
- 快速止血:回滚、摘流量、扩容、切换主备或降级。
- 查看监控:错误率、延迟、流量、CPU、内存、IO、网络。
- 查看日志:应用日志、系统日志、网关日志。
- 定位根因:变更、依赖、资源、网络、数据库或缓存。
- 恢复后复盘并补监控、预案和自动化。
2. 告警风暴怎么处理
2.1. 参考答案
- 先识别根告警,避免被派生告警淹没。
- 按服务拓扑和依赖链路聚合告警。
- 对低价值告警进行静默、收敛或降噪。
- 建立分级告警:P0、P1、P2。
- 告警必须绑定处理手册和负责人。
3. 如何做容量评估
3.1. 参考答案
容量评估应结合历史趋势、峰值流量、增长率和冗余系数。
常见指标:
| 资源 | 指标 |
|---|---|
| CPU | 使用率、负载、运行队列 |
| 内存 | 使用率、缓存、swap |
| 磁盘 | 容量、IOPS、吞吐、延迟 |
| 网络 | 带宽、连接数、丢包、重传 |
| 应用 | QPS、错误率、P95/P99 延迟 |
4. 如何降低变更风险
4.1. 参考答案
- 变更前评审和风险分级。
- 灰度发布或分批执行。
- 明确回滚方案。
- 变更窗口避开业务高峰。
- 变更过程中实时观察核心指标。
- 变更后验证和记录。
5. 故障复盘应该包含什么
5.1. 参考答案
复盘内容:
- 故障时间线。
- 影响范围和用户影响。
- 直接原因和根因。
- 处置过程和有效动作。
- 暴露的问题。
- 后续改进项、负责人和截止时间。
复盘原则 复盘应关注系统和流程改进,避免只追责个人操作。
6. 面试总结
标准回答 SRE 场景题应体现先止血、再定位、后复盘的思路。线上故障先判断影响范围并快速恢复服务,再通过监控、日志、链路和变更记录定位根因。日常建设应围绕 SLI/SLO、容量规划、告警降噪、变更管控、应急预案和故障复盘展开,目标是提升系统可靠性并降低重复故障概率。
关联文档
- 通用运维场景题:补充 Linux 与基础设施运维场景。
- Linux 运维面试题:补充 Linux 基础面试题。
- 监控与可观测性:理解指标、日志和告警体系。
