Linux

SRE 运维场景题

·3 分钟阅读·1016 字

整理 SRE 运维中的可用性、告警、容量、变更、故障复盘和应急响应场景题

📋 目录

SRE 运维场景题

核心定位 本文整理 SRE 面试中的通用运维场景题,重点关注故障响应、可用性保障、容量评估、监控告警、变更风险和复盘机制。

1. 线上服务突然不可用怎么处理

1.1. 参考答案

处理顺序:

  1. 确认故障范围:单实例、单机房、全站或部分接口。
  2. 快速止血:回滚、摘流量、扩容、切换主备或降级。
  3. 查看监控:错误率、延迟、流量、CPU、内存、IO、网络。
  4. 查看日志:应用日志、系统日志、网关日志。
  5. 定位根因:变更、依赖、资源、网络、数据库或缓存。
  6. 恢复后复盘并补监控、预案和自动化。

2. 告警风暴怎么处理

2.1. 参考答案

  1. 先识别根告警,避免被派生告警淹没。
  2. 按服务拓扑和依赖链路聚合告警。
  3. 对低价值告警进行静默、收敛或降噪。
  4. 建立分级告警:P0、P1、P2。
  5. 告警必须绑定处理手册和负责人。

3. 如何做容量评估

3.1. 参考答案

容量评估应结合历史趋势、峰值流量、增长率和冗余系数。

常见指标:

资源指标
CPU使用率、负载、运行队列
内存使用率、缓存、swap
磁盘容量、IOPS、吞吐、延迟
网络带宽、连接数、丢包、重传
应用QPS、错误率、P95/P99 延迟

4. 如何降低变更风险

4.1. 参考答案

  1. 变更前评审和风险分级。
  2. 灰度发布或分批执行。
  3. 明确回滚方案。
  4. 变更窗口避开业务高峰。
  5. 变更过程中实时观察核心指标。
  6. 变更后验证和记录。

5. 故障复盘应该包含什么

5.1. 参考答案

复盘内容:

  1. 故障时间线。
  2. 影响范围和用户影响。
  3. 直接原因和根因。
  4. 处置过程和有效动作。
  5. 暴露的问题。
  6. 后续改进项、负责人和截止时间。

复盘原则 复盘应关注系统和流程改进,避免只追责个人操作。

6. 面试总结

标准回答 SRE 场景题应体现先止血、再定位、后复盘的思路。线上故障先判断影响范围并快速恢复服务,再通过监控、日志、链路和变更记录定位根因。日常建设应围绕 SLI/SLO、容量规划、告警降噪、变更管控、应急预案和故障复盘展开,目标是提升系统可靠性并降低重复故障概率。


关联文档

Yanche Blog

记录云原生、Linux、数据库等技术领域的学习心得,以及日常生活的思考与感悟。

© 2026 Yanche Blog. All rights reserved.

Powered by Astro