← Về mục lục
BỘ CÔNG CỤ / TRA CỨU NHANH

Incident Runbook — từ triệu chứng đến khôi phục

Mở nhanh khi làm lab hoặc khi xử lý một vấn đề thường gặp. Có thể in riêng trang này.

1. Tuyên bố sự cố và mức độ ảnh hưởng

  • Người dùng bị ảnh hưởng: ai, ở đâu, từ thời điểm nào?
  • SLI: error rate, p95/p99, availability, backlog?
  • Gần đây có deploy, config change, node incident hay dependency failure?

2. Thu thập bằng chứng

kubectl config current-context
kubectl get pods -A -o wide
kubectl get events -A --sort-by=.lastTimestamp
kubectl -n NAMESPACE describe pod POD
kubectl -n NAMESPACE logs deploy/APP --since=15m

3. Chẩn đoán theo triệu chứng

Triệu chứng Đầu mối điều tra
Pending requests, node selectors, taints, quota
CrashLoopBackOff previous logs, command, secrets, startup
OOMKilled memory.current/events, heap/RSS, concurrency
Service 503 readiness, selectors, EndpointSlices
DNS timeout CoreDNS, policies, resolver search paths
HTTP 403 auth/application L7/mesh policy
5xx sau deploy Git revision, image digest, migrations

4. Khôi phục và kiểm tra

  • Mitigation an toàn, có owner và rollback.
  • Smoke test + SLI kiểm tra phục hồi.
  • Không xóa backup/volumes hoặc force-delete stateful workloads khi chưa hiểu tác động.

5. Postmortem

Lưu timeline, root causes và các điều kiện đóng góp; follow-ups cần owner và deadline.