← Về mục lục
BỘ CÔNG CỤ / TRA CỨU NHANH
Incident Runbook — từ triệu chứng đến khôi phục
Mở nhanh khi làm lab hoặc khi xử lý một vấn đề thường gặp. Có thể in riêng trang này.
1. Tuyên bố sự cố và mức độ ảnh hưởng
- Người dùng bị ảnh hưởng: ai, ở đâu, từ thời điểm nào?
- SLI: error rate, p95/p99, availability, backlog?
- Gần đây có deploy, config change, node incident hay dependency failure?
2. Thu thập bằng chứng
kubectl config current-context
kubectl get pods -A -o wide
kubectl get events -A --sort-by=.lastTimestamp
kubectl -n NAMESPACE describe pod POD
kubectl -n NAMESPACE logs deploy/APP --since=15m
3. Chẩn đoán theo triệu chứng
| Triệu chứng | Đầu mối điều tra |
|---|---|
| Pending | requests, node selectors, taints, quota |
| CrashLoopBackOff | previous logs, command, secrets, startup |
| OOMKilled | memory.current/events, heap/RSS, concurrency |
| Service 503 | readiness, selectors, EndpointSlices |
| DNS timeout | CoreDNS, policies, resolver search paths |
| HTTP 403 | auth/application L7/mesh policy |
| 5xx sau deploy | Git revision, image digest, migrations |
4. Khôi phục và kiểm tra
- Mitigation an toàn, có owner và rollback.
- Smoke test + SLI kiểm tra phục hồi.
- Không xóa backup/volumes hoặc force-delete stateful workloads khi chưa hiểu tác động.
5. Postmortem
Lưu timeline, root causes và các điều kiện đóng góp; follow-ups cần owner và deadline.