Incident Response và tracing
Từ một 500 đến một timeline có thể kiểm chứng.
Nắm bản chất
Khi xảy ra sự cố, xác định user impact, onset, thay đổi gần nhất, blast radius
và trạng thái các dependencies. Logs cho events, metrics cho xu hướng, traces
cho đường đi của một request. W3C traceparent truyền context xuyên
services, nhưng header thôi chưa có đầy đủ distributed tracing nếu spans không
được export.
Incident commander phân công điều tra, mitigation và communication rõ ràng. Postmortem không chỉ nêu lỗi cá nhân; cần liệt kê điều kiện hệ thống khiến sự cố lan rộng và những hành động giảm tái diễn.
Luồng hoạt động
Hãy tự giải thích mỗi mũi tên: dữ liệu, quyền hoặc tín hiệu nào được truyền qua bước này?
Lệnh & cấu hình mẫu
kubectl get events -A --sort-by=.lastTimestamp
kubectl -n app logs deploy/api --since=15m --timestamps
kubectl -n app get pods -o wide
kubectl -n app rollout history deployment/api
Lệnh có placeholder hoặc phụ thuộc môi trường thì cần thay thông tin thực tế, kiểm tra quyền và chỉ thực hiện trên tài nguyên được phép.
Bài tập 10–20 phút
Dùng lab trace propagation Buổi 11, gửi một request qua 2 services rồi tìm trace ID ở cả hai logs. Viết mini incident timeline gồm detection, mitigation, recovery.
Lỗi dễ mắc
Không chạy kubectl delete pod --force như phản xạ khi chưa đánh
giá stateful data, PVC attachment và tác động lên người dùng.
Tự kiểm tra
Thông tin cốt lõi của incident update là gì?Xem đáp án ↗
Ảnh hưởng, trạng thái hiện tại, hành động đang thực hiện, rủi ro/tác động và thời điểm cập nhật tiếp theo theo quy trình.
Học thêm qua lab
Có project thực hành đúng với chương này, kèm README và những giới hạn môi trường cần lưu ý.
↓ Tải mã nguồn thực hành chương 11Đối chiếu tài liệu gốc
Cú pháp và khả năng hỗ trợ có thể thay đổi theo phiên bản. Trước khi dùng Production, hãy kiểm tra tài liệu tương ứng.
Mở tài liệu chính thức ↗