Blog AgentWatch
Ghi chép thực chiến về giám sát server, uptime và cảnh báo cho đội vận hành nhỏ.
Cách giám sát server Linux không cần dựng Zabbix
So sánh trung thực 3 cách giám sát server Linux: tự dựng Zabbix hay Prometheus, viết script cron, hoặc dùng dịch vụ có agent. Ưu nhược điểm và ai hợp với hướng nào.
Đọc bài →
Đặt ngưỡng cảnh báo CPU, RAM, ổ đĩa bao nhiêu là hợp lý?
Bảng ngưỡng cảnh báo CPU, RAM, ổ đĩa khuyến nghị theo loại workload: web server, database, CI runner. Giải thích vì sao, kèm cách dùng hysteresis và số mẫu liên tiếp để tránh báo động giả.
Đọc bài →
Viết HEALTHCHECK cho Docker đúng cách
Hướng dẫn viết HEALTHCHECK trong Dockerfile và docker-compose: ý nghĩa interval, timeout, retries, start_period, ví dụ thật và các lỗi thường gặp như endpoint health gọi ra dịch vụ ngoài.
Đọc bài →
Server sập thì làm gì: quy trình 7 bước xử lý sự cố
Checklist 7 bước xử lý khi server sập, kèm lệnh Linux thật: systemctl, journalctl, df -h, free -m, docker ps, ss -tlnp. Làm theo thứ tự để khôi phục nhanh và không phá bằng chứng.
Đọc bài →
Status page là gì và khi nào doanh nghiệp nhỏ cần?
Status page là trang công khai hiển thị tình trạng hoạt động của dịch vụ. Giải thích status page gồm những gì, lợi ích thật với doanh nghiệp nhỏ và 4 dấu hiệu cho thấy bạn đã cần một trang.
Đọc bài →
99,9% uptime nghĩa là được sập bao lâu?
Bảng quy đổi chính xác 99% / 99,5% / 99,9% / 99,95% / 99,99% uptime sang thời gian ngừng cho phép mỗi ngày, mỗi tháng và mỗi năm, kèm cách tự tính và cách chọn mục tiêu phù hợp.
Đọc bài →
