Giám sát máy chủ cần theo dõi những chỉ số nào là đủ
Giám sát máy chủ đúng cách là biết sự cố trước khi khách gọi báo web sập, không phải nhìn biểu đồ cho đẹp. Sáu chỉ số cần theo dõi, kèm ngưỡng cảnh báo.
Giám sát máy chủ là theo dõi liên tục các chỉ số vận hành: website còn phản hồi không, ổ đĩa còn chỗ trống bao nhiêu, RAM và CPU dùng tới đâu, database còn nhận kết nối mới không, và chứng chỉ SSL còn hạn bao lâu. Mục đích không phải nhìn biểu đồ cho đẹp, mà biết vấn đề trước khi khách gọi báo web sập.

Giám sát máy chủ là theo dõi những chỉ số nào
Một cuộc gọi báo trang chủ không mở được là dấu hiệu đội kỹ thuật đã phản ứng chậm một bước. Công cụ theo dõi hệ thống đặt đúng cách phải bắn cảnh báo trước khi tình huống đó xảy ra. Bài này liệt kê sáu nhóm chỉ số theo đúng thứ tự nên nhìn, kèm ngưỡng đặt cảnh báo và việc cần làm khi vượt.
Phần lớn VPS mới nhận chưa bật giám sát gì cả. Danh sách việc cần làm sau khi nhận máy thường xếp bước dựng cảnh báo theo dõi ngay sau khi đổi mật khẩu và khoá SSH. Doanh nghiệp không có ai trực xem các chỉ số này có thể giao phần đó cho dịch vụ quản trị máy chủ BizMaC.
Website còn phản hồi không là chỉ số ưu tiên hàng đầu
Chỉ số quan trọng nhất trong giám sát máy chủ là website có phản hồi hay không, và mất bao lâu để phản hồi. Công cụ uptime check gửi request tới trang đều đặn mỗi vài phút, đo thời gian trả về và mã trạng thái HTTP.
Ngưỡng cảnh báo hợp lý: thời gian phản hồi vượt 3 giây, hoặc hai lần kiểm tra liên tiếp không kết nối được. Vượt ngưỡng này thường do web server đã dừng, tiến trình PHP-FPM treo, hoặc máy chủ hết tài nguyên xử lý request. Việc cần làm là xem log lỗi web server, kiểm tra tiến trình đang chạy, khởi động lại dịch vụ nếu cần, rồi mới tính nâng cấu hình. Khi trang báo lỗi hẳn thay vì chỉ chậm, kiểm tra khi website không truy cập giúp khoanh vùng nhanh giữa lỗi DNS, hosting hết hạn hay server quá tải. Đây là lớp giám sát rẻ và dễ dựng nhất, nên đặt trước tiên.
Ổ đĩa đầy là nguyên nhân sập máy chủ hay gặp nhất
Ổ đĩa đầy khiến máy chủ ngừng ghi log, database không insert được dữ liệu mới, trang web bắt đầu trả lỗi 500 dù CPU và RAM vẫn còn dư. Chỉ số dung lượng ổ đĩa nên đặt cảnh báo sớm, trước khi hệ điều hành tự chặn ghi.
Ngưỡng hợp lý là cảnh báo khi dung lượng trống còn dưới 15%, khẩn khi còn dưới 5%. Theo tài liệu mke2fs của ext4, mặc định 5% dung lượng ổ đĩa được dự trữ riêng cho tiến trình root, nghĩa là ứng dụng chạy quyền người dùng thường có thể đã hết chỗ ghi trước khi ổ đĩa báo đầy 100%. Nguyên nhân hay gặp: log không xoay vòng, backup cũ không dọn, hoặc file người dùng tải lên tích tụ qua nhiều năm. Việc cần làm là xác định thư mục nào phình to, dọn log và backup cũ, rồi mới cân nhắc nâng dung lượng.
RAM và swap báo hiệu máy chủ đuối sức trước khi crash
RAM khả dụng giảm dần và swap bắt đầu được dùng nhiều là dấu hiệu máy chủ sắp đuối trước khi crash hẳn. Chỉ số RAM cho biết tiến trình nào đang chiếm bộ nhớ bất thường, để xử lý trước khi hệ điều hành tự tắt tiến trình đó.
Ngưỡng cảnh báo: RAM khả dụng còn dưới 10%, hoặc swap dùng vượt 50%. Vượt ngưỡng thường do rò rỉ bộ nhớ ở một tiến trình chạy lâu ngày, hoặc cấu hình VPS không đủ cho lượng truy cập thực tế. Việc cần làm là xem tiến trình theo mức dùng RAM, restart dịch vụ nghi ngờ rò rỉ, và nếu tình trạng lặp lại đều đặn thì đó là dấu hiệu cần nâng tài nguyên VPS chứ không phải sự cố tạm thời.
Tải CPU và số kết nối database nói lên điều gì
Tải trung bình (load average) và số kết nối database đang mở cho biết máy chủ có xử lý kịp lượng việc gửi tới hay không. Hai chỉ số này thường tăng cùng lúc khi có đợt truy cập cao điểm hoặc truy vấn database chạy chậm.
Load average vượt số nhân CPU của VPS trong 5 phút liên tục là ngưỡng nên cảnh báo. VPS 2 vCPU mà load average giữ trên 2 nghĩa là tiến trình đang xếp hàng chờ xử lý. Việc cần làm là xem tiến trình chiếm CPU nhiều nhất, kiểm tra cronjob chạy trùng giờ cao điểm, tối ưu truy vấn chậm trước khi tính chuyện nâng cấu hình.
Số kết nối database nên cảnh báo khi chạm 80% giới hạn cấu hình. Theo tài liệu MySQL Reference Manual, giá trị mặc định của tham số max_connections là 151, một con số nhiều ứng dụng dùng nguyên mà không chỉnh lại theo tải thực tế. Kết nối tăng bất thường thường do ứng dụng mở kết nối không đóng, hoặc traffic tăng đột biến. Việc cần làm là kiểm tra connection pool, tìm truy vấn treo lâu, và tăng giới hạn nếu hạ tầng còn dư tài nguyên.
| Chỉ số | Ngưỡng cảnh báo | Nghĩa là gì | Làm gì |
|---|---|---|---|
| Thời gian phản hồi website | Trên 3 giây, hoặc mất kết nối 2 lần liên tiếp | Web server đã dừng hoặc hết tài nguyên xử lý | Xem log web server, kiểm tra tiến trình, restart dịch vụ |
| Dung lượng ổ đĩa | Còn dưới 15%, khẩn khi dưới 5% | Log hoặc backup tích tụ không dọn | Dọn log và backup cũ, rồi cân nhắc nâng dung lượng |
| RAM khả dụng | Còn dưới 10%, swap dùng trên 50% | Rò rỉ bộ nhớ hoặc cấu hình chưa đủ tải | Xem tiến trình chiếm RAM nhiều nhất, restart dịch vụ nghi ngờ |
| Tải trung bình (load average) | Vượt số nhân CPU trong 5 phút liên tục | Tiến trình xếp hàng chờ xử lý, CPU nghẽn | Xem tiến trình chiếm CPU, tối ưu truy vấn chậm |
| Số kết nối database | Chạm 80% giới hạn max_connections | Ứng dụng mở kết nối không đóng, hoặc traffic tăng đột biến | Kiểm tra connection pool, tìm truy vấn treo lâu |
| Hạn chứng chỉ SSL | Còn dưới 14 ngày | Chứng chỉ sắp hết hạn, trình duyệt sẽ chặn trang | Gia hạn hoặc bật gia hạn tự động, kiểm tra lại sau khi cài |
Không có ai trực xem các chỉ số này mỗi ngày?
Ba gói quản trị máy chủ BizMaC từ 1.500.000đ/tháng, gói Advanced giám sát toàn diện uptime, database, xử lý sự cố chủ động kèm báo cáo nguyên nhân.
Chứng chỉ SSL còn hạn bao lâu, và lỗi hay gặp khi đặt cảnh báo
Chứng chỉ SSL hết hạn khiến trình duyệt chặn toàn bộ trang bằng cảnh báo không an toàn, dù máy chủ vẫn chạy bình thường. Theo CA/Browser Forum, chứng chỉ SSL công khai hiện tối đa 398 ngày, còn chứng chỉ Let's Encrypt miễn phí chỉ 90 ngày, nên rất dễ quên nếu không đặt cảnh báo riêng.
Ngưỡng cảnh báo hợp lý: còn dưới 14 ngày là hạn chót phải xử lý, dưới 30 ngày là mốc nên bắt đầu theo dõi. Việc cần làm là gia hạn thủ công hoặc bật gia hạn tự động với Let's Encrypt, rồi kiểm tra lại trang đã nhận chứng chỉ mới hay chưa, vì một số cấu hình cần restart web server mới áp dụng.
Lỗi hay gặp nhất không nằm ở công cụ, mà ở cách cấu hình cảnh báo. Ngưỡng đặt quá nhạy, ví dụ cảnh báo ngay khi CPU chạm 50%, khiến hộp thư ngập tin không quan trọng, và sau vài tuần cả đội âm thầm tắt thông báo. Lỗi thứ hai là không phân công rõ ai nhận cảnh báo: email gửi tới một nhóm chung, ai cũng nghĩ người khác đã xem, không ai thật sự xử lý. Không đủ người trực nhận thì nên so sánh chi phí tự quản trị với thuê ngoài, chứ không phải mua thêm công cụ mới. Nhật ký hệ thống cũng cần người đọc định kỳ, vì nhiều sự cố để lại dấu vết trong log trước khi chỉ số vượt ngưỡng.
Load average và RAM vượt ngưỡng thường xuyên chứ không phải một lần thì nên tìm nguyên nhân VPS chạy chậm trước khi vội nâng cấu hình. Đôi khi nghẽn nằm ở một tiến trình lỗi, không phải do tài nguyên VPS thiếu thật.
Câu hỏi thường gặp về giám sát máy chủ
Theo dõi hệ thống khác gì với quản trị máy chủ?
Theo dõi là quan sát chỉ số và bắn cảnh báo khi vượt ngưỡng. Quản trị máy chủ rộng hơn, gồm cài đặt, vá lỗi bảo mật, backup và xử lý sự cố khi cảnh báo xảy ra.
Nên tự dựng công cụ giám sát hay dùng dịch vụ có sẵn?
VPS nhỏ, một người quản lý có thể tự dựng công cụ mã nguồn mở cho vài chỉ số cơ bản. Nhiều máy chủ hoặc không có nhân sự kỹ thuật riêng thì hợp với gói quản trị trọn gói hơn.
Bao lâu nên xem lại các chỉ số theo dõi hệ thống một lần?
Cảnh báo tự động xử lý phần phát hiện tức thời. Nên có người xem lại xu hướng ổ đĩa và RAM theo tuần, vì tăng dần đều là dấu hiệu sớm hơn một lần vượt ngưỡng đột ngột.
VPS cấu hình nhỏ có cần theo dõi đủ sáu chỉ số không?
Có. VPS cấu hình nhỏ ít đệm tài nguyên dự phòng, chạm ngưỡng nhanh hơn máy chủ lớn. Ưu tiên dựng trước ba chỉ số: phản hồi website, ổ đĩa, RAM.
Tip tham khảo
Bắt đầu với ba chỉ số dễ dựng nhất: uptime check, ổ đĩa, RAM. Ba chỉ số này bắt được phần lớn sự cố máy chủ thường gặp mà không cần công cụ phức tạp. Load average, kết nối database và hạn SSL thêm sau khi phần theo dõi hệ thống cơ bản đã chạy ổn định.
Đặt ngưỡng cảnh báo vừa đủ nhạy, phân công rõ ai nhận và xử lý, rồi mới tính thêm chỉ số. Doanh nghiệp không có nhân sự trực theo dõi có thể cân nhắc gói Managed theo dõi hệ thống để đội kỹ thuật BizMaC nhận phần này thay.
Lưu ý: Bài viết chia kinh nghiệm chung, còn mỗi doanh nghiệp một quy mô và một cách vận hành. Muốn biết cách nào hợp với trường hợp của bạn — chọn gói nào, làm theo thứ tự nào, chi phí ra sao — chuyên viên BizMaC tư vấn và làm giúp bạn phần kỹ thuật.
Để BizMaC dựng website cho doanh nghiệp bạn
Giao diện chuẩn UX, cấu trúc chuẩn SEO, chạy mượt trên di động và dễ tự quản trị sau khi bàn giao. BizMaC làm website cho doanh nghiệp Việt từ năm 2007, đi kèm hướng dẫn vận hành chứ không bàn giao xong là hết.



