Panduan Operasional Proxmox VE Cluster HA & Ceph: Quorum, Failure Handling, dan Recovery
Implementasi Bertahap
Langkah konfigurasi dan tindakan lapangan yang dilakukan dari awal sampai siap diuji.
Tested & Verified On
Proxmox VE 8.x dan Ceph Reef
Prerequisites
Cluster Proxmox dan Ceph dasar sudah ada. Tim memahami perbedaan jaringan management, cluster, dan storage. Tersedia jendela lab untuk simulasi gangguan terkontrol.
Kasus Lapangan & Sasaran Implementasi
Membangun cluster hanyalah langkah awal. Tantangan sebenarnya muncul saat satu node hilang, quorum goyah, OSD down, atau live migration gagal. Tim operasional harus memahami apa yang boleh dan tidak boleh dilakukan saat kondisi cluster sedang tidak sehat.
Target pembaca: Administrator cluster yang sudah punya Proxmox dasar dan ingin memahami operasi saat insiden.
Hasil akhir yang harus dicapai: Tim mampu membaca status cluster dengan benar dan mengambil tindakan recovery yang aman saat terjadi gangguan.
Tahapan Implementasi Lapangan
- Pelajari baseline cluster sehat: quorum, status corosync, health Ceph, dan distribusi OSD.
- Simulasikan satu node down dan lihat dampaknya ke VM, quorum, dan recovery.
- Uji skenario OSD down atau storage degraded lalu baca health warning dengan benar.
- Dokumentasikan langkah recovery dan keputusan kapan maintenance aman dilakukan.
Contoh Konfigurasi / Command Penting
pvecm status
systemctl status corosync
ceph -s
ceph osd tree
ha-manager status
CLI Command & Configuration Script
pvecm status systemctl status corosync ceph -s ceph osd tree ha-manager status