Il sistema di high availability di Proxmox VE fornisce failover automatico per macchine virtuali KVM e container LXC. Quando un nodo diventa non raggiungibile e il cluster mantiene il quorum, le risorse configurate per l'HA vengono automaticamente riavviate su un altro nodo.
Fencing: isolare il nodo guasto
Prima di riavviare una VM su un altro nodo, il cluster deve avere la certezza che il nodo guasto non stia ancora accedendo ai dischi condivisi. Proxmox VE implementa il fencing tramite un meccanismo watchdog-based: ogni nodo esegue un timer hardware che deve essere resettato periodicamente dal software. Se il nodo smette di funzionare e il watchdog scade, il nodo viene automaticamente riavviato, garantendo l'isolamento. Senza fencing corretto, il rischio è la corruzione dei dati per accesso concorrente.
Il watchdog software di default funziona nella maggior parte dei casi. Per ambienti di produzione critici, è preferibile abilitare il watchdog hardware IPMI (se il server lo supporta): è più affidabile in scenari di kernel panic dove il watchdog software potrebbe non scattare. Un comando utile: wdctl per verificare che il watchdog attivo sia quello corretto.
Configurazione HA da interfaccia web
La configurazione dell'alta disponibilità avviene dalla web UI. Per ogni VM o container puoi definire: lo stato desiderato (started, stopped, disabled), il gruppo di nodi preferiti per il failover e la priorità di riavvio. Il sistema monitora continuamente lo stato dei servizi e interviene automaticamente.
Un punto operativo importante: non configurare tutte le VM come HA. Se un nodo con 30 VM va giù e tutte sono HA, i nodi rimanenti dovranno riavviarne 30 simultaneamente, con un picco di I/O e RAM che può saturare le risorse e causare un effetto domino. Configurare come HA solo le VM critiche per il business, impostando priorità di riavvio differenziate: i database prima, le applicazioni dopo.