Il cluster ha perso il quorum
I nodi non si vedono, `pvecm status` non torna, le VM in HA restano ferme o si riavviano a ripetizione.
Emergenza Proxmox e Ceph · Linea H24, 365 giorni
Cluster senza quorum, storage Ceph in sola lettura, VM che non ripartono: chiami e ti risponde un sistemista che quei cluster li tiene in piedi tutti i giorni.
365 giorni, festivi inclusi
Risponde un sistemista, non un centralino
Proxmox Gold Partner, escalation al vendor
Analisi post-incidente inclusa
Se l'emergenza è in corso chiama: il modulo è per chi può aspettare una risposta scritta.
Quando chiamarci
Per tutto il resto (configurazioni, preventivi, quesiti) c'è il supporto ordinario.
I nodi non si vedono, `pvecm status` non torna, le VM in HA restano ferme o si riavviano a ripetizione.
OSD down, PG `inactive` o `incomplete`, il pool passa in read-only e le VM sopra si bloccano.
Il disco non si aggancia, restano lock aperti, lo storage risponde ma non monta.
Il backup su Proxmox Backup Server non si verifica, il restore si ferma a metà, la copia buona non si trova.
File cifrati, snapshot spariti, accessi che non riconosci: qui la prima mossa sbagliata costa più del guasto.
Dopo un upgrade il nodo non torna su, o il cluster resta diviso fra due versioni.
Come funziona
Tre domande: che cosa è fermo, da quando, che cosa hai già provato. Se chiami, dall'altra parte c'è un sistemista.
Guardiamo insieme lo stato del cluster e dello storage, decidiamo la prima mossa e ti diciamo che cosa comporta, costo compreso, prima di toccare qualcosa.
Si lavora in sessione condivisa o in accesso diretto. Alla fine resta scritto che cosa è successo, che cosa abbiamo fatto e che cosa conviene sistemare dopo.
Mentre aspetti
I primi minuti contano: queste azioni preservano i dati e accorciano il ripristino.
Due modi di essere coperti
L'intervento d'emergenza non richiede abbonamento. Se il cluster è in produzione, però, un contratto costa meno di un'emergenza: il presidio conosce già l'ambiente e non parte da zero.
Su cosa mettiamo le mani
Sì, interveniamo anche se non siete clienti, e anche su cluster che non abbiamo installato noi. Serve solo che qualcuno da parte vostra possa darci accesso e raccontarci che cosa è cambiato prima del guasto.
Dipende da che cosa è fermo e da quanto lavoro serve. Il preventivo si concorda durante il triage, prima di mettere le mani sui sistemi: un'emergenza non ha un listino, e scriverne uno in pagina vorrebbe dire indovinare. Non serve nessun abbonamento per chiamare.
Nel modo che decidete voi: sessione condivisa mentre guardate, VPN, salto da un bastion. Tutto quello che facciamo finisce nel report post-incidente, comando per comando.
Capita spesso: rete, storage sottostante, alimentazione, un firmware aggiornato la settimana prima. Il triage serve anche a questo, e se la causa è fuori dal nostro perimetro lo diciamo subito invece di far passare le ore.
La linea è attiva H24, 365 giorni. Risponde un sistemista del presidio, non una segreteria che apre un ticket.
Il report dice che cosa ha ceduto e che cosa conviene cambiare: dal dimensionamento di Ceph alla rete del cluster, dalla politica di backup alla verifica dei ripristini. Se volete ne parliamo con calma, ed è lì che nasce un contratto, non durante l'emergenza.
Backup verificati, cluster progettato per reggere un guasto e presidio continuo: parliamone prima che serva la linea rossa.
Emergenze: +39 0421 1880420 · H24