docs(cluster): procedura de oprire planificata + corectii stare HA reala
Runbook nou pentru oprirea controlata a celor 3 noduri (lucrari electrice, mutare rack, mentenanta UPS) fara ca HA sa relocheze resursele si fara ca watchdog-ul sa reseteze hard nodul ramas fara quorum. Doua capcane documentate: - /etc/pve/datacenter.cfg nu exista => shutdown_policy implicit `conditional` => poweroff pe nod declanseaza FAILOVER, nu freeze - watchdog-ul face reset hard dupa ~60s pe nodul care pierde quorumul cu servicii HA inca active Corectii in failover/README.md, verificate pe clusterul live: - VM 201 ESTE in HA (grup ha-prefer-pvemini), docul spunea ca nu e - CT 108 e in ha-prefer-pvemini (pvemini:100, pve1:50, pveelite:10), nu in ha-group-main cu pveelite:50/pve1:33 - replicare CT 108 si VM 201 la */15 min, nu */5 => RPO real 15 min Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01RRyaDj39hPQ89SZS6URRpS
This commit is contained in:
@@ -113,6 +113,9 @@ proxmox/
|
||||
|--------|-----------|
|
||||
| `README.md` | Ghid complet: SSH, noduri, storage, comenzi Proxmox, hartă IP-uri |
|
||||
| `cluster-ha-monitor.sh` | Script monitorizare High Availability |
|
||||
| `docs/oprire-planificata-cluster.md` | **Oprire controlată a celor 3 noduri fără failover HA / fence** |
|
||||
| `failover/README.md` | Strategia HA pe nivele de criticitate, failover VM 201 |
|
||||
| `incidents/` | Post-mortem-uri incidente cluster |
|
||||
| `ups/` | Sistem UPS: configurare NUT, shutdown orchestrat, test baterie |
|
||||
|
||||
**Quick Start:**
|
||||
@@ -452,6 +455,8 @@ ssh root@10.0.20.201 "qm snapshot 302 pre-test --description 'Before ROA test'"
|
||||
- **Văd toate IP-urile și serviciile** → `cluster/README.md`
|
||||
- **Configurez SSH** → `cluster/README.md` → "Configurare Inițială SSH"
|
||||
- **Monitorizez HA cluster** → `cluster/cluster-ha-monitor.sh`
|
||||
- **Opresc toate serverele (lucrări electrice, mutare rack)** → `cluster/docs/oprire-planificata-cluster.md`
|
||||
- **Înțeleg strategia de failover / ce e în HA** → `cluster/failover/README.md`
|
||||
- **Gestionez UPS** → `cluster/ups/README.md`
|
||||
|
||||
### Flowise AI / Chatbot Maria (LXC 104)
|
||||
|
||||
Reference in New Issue
Block a user