docs(cluster): procedura de oprire planificata + corectii stare HA reala

Runbook nou pentru oprirea controlata a celor 3 noduri (lucrari electrice,
mutare rack, mentenanta UPS) fara ca HA sa relocheze resursele si fara ca
watchdog-ul sa reseteze hard nodul ramas fara quorum.

Doua capcane documentate:
- /etc/pve/datacenter.cfg nu exista => shutdown_policy implicit `conditional`
  => poweroff pe nod declanseaza FAILOVER, nu freeze
- watchdog-ul face reset hard dupa ~60s pe nodul care pierde quorumul cu
  servicii HA inca active

Corectii in failover/README.md, verificate pe clusterul live:
- VM 201 ESTE in HA (grup ha-prefer-pvemini), docul spunea ca nu e
- CT 108 e in ha-prefer-pvemini (pvemini:100, pve1:50, pveelite:10),
  nu in ha-group-main cu pveelite:50/pve1:33
- replicare CT 108 si VM 201 la */15 min, nu */5 => RPO real 15 min

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01RRyaDj39hPQ89SZS6URRpS
This commit is contained in:
Marius
2026-08-27 12:28:54 +03:00
parent 3ba36b6119
commit ff7e7da6d1
4 changed files with 316 additions and 6 deletions

View File

@@ -113,6 +113,9 @@ proxmox/
|--------|-----------|
| `README.md` | Ghid complet: SSH, noduri, storage, comenzi Proxmox, hartă IP-uri |
| `cluster-ha-monitor.sh` | Script monitorizare High Availability |
| `docs/oprire-planificata-cluster.md` | **Oprire controlată a celor 3 noduri fără failover HA / fence** |
| `failover/README.md` | Strategia HA pe nivele de criticitate, failover VM 201 |
| `incidents/` | Post-mortem-uri incidente cluster |
| `ups/` | Sistem UPS: configurare NUT, shutdown orchestrat, test baterie |
**Quick Start:**
@@ -452,6 +455,8 @@ ssh root@10.0.20.201 "qm snapshot 302 pre-test --description 'Before ROA test'"
- **Văd toate IP-urile și serviciile** → `cluster/README.md`
- **Configurez SSH** → `cluster/README.md` → "Configurare Inițială SSH"
- **Monitorizez HA cluster** → `cluster/cluster-ha-monitor.sh`
- **Opresc toate serverele (lucrări electrice, mutare rack)** → `cluster/docs/oprire-planificata-cluster.md`
- **Înțeleg strategia de failover / ce e în HA** → `cluster/failover/README.md`
- **Gestionez UPS** → `cluster/ups/README.md`
### Flowise AI / Chatbot Maria (LXC 104)