docs(cluster): corectii la runbook, descoperite la executie

- vm109-watchdog.sh ruleaza si pe pvemini, nu doar pe pveelite (contine
  `qm start 109`); tabelul de cron-uri de dezactivat era incomplet
- weekly-dr-test-proxmox.sh ruleaza sambata 06:00 pe AMBELE noduri si
  porneste VM 109 — avertisment nou, cu trimitere la incidentul 2026-04-20
- comanda gata de rulat pentru dezactivare + comanda de restaurare din backup

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01RRyaDj39hPQ89SZS6URRpS
This commit is contained in:
Marius
2026-08-27 12:30:31 +03:00
parent ff7e7da6d1
commit bd83bf809c

View File

@@ -83,19 +83,50 @@ repornesc pe același nod când nodul revine.
Altfel primești zeci de mailuri, iar `vm109-watchdog.sh` conține un `qm start 109` Altfel primești zeci de mailuri, iar `vm109-watchdog.sh` conține un `qm start 109`
care poate porni VM 109 fix când nu trebuie. care poate porni VM 109 fix când nu trebuie.
**Pe pveelite (10.0.20.202)** — `crontab -e`, comentează: Ce trebuie dezactivat pe fiecare nod:
``` | Nod | Script | De ce |
* * * * * /opt/scripts/pvemini-down-alert.sh |-----|--------|-------|
* * * * * /opt/scripts/vm109-watchdog.sh | pveelite | `pvemini-down-alert.sh` | mail la fiecare minut cât pvemini e jos |
* * * * * /opt/scripts/oom-alert.sh | pveelite | `vm109-watchdog.sh` | conține `qm start 109` |
| pveelite | `oom-alert.sh` | zgomot |
| **pvemini** | **`vm109-watchdog.sh`** | **rulează și aici, nu doar pe pveelite** |
| pvemini | `pveelite-down-alert.sh` | zgomot |
| pvemini | `oom-alert.sh` | zgomot |
| pve1 | `oom-alert.sh` | zgomot |
Comandă unică, rulată pe fiecare nod — face backup și comentează exact liniile
astea, lăsând restul crontab-ului neatins:
```bash
for h in 10.0.20.200 10.0.20.201 10.0.20.202; do
ssh root@$h 'crontab -l > /root/crontab.backup-mentenanta.txt; \
crontab -l | sed -E "/^[^#]/ s%^(.*(oom-alert|pvemini-down-alert|pveelite-down-alert|vm109-watchdog)\.sh.*)$%#MENTENANTA \1%" | crontab -'
done
``` ```
**Pe pvemini (10.0.20.201):** `pveelite-down-alert.sh` Restaurare după intervenție:
**Pe pve1 (10.0.20.200):** `oom-alert.sh`
```bash
for h in 10.0.20.200 10.0.20.201 10.0.20.202; do
ssh root@$h 'crontab /root/crontab.backup-mentenanta.txt && crontab -l | grep -c MENTENANTA'
done # trebuie sa intoarca 0 pe fiecare nod
```
> `pvemini-down-alert.sh` doar **trimite mail** cu comanda de failover, nu o > `pvemini-down-alert.sh` doar **trimite mail** cu comanda de failover, nu o
> execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109. > execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109,
> și rulează pe **ambele** noduri (pvemini și pveelite).
### ⚠️ Dacă fereastra de lucrări prinde sâmbătă dimineața
`weekly-dr-test-proxmox.sh` rulează **sâmbătă la 06:00, pe pvemini ȘI pe pveelite**,
și **pornește VM 109**. Conform [incidentului 2026-04-20](../incidents/2026-04-20-cluster-outage.md),
scriptul are istoric de a lăsa VM 109 pornit după un eșec (bug `set -e`) — exact
declanșatorul buclei OOM de atunci.
Dacă intervenția atinge sâmbătă 06:00, comentează-l pe ambele noduri.
La fel `vm109-patch-window.sh` (zilele 1-7 ale lunii, ora 03:00) dacă fereastra
prinde începutul de lună.
### Job-uri de backup ### Job-uri de backup