docs(cluster): corectii la runbook, descoperite la executie
- vm109-watchdog.sh ruleaza si pe pvemini, nu doar pe pveelite (contine `qm start 109`); tabelul de cron-uri de dezactivat era incomplet - weekly-dr-test-proxmox.sh ruleaza sambata 06:00 pe AMBELE noduri si porneste VM 109 — avertisment nou, cu trimitere la incidentul 2026-04-20 - comanda gata de rulat pentru dezactivare + comanda de restaurare din backup Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01RRyaDj39hPQ89SZS6URRpS
This commit is contained in:
@@ -83,19 +83,50 @@ repornesc pe același nod când nodul revine.
|
||||
Altfel primești zeci de mailuri, iar `vm109-watchdog.sh` conține un `qm start 109`
|
||||
care poate porni VM 109 fix când nu trebuie.
|
||||
|
||||
**Pe pveelite (10.0.20.202)** — `crontab -e`, comentează:
|
||||
Ce trebuie dezactivat pe fiecare nod:
|
||||
|
||||
```
|
||||
* * * * * /opt/scripts/pvemini-down-alert.sh
|
||||
* * * * * /opt/scripts/vm109-watchdog.sh
|
||||
* * * * * /opt/scripts/oom-alert.sh
|
||||
| Nod | Script | De ce |
|
||||
|-----|--------|-------|
|
||||
| pveelite | `pvemini-down-alert.sh` | mail la fiecare minut cât pvemini e jos |
|
||||
| pveelite | `vm109-watchdog.sh` | conține `qm start 109` |
|
||||
| pveelite | `oom-alert.sh` | zgomot |
|
||||
| **pvemini** | **`vm109-watchdog.sh`** | **rulează și aici, nu doar pe pveelite** |
|
||||
| pvemini | `pveelite-down-alert.sh` | zgomot |
|
||||
| pvemini | `oom-alert.sh` | zgomot |
|
||||
| pve1 | `oom-alert.sh` | zgomot |
|
||||
|
||||
Comandă unică, rulată pe fiecare nod — face backup și comentează exact liniile
|
||||
astea, lăsând restul crontab-ului neatins:
|
||||
|
||||
```bash
|
||||
for h in 10.0.20.200 10.0.20.201 10.0.20.202; do
|
||||
ssh root@$h 'crontab -l > /root/crontab.backup-mentenanta.txt; \
|
||||
crontab -l | sed -E "/^[^#]/ s%^(.*(oom-alert|pvemini-down-alert|pveelite-down-alert|vm109-watchdog)\.sh.*)$%#MENTENANTA \1%" | crontab -'
|
||||
done
|
||||
```
|
||||
|
||||
**Pe pvemini (10.0.20.201):** `pveelite-down-alert.sh`
|
||||
**Pe pve1 (10.0.20.200):** `oom-alert.sh`
|
||||
Restaurare după intervenție:
|
||||
|
||||
```bash
|
||||
for h in 10.0.20.200 10.0.20.201 10.0.20.202; do
|
||||
ssh root@$h 'crontab /root/crontab.backup-mentenanta.txt && crontab -l | grep -c MENTENANTA'
|
||||
done # trebuie sa intoarca 0 pe fiecare nod
|
||||
```
|
||||
|
||||
> `pvemini-down-alert.sh` doar **trimite mail** cu comanda de failover, nu o
|
||||
> execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109.
|
||||
> execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109,
|
||||
> și rulează pe **ambele** noduri (pvemini și pveelite).
|
||||
|
||||
### ⚠️ Dacă fereastra de lucrări prinde sâmbătă dimineața
|
||||
|
||||
`weekly-dr-test-proxmox.sh` rulează **sâmbătă la 06:00, pe pvemini ȘI pe pveelite**,
|
||||
și **pornește VM 109**. Conform [incidentului 2026-04-20](../incidents/2026-04-20-cluster-outage.md),
|
||||
scriptul are istoric de a lăsa VM 109 pornit după un eșec (bug `set -e`) — exact
|
||||
declanșatorul buclei OOM de atunci.
|
||||
|
||||
Dacă intervenția atinge sâmbătă 06:00, comentează-l pe ambele noduri.
|
||||
La fel `vm109-patch-window.sh` (zilele 1-7 ale lunii, ora 03:00) dacă fereastra
|
||||
prinde începutul de lună.
|
||||
|
||||
### Job-uri de backup
|
||||
|
||||
|
||||
Reference in New Issue
Block a user