docs(cluster): corectii la runbook, descoperite la executie
- vm109-watchdog.sh ruleaza si pe pvemini, nu doar pe pveelite (contine `qm start 109`); tabelul de cron-uri de dezactivat era incomplet - weekly-dr-test-proxmox.sh ruleaza sambata 06:00 pe AMBELE noduri si porneste VM 109 — avertisment nou, cu trimitere la incidentul 2026-04-20 - comanda gata de rulat pentru dezactivare + comanda de restaurare din backup Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01RRyaDj39hPQ89SZS6URRpS
This commit is contained in:
@@ -83,19 +83,50 @@ repornesc pe același nod când nodul revine.
|
|||||||
Altfel primești zeci de mailuri, iar `vm109-watchdog.sh` conține un `qm start 109`
|
Altfel primești zeci de mailuri, iar `vm109-watchdog.sh` conține un `qm start 109`
|
||||||
care poate porni VM 109 fix când nu trebuie.
|
care poate porni VM 109 fix când nu trebuie.
|
||||||
|
|
||||||
**Pe pveelite (10.0.20.202)** — `crontab -e`, comentează:
|
Ce trebuie dezactivat pe fiecare nod:
|
||||||
|
|
||||||
```
|
| Nod | Script | De ce |
|
||||||
* * * * * /opt/scripts/pvemini-down-alert.sh
|
|-----|--------|-------|
|
||||||
* * * * * /opt/scripts/vm109-watchdog.sh
|
| pveelite | `pvemini-down-alert.sh` | mail la fiecare minut cât pvemini e jos |
|
||||||
* * * * * /opt/scripts/oom-alert.sh
|
| pveelite | `vm109-watchdog.sh` | conține `qm start 109` |
|
||||||
|
| pveelite | `oom-alert.sh` | zgomot |
|
||||||
|
| **pvemini** | **`vm109-watchdog.sh`** | **rulează și aici, nu doar pe pveelite** |
|
||||||
|
| pvemini | `pveelite-down-alert.sh` | zgomot |
|
||||||
|
| pvemini | `oom-alert.sh` | zgomot |
|
||||||
|
| pve1 | `oom-alert.sh` | zgomot |
|
||||||
|
|
||||||
|
Comandă unică, rulată pe fiecare nod — face backup și comentează exact liniile
|
||||||
|
astea, lăsând restul crontab-ului neatins:
|
||||||
|
|
||||||
|
```bash
|
||||||
|
for h in 10.0.20.200 10.0.20.201 10.0.20.202; do
|
||||||
|
ssh root@$h 'crontab -l > /root/crontab.backup-mentenanta.txt; \
|
||||||
|
crontab -l | sed -E "/^[^#]/ s%^(.*(oom-alert|pvemini-down-alert|pveelite-down-alert|vm109-watchdog)\.sh.*)$%#MENTENANTA \1%" | crontab -'
|
||||||
|
done
|
||||||
```
|
```
|
||||||
|
|
||||||
**Pe pvemini (10.0.20.201):** `pveelite-down-alert.sh`
|
Restaurare după intervenție:
|
||||||
**Pe pve1 (10.0.20.200):** `oom-alert.sh`
|
|
||||||
|
```bash
|
||||||
|
for h in 10.0.20.200 10.0.20.201 10.0.20.202; do
|
||||||
|
ssh root@$h 'crontab /root/crontab.backup-mentenanta.txt && crontab -l | grep -c MENTENANTA'
|
||||||
|
done # trebuie sa intoarca 0 pe fiecare nod
|
||||||
|
```
|
||||||
|
|
||||||
> `pvemini-down-alert.sh` doar **trimite mail** cu comanda de failover, nu o
|
> `pvemini-down-alert.sh` doar **trimite mail** cu comanda de failover, nu o
|
||||||
> execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109.
|
> execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109,
|
||||||
|
> și rulează pe **ambele** noduri (pvemini și pveelite).
|
||||||
|
|
||||||
|
### ⚠️ Dacă fereastra de lucrări prinde sâmbătă dimineața
|
||||||
|
|
||||||
|
`weekly-dr-test-proxmox.sh` rulează **sâmbătă la 06:00, pe pvemini ȘI pe pveelite**,
|
||||||
|
și **pornește VM 109**. Conform [incidentului 2026-04-20](../incidents/2026-04-20-cluster-outage.md),
|
||||||
|
scriptul are istoric de a lăsa VM 109 pornit după un eșec (bug `set -e`) — exact
|
||||||
|
declanșatorul buclei OOM de atunci.
|
||||||
|
|
||||||
|
Dacă intervenția atinge sâmbătă 06:00, comentează-l pe ambele noduri.
|
||||||
|
La fel `vm109-patch-window.sh` (zilele 1-7 ale lunii, ora 03:00) dacă fereastra
|
||||||
|
prinde începutul de lună.
|
||||||
|
|
||||||
### Job-uri de backup
|
### Job-uri de backup
|
||||||
|
|
||||||
|
|||||||
Reference in New Issue
Block a user