diff --git a/proxmox/cluster/docs/oprire-planificata-cluster.md b/proxmox/cluster/docs/oprire-planificata-cluster.md index bdcf1e7..274a7c5 100644 --- a/proxmox/cluster/docs/oprire-planificata-cluster.md +++ b/proxmox/cluster/docs/oprire-planificata-cluster.md @@ -83,19 +83,50 @@ repornesc pe același nod când nodul revine. Altfel primești zeci de mailuri, iar `vm109-watchdog.sh` conține un `qm start 109` care poate porni VM 109 fix când nu trebuie. -**Pe pveelite (10.0.20.202)** — `crontab -e`, comentează: +Ce trebuie dezactivat pe fiecare nod: -``` -* * * * * /opt/scripts/pvemini-down-alert.sh -* * * * * /opt/scripts/vm109-watchdog.sh -* * * * * /opt/scripts/oom-alert.sh +| Nod | Script | De ce | +|-----|--------|-------| +| pveelite | `pvemini-down-alert.sh` | mail la fiecare minut cât pvemini e jos | +| pveelite | `vm109-watchdog.sh` | conține `qm start 109` | +| pveelite | `oom-alert.sh` | zgomot | +| **pvemini** | **`vm109-watchdog.sh`** | **rulează și aici, nu doar pe pveelite** | +| pvemini | `pveelite-down-alert.sh` | zgomot | +| pvemini | `oom-alert.sh` | zgomot | +| pve1 | `oom-alert.sh` | zgomot | + +Comandă unică, rulată pe fiecare nod — face backup și comentează exact liniile +astea, lăsând restul crontab-ului neatins: + +```bash +for h in 10.0.20.200 10.0.20.201 10.0.20.202; do + ssh root@$h 'crontab -l > /root/crontab.backup-mentenanta.txt; \ + crontab -l | sed -E "/^[^#]/ s%^(.*(oom-alert|pvemini-down-alert|pveelite-down-alert|vm109-watchdog)\.sh.*)$%#MENTENANTA \1%" | crontab -' +done ``` -**Pe pvemini (10.0.20.201):** `pveelite-down-alert.sh` -**Pe pve1 (10.0.20.200):** `oom-alert.sh` +Restaurare după intervenție: + +```bash +for h in 10.0.20.200 10.0.20.201 10.0.20.202; do + ssh root@$h 'crontab /root/crontab.backup-mentenanta.txt && crontab -l | grep -c MENTENANTA' +done # trebuie sa intoarca 0 pe fiecare nod +``` > `pvemini-down-alert.sh` doar **trimite mail** cu comanda de failover, nu o -> execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109. +> execută singur — verificat în cod. `vm109-watchdog.sh` însă chiar pornește VM 109, +> și rulează pe **ambele** noduri (pvemini și pveelite). + +### ⚠️ Dacă fereastra de lucrări prinde sâmbătă dimineața + +`weekly-dr-test-proxmox.sh` rulează **sâmbătă la 06:00, pe pvemini ȘI pe pveelite**, +și **pornește VM 109**. Conform [incidentului 2026-04-20](../incidents/2026-04-20-cluster-outage.md), +scriptul are istoric de a lăsa VM 109 pornit după un eșec (bug `set -e`) — exact +declanșatorul buclei OOM de atunci. + +Dacă intervenția atinge sâmbătă 06:00, comentează-l pe ambele noduri. +La fel `vm109-patch-window.sh` (zilele 1-7 ale lunii, ora 03:00) dacă fereastra +prinde începutul de lună. ### Job-uri de backup