upsmon face fork in doua procese, iar NOTIFYCMD ruleaza in cel neprivilegiat, ca user `nut`: shell nologin, home /var/lib/nut, NICIO cheie SSH. Verificat pe pvemini — pentru `nut`, `qm list`, `pct list` si `ssh root@pve1` esueaza toate. Deci ups-shutdown-cluster.sh nu putea opri niciun guest si nu putea ajunge la niciun nod. Singurul lucru care mergea erau emailurile, pentru care exista deja `nut ALL=(root) NOPASSWD: /usr/bin/perl`. De asta /var/log/ups-shutdown.log nu continea nicio oprire reusita din 2025-10-06 incoace: la fiecare pana de curent se trimiteau emailuri si nu se oprea nimic, iar pve1/pveelite mergeau pana se termina bateria. Reparat: - /etc/sudoers.d/nut-shutdown da userului nut dreptul sa ruleze scriptul ca root - upssched-cmd il invoca prin sudo (liniile 355 si 413) - scriptul refuza sa porneasca daca nu e root, cu mesaj explicit Rescris scriptul: - seteaza shutdown_policy=freeze INAINTE de orice. Fara asta, politica implicita `conditional` transforma fiecare poweroff de nod in failover catre un nod care se stinge si el imediat — exact incidentul 2026-01-11, cu VM 201 migrat in timpul unei pene - guest-urile HA se opresc cu `ha-manager set --state stopped`, nu cu pct/qm shutdown, care din CLI nu actualizeaza state-ul HA - Oracle primeste `shutdown immediate` inainte de oprirea containerului - consumatorii se opresc in paralel, Oracle ultimul - detecteaza lipsa quorumului si cade pe oprire directa, in loc sa blocheze - flock: ONBATT si LOWBATT pot declansa amandoua scriptul - sare peste nodurile care nu raspund la ping in loc sa astepte timeout SSH - timeout pe notificarile email: nu consumam baterie pe SMTP - --dry-run si --force; credentialele UPS pot veni din /etc/nut/ups-shutdown.conf in loc sa fie in script ups-shutdown-test.sh nu mai duplica logica: invoca scriptul real cu --dry-run. Un test cu cod propriu testeaza altceva decat ce ruleaza in realitate. Testat pe pvemini prin lantul complet: sudo -u nut sudo /usr/local/bin/ups-shutdown-cluster.sh --dry-run --force Descopera corect toate cele 11 guest-uri, inclusiv cele de pe pve1 (deci SSH-ul merge), si gaseste shutdown.stayoff pe UPS. RAMANE DE VERIFICAT FIZIC: ups.load e 8%, putin pentru trei servere. Daca pve1 si pveelite nu sunt alimentate din UPS, mor instant la pana si toata orchestrarea e decorativa. Nu se poate verifica din software. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01RRyaDj39hPQ89SZS6URRpS
34 lines
1.1 KiB
Bash
Executable File
34 lines
1.1 KiB
Bash
Executable File
#!/bin/bash
|
|
#
|
|
# ups-shutdown-test.sh — rulează procedura reală de shutdown UPS în gol.
|
|
#
|
|
# Nu duplică logica: invocă exact scriptul care rulează la o pană de curent,
|
|
# cu --dry-run. Asta e tot rostul lui — dacă testul ar avea cod propriu, ar
|
|
# testa altceva decât ce se execută în realitate.
|
|
#
|
|
# Utilizare:
|
|
# ups-shutdown-test.sh # ca root
|
|
# sudo -u nut sudo /usr/local/bin/ups-shutdown-test.sh # verifică și lanțul de permisiuni
|
|
#
|
|
set -uo pipefail
|
|
|
|
SCRIPT=/usr/local/bin/ups-shutdown-cluster.sh
|
|
|
|
if [[ ! -x "$SCRIPT" ]]; then
|
|
echo "EROARE: $SCRIPT lipsește sau nu e executabil." >&2
|
|
exit 1
|
|
fi
|
|
|
|
if [[ "$(id -u)" != "0" ]]; then
|
|
echo "EROARE: rulează ca $(id -un), nu ca root." >&2
|
|
echo " La o pană reală, upssched rulează ca 'nut' și invocă scriptul prin sudo." >&2
|
|
echo " Testează lanțul complet cu: sudo -u nut sudo $SCRIPT --dry-run --force" >&2
|
|
exit 1
|
|
fi
|
|
|
|
echo "=== Test în gol al procedurii de shutdown UPS ==="
|
|
echo "Nu se oprește nimic. --force ocolește verificarea că UPS-ul e pe baterie."
|
|
echo
|
|
|
|
exec "$SCRIPT" --dry-run --force "$@"
|