docs: infrastructura din dashboard si /infra, acces agenti pe statia de birou si 10.0.20.36

Lantul de pornire nou: JuiceSSH -> 10.0.20.36 -> C:\wolcluster.bat. Cheia moltbot
in docs/chei-publice.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01KddsXCqEbKMhdFJDYbAsx8
This commit is contained in:
Claude Agent
2026-09-13 10:19:06 +00:00
parent c87fa06b55
commit ab9dbef998
6 changed files with 186 additions and 1 deletions

View File

@@ -8,6 +8,51 @@ mutare rack, mentenanță UPS, intervenții la switch.
**Autor:** Claude Code · **Ultima verificare pe cluster live:** 2026-08-29
---
## Varianta cea mai rapidă — din dashboard sau Discord `/infra`
De preferat variantei de mai jos (stație de admin), pentru o oprire/pornire
simplă, fără lucrări la insula `10.10.10.0/24` sau la switch:
1. **Oprire:** tab Infrastructură → *Oprește* (sau Discord `/infra
actiune:oprire`, confirmare). Rulează `cluster-shutdown.sh --allow-on-node
--yes` pe **pvemini**, lansat detașat prin `systemd-run` (vezi
[dashboard/README.md § Tab Infrastructură](../../lxc171-claude-agent/discord-bridge/dashboard/README.md#tab-infrastructur%C4%83)).
CT 171 (claude-agent) **rămâne pornit** — moare odată cu pvemini la
poweroff, iar `ha: shutdown_policy=freeze` îl repornește la revenirea
nodului. La final se postează (și se încearcă fixarea) în Discord un mesaj
cu instrucțiunile de pornire de mai jos + un email către
`mmarius28@gmail.com`.
2. **Pornire, când revine curentul:**
- JuiceSSH (prin Tailscale) → `10.0.20.36:22122` → rulează `C:\wolcluster.bat`
(vezi [docs/acces-agenti-windows-birou-server36.md](../../../docs/acces-agenti-windows-birou-server36.md)
pentru accesul pe .36 și alias-ul ssh `oracle-prod-admin` folosit și de
acțiunea `wol` din dashboard).
- Așteaptă mesajul „Cluster sus" în Discord (postat automat de
`infra_boot_check` când clusterul are iar cvorum, dar crontab-ul e încă
în mentenanță).
- Apasă *Pornește guest-urile* (buton pe mesajul din Discord, sau tab
Infrastructură → *Pornește*) — rulează `cluster-startup.sh
--allow-on-node --yes` pe pvemini.
3. **Dacă CT 171 nu revine** (dashboard/bot nu mai răspund după poweroff):
`ssh root@10.0.20.201 /opt/scripts/cluster-startup.sh --allow-on-node --yes`
4. **Fallback dacă WoL nu merge:** `wolmarius.bat` (de pe .36) trezește
stația de birou, apoi `wake-cluster.ps1` de acolo.
`cluster-shutdown.sh`/`cluster-startup.sh` au acum flag-ul `--allow-on-node`,
care le permite să ruleze *pe* un nod (pvemini) în loc de pe stația de admin —
guard-ul care le blochează pe un nod Proxmox e condiționat de acest flag; CT
171 rămâne exclus din lista de oprire explicită (`KEEP_RUNNING=171`) și din
verificările de la pasul 7/8. Restul procedurii (varianta de pe stația de
admin, PowerShell/Bash, fără `--allow-on-node`) rămâne valabilă neschimbată —
vezi mai jos.
tmux e acum instalat pe toate cele 3 noduri, pentru rulări manuale lungi din
consolă (nu e folosit de `--allow-on-node`, care lansează prin `systemd-run`).
---
> **Atenție, s-a schimbat ceva important pe 2026-08-29.** Clusterul are acum o rețea
> dedicată, `10.10.10.0/24` („insula"), pe un switch separat — vezi
> [switch 2.5G dedicat nodurilor](switch-2.5g-dedicat-noduri.md). De ea atârnă