feat(retea): retea dedicata de cluster pe switch separat, vmbr0 mutat de pe USB
Replicarea, migrarea si backup-ul NFS trec acum pe o insula 10.10.10.0/24 (switch 1, fara gateway), iar vmbr0 a fost mutat de pe dongle-urile USB Realtek pe placile Intel onboard. Castigul nu e viteza. Masurat: replicarea mergea deja la 272 MB/s, adica ~95% din firul de 2.5G, iar criptarea SSH nu era limita. 10G e imposibil cat timp pve1 si pveelite au doar dongle-uri USB de 2.5G si niciun slot PCIe liber; placa X710 din pvemini e SFP+ cu cage-urile goale, iar switch-ul are doar porturi RJ45. Replicarea ruleaza si strict secvential (Replication.pm:138, un singur lock, fara fork), deci nici agregarea de linkuri nu ar ajuta. Castigul e ca IP-ul de cluster si corosync ring0 nu mai stau pe dongle-ul USB care a lasat pveelite invizibil 16 ore pe 2026-08-27 - fara sa fie nevoie de vreo modificare in corosync.conf, fiindca IP-urile au ramas aceleasi. Plus izolarea replicarii de productie, WoL persistat pe onboard, si o cale out-of-band catre noduri prin insula. Aplicat si verificat: cvorum pe 3 pe tot parcursul, 262-273 MB/s pe insula, job real de replicare confirmat cu numarare de octeti pe interfete (4959 KB pe insula vs 1553 KB pe productie), NFS activ si scriibil. Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01RJFQZcA7uerXRaL1NrsXpS
This commit is contained in:
@@ -870,7 +870,14 @@ swapon -a
|
||||
- **2026-04-20 Cluster Outage:** `incidents/2026-04-20-cluster-outage.md` — post-mortem complet + plan prevenție
|
||||
- **2026-04-30 pvemini backup SSD hang:** `incidents/2026-04-30-pvemini-backup-ssd-hang.md` — Kingston thermal hang → emergency mode
|
||||
- **2026-07-31 LXC 110 DNS + OOM:** `incidents/2026-07-31-lxc110-dns-tailscale-oom.md` — logout Tailscale → DNS mort; zram instalat pe pve1
|
||||
- **2026-08-27 pveelite fără rețea 16h:** `incidents/2026-08-27-pveelite-down.md` — resetul adaptorului USB LAN scoate interfața din `vmbr0` și nu o mai readaugă nimeni; mașina merge, dar e invizibilă. Fix: `ifreload -a`. De fond: mutarea pe `eno1`. Verificare: `scripts/verifica-pveelite.ps1`
|
||||
- **2026-08-27 pveelite fără rețea 16h:** `incidents/2026-08-27-pveelite-down.md` — resetul adaptorului USB LAN scoate interfața din `vmbr0` și nu o mai readaugă nimeni; mașina merge, dar e invizibilă. Fix: `ifreload -a`. **Reparație de fond aplicată pe 2026-08-29:** `vmbr0` a fost mutat pe `eno1` (Intel onboard) pe pve1 și pveelite — vezi `docs/switch-2.5g-dedicat-noduri.md`. Verificare: `scripts/verifica-pveelite.ps1`
|
||||
|
||||
### Rețea
|
||||
- **Rețea dedicată de cluster pe switch separat (aplicat 2026-08-29):**
|
||||
`docs/switch-2.5g-dedicat-noduri.md` — harta celor două switch-uri cu porturi și IP-uri,
|
||||
insula `10.10.10.0/24` pentru replicare/migrare/backup, mutarea lui `vmbr0` de pe dongle-urile
|
||||
USB pe plăcile Intel onboard, plus măsurătorile care arată că **nu mai există viteză de
|
||||
câștigat** (2.5G e plafon dur, replicarea rulează la 95% din fir)
|
||||
|
||||
### LXC Containers
|
||||
- **LXC 108 - Oracle Database:** `../lxc108-oracle/README.md`
|
||||
|
||||
Reference in New Issue
Block a user