docs(lxc110): incident DNS/OOM 2026-07-31 + zram pe pve1 + limite TTS
LXC 110 (moltbot) a picat dupa un OOM local containerului urmat de reboot: tailscaled a ramas delogat, iar containerul mostenea resolv.conf-ul Tailscale de la host-ul pve1 (doar MagicDNS 100.100.100.100) -> rezolutie DNS zero desi L3 era functional -> echo-core in crash-loop pe telegram.error.TimedOut. Fixuri aplicate: - pct set 110 --nameserver '10.0.20.1 1.1.1.1' (elimina dependenta de Tailscale) - zram-tools pe pve1 (8G zstd, prio 100) - `swap: 4096` din config era fictiv, host-ul nu avea niciun swap; root pe ZFS deci zram, nu swapfile - MemoryHigh/MemoryMax pe pocket-tts + supertonic-tts - toate serviciile user rulau cu limite `infinity`, de unde OOM-uri recurente (Apr 25, May 28 x4) cu victime aleatorii alese dupa oom_score_adj Documentatie: - nou post-mortem in cluster/incidents/, adaugat in indexuri - README lxc110: host corectat pveelite -> pve1 (+ RAM/CPU/storage reale), comenzile pct redirectionate spre nodul corect - README lxc171: tabel cu starea swap pe cele 3 noduri (pveelite are zvol, nu zram - nu necesita acelasi fix) Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -214,6 +214,18 @@ zramctl; swapon --show # verificare: /dev/zram0 8G zstd
|
||||
Acum cei 8GB `swap` din configul LXC 171 au backing real → vârfurile tranzitorii fac
|
||||
swap-out în loc de OOM-kill instant.
|
||||
|
||||
> **Același fix aplicat pe pve1 în 2026-07-31** (aceeași cauză: LXC 110 moltbot cu
|
||||
> `swap: 4096` fictiv → OOM-kill în cgroup + reboot). Config identic, `SIZE=8192`.
|
||||
> Vezi `../cluster/incidents/2026-07-31-lxc110-dns-tailscale-oom.md`.
|
||||
|
||||
**Stare swap pe cluster (2026-07-31):**
|
||||
|
||||
| Nod | Swap | Tip |
|
||||
|-----|------|-----|
|
||||
| pvemini | 8G | zram0 (zstd, prio 100) |
|
||||
| pve1 | 8G | zram0 (zstd, prio 100) |
|
||||
| pveelite | 8G | zvol `/dev/zd64` (prio -2) — swap real, nu necesită zram |
|
||||
|
||||
### Fix 2 — reaping orfane (`scripts/reap-orphans.sh`, cron în 171)
|
||||
|
||||
Script conservator care rulează ca root **în interiorul containerului**, la fiecare 6 ore:
|
||||
|
||||
Reference in New Issue
Block a user