Merge branch 'master' of ssh://gitea.romfast.ro:222/romfast/ROMFASTSQL

This commit is contained in:
Marius
2026-08-24 13:53:58 +03:00

View File

@@ -106,6 +106,42 @@ ssh root@10.0.20.202 "ssh -p 22122 romfast@10.0.20.37 \
**Zgomot preexistent, fără legătură cu incidentul:** la fiecare boot apar `VSS 8213` + `SCM 7023` pentru `OracleVssWriterROA` („General access denied"). Serviciul VSS writer al Oracle nu are drepturi suficiente. Nu afectează restore-ul RMAN (care nu folosește VSS) — de rezolvat separat. **Zgomot preexistent, fără legătură cu incidentul:** la fiecare boot apar `VSS 8213` + `SCM 7023` pentru `OracleVssWriterROA` („General access denied"). Serviciul VSS writer al Oracle nu are drepturi suficiente. Nu afectează restore-ul RMAN (care nu folosește VSS) — de rezolvat separat.
## 🩹 Blocaj de boot pre-OS pe VM 109 — incident 2026-08-22
**Simptom:** testul DR din 2026-08-22 a raportat `FAILED` — `NFS: Not Mounted`, `Restore failed` după 12s, `Tables restored: 0`, plus warning „Servicing guard skipped: check_servicing.ps1 missing or unreachable". Log-ul bash arată VM Startup 304s (fața de 25-38s normal), timeout la 180s de așteptare SSH, apoi `ssh: connect to host 10.0.20.37 port 22122: No route to host` la STEP 4.
**Investigație:**
- **Host-side curat**: `journalctl` pe pveelite arată VM 109 pornit normal la 06:00:18 (`hastart` OK, `tap109i0` up, `forwarding state`), cluster quorate, memorie disponibilă. Nicio problemă Proxmox/rețea.
- **CPU consumat în cele ~6 minute: doar 1min25s** — mult sub un boot Windows normal. VM-ul rula, dar nu făcea nimic util.
- **Zero evenimente în System log** pentru fereastra 05:50–07:35 — nici măcar `Kernel-General 12` („OS started"). Windows nu a apucat să inițializeze event log service-ul.
- Repornire manuală de verificare (cu `vm109-debug.flag`): boot normal, SSH OK în ~90s. **Nu e reproductibil la comandă** — deci intermitent.
- `fsutil dirty query C:` → not dirty. Nu e corupție de filesystem.
- Referința „previous shutdown was unexpected" din event log a rămas blocată la 2026-08-17 — confirmă că boot-ul eșuat din 08-22 nu a ajuns niciodată suficient de departe cât să-și înregistreze propriul shutdown.
**Concluzie:** blocaj la nivel de firmware/bootloader (UEFI OVMF, înainte ca Windows să pornească), nu problemă de Windows Update/servicing (guard-ul a fost sărit corect, fiindcă VM-ul nu a ajuns niciodată acolo) și nu problemă de backup — un test de restore manual rulat imediat după (119 backup-uri, RMAN restore complet, `DB_NAME: ROA, OPEN_MODE: READ WRITE`, 44636 tabele) a confirmat că datele și pipeline-ul de restore sunt intacte.
**Măsură aplicată (2026-08-22):** consolă serial adăugată pe VM 109, ca să putem prinde live ecranul exact în momentul blocajului dacă se repetă.
```bash
ssh root@10.0.20.202 "qm set 109 -serial0 socket"
```
Plus EMS activat în guest (trimite mesajele Boot Manager/OS Loader pe COM1), rulat o singură dată cât VM-ul era pornit pentru verificare:
```powershell
bcdedit /ems "{current}" on
bcdedit /emssettings EMSPORT:1 EMSBAUDRATE:115200
```
**Verificare/atașare live data viitoare când se întâmplă:**
```bash
ssh root@10.0.20.202 "qm terminal 109"
```
**Status:** neconfirmat dacă se repetă — de urmărit la testele DR următoare (sâmbătă). Dacă reapare, consola serial ar trebui să arate exact unde rămâne blocat (Boot Manager vs. OS Loader vs. altceva la nivel OVMF).
--- ---
# 🛡️ Oracle DR System - Complete Architecture # 🛡️ Oracle DR System - Complete Architecture
@@ -391,6 +427,7 @@ ssh root@10.0.20.202 'crontab -l | grep -E "dr-test|patch-window|watchdog"'
|---|---| |---|---|
| `Restore failed` în < 60s, **fără log RMAN**, `Broken pipe` în log-ul bash | Nu e problemă de backup — sesiunea SSH a murit. Vezi [Windows Update pe VM 109](#-windows-update-pe-vm-109--incident-2026-08-08). Verifică `SCM 7034 sshd` în Event Log-ul guest-ului. | | `Restore failed` în < 60s, **fără log RMAN**, `Broken pipe` în log-ul bash | Nu e problemă de backup — sesiunea SSH a murit. Vezi [Windows Update pe VM 109](#-windows-update-pe-vm-109--incident-2026-08-08). Verifică `SCM 7034 sshd` în Event Log-ul guest-ului. |
| `ABORTED - Windows servicing` | Guard-ul STEP 3b a oprit testul intenționat: Windows Update era activ. Backup-urile nu sunt implicate. Rulează fereastra de patching manual. | | `ABORTED - Windows servicing` | Guard-ul STEP 3b a oprit testul intenționat: Windows Update era activ. Backup-urile nu sunt implicate. Rulează fereastra de patching manual. |
| `NFS: Not Mounted` + `No route to host` pe portul 22122 + VM Startup >180s | VM-ul nu a bootat deloc (blocaj pre-OS). Vezi [Blocaj de boot pre-OS](#-blocaj-de-boot-pre-os-pe-vm-109--incident-2026-08-22). Verifică `qm terminal 109` la următorul test. |
| `Restore failed` după 10+ minute, cu log RMAN | Problemă reală de restore — continuă cu secțiunile de mai jos. | | `Restore failed` după 10+ minute, cu log RMAN | Problemă reală de restore — continuă cu secțiunile de mai jos. |
### 🔍 Debugging Restore Tests ### 🔍 Debugging Restore Tests
@@ -741,6 +778,9 @@ vm109-windows-dr/
## 📋 Changelog ## 📋 Changelog
### v2.3 (Aug 22, 2026)
- 🐛 **Boot hang pre-OS**: consolă serial (`serial0: socket`) + EMS activat în guest pentru diagnostic live la următorul blocaj de boot. Vezi [incident 2026-08-22](#-blocaj-de-boot-pre-os-pe-vm-109--incident-2026-08-22).
### v2.2 (Oct 31, 2025) ### v2.2 (Oct 31, 2025)
- ✨ **Unified transfer script**: Replaced `transfer_to_dr.ps1` and `transfer_incremental.ps1` with single `transfer_backups.ps1` - ✨ **Unified transfer script**: Replaced `transfer_to_dr.ps1` and `transfer_incremental.ps1` with single `transfer_backups.ps1`
- 🎯 **Smart duplicate detection**: Automatically skips files that exist on DR - 🎯 **Smart duplicate detection**: Automatically skips files that exist on DR