# Supliment GLM (Z.AI) pentru plafonul săptămânal Claude Max 5x **Analiză: 2026-09-01. Decizie: neimplementată.** Date brute și metodologie completă: [`claude_usage_report.md`](../claude_usage_report.md), `claude_usage_sessions.csv`, `claude_usage_summary.csv`. ## Problema Max 5x are două plafoane săptămânale: unul general și unul separat pentru Opus. Se atinge **cel general** — cota se consumă în ~2 zile, urmează ~5 zile blocate. Semnătura în date, săptămâna 2026-W33 (M tokeni): | Lu | Ma | Mi | Jo | Vi | Sâ | Du | |---:|---:|---:|---:|---:|---:|---:| | 655 | 229 | 40 | 8 | 1 | 1 | 1 | ## Cifrele care contează Măsurat pe 3 mașini (Windows `LENOVO-AIO-BIRO` 95,5%, `claude-agent` 2,7%, `moltbot` 1,7%), 2026-07-29 → 2026-09-01, 435 sesiuni, 64.211 cereri API, dedup pe `message.id`+`requestId`. | Metrică | Valoare | |---|---:| | Total tokeni | 11,15 miliarde | | Cache read (din total) | 97,2% | | Opus 5 / Sonnet 5 | 38,3% / 60,2% | | Livrat de Max 5x | 2,23B / săptămână | | Zile blocate | 10 din 34 (29%) | | **Deficit** | **+32% ≈ ~570 prompturi/săpt.** | | Prompturi umane reale | ~9.000 (~1.801/săpt.), 7,14 cereri API per prompt | **Valoarea abonamentului Max:** aceiași tokeni, fiecare model la tariful lui pe OpenCode Zen, ar costa **$5.167/lună**. Max 5x la $100 e de ~52× mai ieftin. Nu se atinge. ## Ce acoperă deficitul | Opțiune | Cost/lună | Acoperă deficitul | Verdict | |---|---:|---:|---| | OpenCode Zen $20 (per-token) | $20 | 10,5% din volum total | nu — plafon în dolari | | OpenCode Go | $10 | plafon $30/săpt. → 0,3 zile | testat, s-a consumat în 1–2 zile | | **Z.AI Coding Lite** | **$18** (anual $12,60) | **70%** → ~0,6 zile blocate | **de aici se începe** | | Z.AI Coding Pro | $72 (anual $50,40) | 351% → 0 zile blocate | dacă Lite nu ajunge | | Z.AI Coding Max | $160 (anual $112) | 1403% | supradimensionat | Planurile Z.AI se contorizează în **prompturi**, nu în dolari de consum — de asta rezistă la un workload cu 7,1 cereri API per prompt, spre deosebire de Zen/Go. **Necunoscută care schimbă decizia:** multiplicatorul de credite pentru GLM-5.3-Flash. Z.AI documentează 3× în orele de vârf pentru modelele mari. Flash e modelul mic, deci probabil 1× — dar dacă nu, cei ~400 prompturi/săpt. ai lui Lite devin ~133 și Lite pică. **De verificat înainte de a plăti.** Prețuri verificate 2026-09-01: [docs.z.ai/devpack/overview](https://docs.z.ai/devpack/overview), [opencode.ai/docs/zen](https://opencode.ai/docs/zen/), [opencode.ai/docs/go](https://opencode.ai/docs/go/). GLM-5.3 nu e listat încă pe OpenCode Zen; s-a folosit tariful Z.AI ca proxy. ## Mecanismul — ce s-a verificat empiric | Întrebare | Răspuns | Cum s-a verificat | |---|---|---| | Subagenți (tool `Agent`) pe GLM? | **NU** | rulează în proces, moștenesc auth; `model` acceptă doar sonnet/opus/haiku/fable | | Sesiuni separate pe GLM? | **DA** | endpoint fals local: cererea a plecat cu `Bearer zai-…` pe `glm-5.3-flash`, nu spre Anthropic | | Sesiunea părinte e afectată? | **NU** | variabilele de mediu sunt per-proces | | Predare de sesiune? | **DA** | `--output-format json` → `session_id`, apoi `--resume` cu același env | | Paralelism? | **DA** | 3 sesiuni simultane, curat | | Cost pornire proces | **~20–60s** | măsurat | | Memorie per sesiune | **~186MB RSS** | măsurat | Z.AI e singurul provider cu endpoint compatibil Anthropic (`https://api.z.ai/api/anthropic`), deci singurul drop-in pentru Claude Code. ## Implementare 1. **Cheia:** `~/.config/zai/key`, `chmod 600`. Nu în linia de comandă (ajunge în `history` și `ps`). 2. **Wrapper:** [`tools/claude-glm.sh`](../tools/claude-glm.sh) — `task` / `resume` / `shell`. Setează `[1m]` pe model (altfel Claude Code presupune 200k și compactează devreme), `--autocompact 250000`, și `CLAUDE_CONFIG_DIR=~/.claude-glm` separat, ca transcripturile GLM să nu strice statistica de consum. 3. **Reguli de orchestrare** în `CLAUDE.md` — vezi mai jos. 4. **Măsurare după:** re-rulează `tools/claude_usage_extract.py` pe ambele config dir-uri și compară deficitul. Fără asta nu știi dacă a funcționat. ### Reguli de orchestrare (de pus în CLAUDE.md la implementare) - **Agenți Sonnet** (tool `Agent`): judecată, cod critic, nevoie de contextul sesiunii. Consumă Max. - **Agenți GLM** (`Bash: tools/claude-glm.sh task "..."`): sarcini mari, delimitate, verificabile mecanic — implementare după spec, teste, refactorizări repetitive. Nu consumă Max. - Minimum ~10 min de lucru per lansare GLM; sub asta pornirea domină. - Maximum 4 procese GLM simultane (186MB fiecare; cgroup-ul LXC 171 are istoric de OOM). - Pentru fan-out larg: **un singur** proces GLM căruia îi ceri să folosească subagenți — ei moștenesc GLM. Nu multiplica procesele din orchestrator. - Briefing complet în prompt: agentul GLM nu vede contextul orchestratorului. - **Verifică mecanic rezultatul.** Flash e modelul mic; rulează testele, nu accepta raportul lui. ## Rezerve 1. **Orchestrarea rămâne pe Max.** Fiecare lansare și citire de rezultat consumă cotă Opus. Câștigul e proporțional cu autonomia sarcinilor date lui GLM. 2. **Deficitul de +32% e conservator** — presupune ritm median în zilele blocate, nu ritmul zilelor bune (peste 850M). Cererea suprimată reală e probabil mai mare. 3. **`claude-agent` are doar 5 zile din 35** cu transcripturi păstrate (retenție + recreare director pe 2026-08-30). Nu s-a extrapolat. 4. **Prompturile de pe Windows sunt estimate** din raportul 7,14 măsurat pe Linux — singura extrapolare din analiză. 5. **Promoția Flash expiră 2026-09-09**; tarifele per-token se dublează (irelevant dacă se merge pe abonament).