Plafonul general saptamanal Max 5x se consuma in ~2 zile, urmate de ~5 zile blocate. Masurat pe 3 masini (Windows, claude-agent, moltbot), 2026-07-29 -> 2026-09-01: 11,15 miliarde tokeni, 435 sesiuni, 64.211 cereri API, dedup pe message.id + requestId. Deficit +32% (~570 prompturi/saptamana). Concluzia nu e cea asteptata: bugetele plafonate in dolari (OpenCode Zen $20, OpenCode Go) se evapora la acest volum -- Go a tinut 1-2 zile in practica. Planurile Z.AI se contorizeaza in prompturi, nu in dolari, si rezista la un workload cu 7,1 cereri API per prompt. Z.AI Coding Lite ($18/luna) acopera 70% din deficit; Pro ($72) il acopera integral. Verificat empiric ca subagentii nu pot rula pe GLM (in proces, moștenesc auth), dar sesiunile separate pot: endpoint fals local a primit cererea cu tokenul alternativ, fara sa atinga OAuth-ul Max. Masurat: ~186MB RSS si 20-60s pornire per sesiune -- de aici regulile de orchestrare (sarcini mari, max 4 procese, fan-out in interiorul unei sesiuni GLM). Ramane neverificat multiplicatorul de credite pentru GLM-5.3-Flash; la 3x in loc de 1x, Lite pica si decizia se muta pe Pro. - docs/supliment-glm-zai.md: rezumat de implementare (indexat in CLAUDE.md) - claude_usage_report.md + CSV-uri: analiza completa si datele brute - tools/claude_usage_*.py: pipeline de masurare read-only, re-rulabil remote - tools/claude-glm.sh: wrapper de sesiune GLM (task/resume/shell) Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01Q4uzvgm7AyJch5WH8QHRhY
5.7 KiB
Supliment GLM (Z.AI) pentru plafonul săptămânal Claude Max 5x
Analiză: 2026-09-01. Decizie: neimplementată.
Date brute și metodologie completă: claude_usage_report.md,
claude_usage_sessions.csv, claude_usage_summary.csv.
Problema
Max 5x are două plafoane săptămânale: unul general și unul separat pentru Opus. Se atinge cel general — cota se consumă în ~2 zile, urmează ~5 zile blocate.
Semnătura în date, săptămâna 2026-W33 (M tokeni):
| Lu | Ma | Mi | Jo | Vi | Sâ | Du |
|---|---|---|---|---|---|---|
| 655 | 229 | 40 | 8 | 1 | 1 | 1 |
Cifrele care contează
Măsurat pe 3 mașini (Windows LENOVO-AIO-BIRO 95,5%, claude-agent 2,7%, moltbot 1,7%),
2026-07-29 → 2026-09-01, 435 sesiuni, 64.211 cereri API, dedup pe message.id+requestId.
| Metrică | Valoare |
|---|---|
| Total tokeni | 11,15 miliarde |
| Cache read (din total) | 97,2% |
| Opus 5 / Sonnet 5 | 38,3% / 60,2% |
| Livrat de Max 5x | 2,23B / săptămână |
| Zile blocate | 10 din 34 (29%) |
| Deficit | +32% ≈ ~570 prompturi/săpt. |
| Prompturi umane reale | ~9.000 (~1.801/săpt.), 7,14 cereri API per prompt |
Valoarea abonamentului Max: aceiași tokeni, fiecare model la tariful lui pe OpenCode Zen, ar costa $5.167/lună. Max 5x la $100 e de ~52× mai ieftin. Nu se atinge.
Ce acoperă deficitul
| Opțiune | Cost/lună | Acoperă deficitul | Verdict |
|---|---|---|---|
| OpenCode Zen $20 (per-token) | $20 | 10,5% din volum total | nu — plafon în dolari |
| OpenCode Go | $10 | plafon $30/săpt. → 0,3 zile | testat, s-a consumat în 1–2 zile |
| Z.AI Coding Lite | $18 (anual $12,60) | 70% → ~0,6 zile blocate | de aici se începe |
| Z.AI Coding Pro | $72 (anual $50,40) | 351% → 0 zile blocate | dacă Lite nu ajunge |
| Z.AI Coding Max | $160 (anual $112) | 1403% | supradimensionat |
Planurile Z.AI se contorizează în prompturi, nu în dolari de consum — de asta rezistă la un workload cu 7,1 cereri API per prompt, spre deosebire de Zen/Go.
Necunoscută care schimbă decizia: multiplicatorul de credite pentru GLM-5.3-Flash. Z.AI documentează 3× în orele de vârf pentru modelele mari. Flash e modelul mic, deci probabil 1× — dar dacă nu, cei ~400 prompturi/săpt. ai lui Lite devin ~133 și Lite pică. De verificat înainte de a plăti.
Prețuri verificate 2026-09-01: docs.z.ai/devpack/overview, opencode.ai/docs/zen, opencode.ai/docs/go. GLM-5.3 nu e listat încă pe OpenCode Zen; s-a folosit tariful Z.AI ca proxy.
Mecanismul — ce s-a verificat empiric
| Întrebare | Răspuns | Cum s-a verificat |
|---|---|---|
Subagenți (tool Agent) pe GLM? |
NU | rulează în proces, moștenesc auth; model acceptă doar sonnet/opus/haiku/fable |
| Sesiuni separate pe GLM? | DA | endpoint fals local: cererea a plecat cu Bearer zai-… pe glm-5.3-flash, nu spre Anthropic |
| Sesiunea părinte e afectată? | NU | variabilele de mediu sunt per-proces |
| Predare de sesiune? | DA | --output-format json → session_id, apoi --resume cu același env |
| Paralelism? | DA | 3 sesiuni simultane, curat |
| Cost pornire proces | ~20–60s | măsurat |
| Memorie per sesiune | ~186MB RSS | măsurat |
Z.AI e singurul provider cu endpoint compatibil Anthropic (https://api.z.ai/api/anthropic),
deci singurul drop-in pentru Claude Code.
Implementare
- Cheia:
~/.config/zai/key,chmod 600. Nu în linia de comandă (ajunge înhistoryșips). - Wrapper:
tools/claude-glm.sh—task/resume/shell. Setează[1m]pe model (altfel Claude Code presupune 200k și compactează devreme),--autocompact 250000, șiCLAUDE_CONFIG_DIR=~/.claude-glmseparat, ca transcripturile GLM să nu strice statistica de consum. - Reguli de orchestrare în
CLAUDE.md— vezi mai jos. - Măsurare după: re-rulează
tools/claude_usage_extract.pype ambele config dir-uri și compară deficitul. Fără asta nu știi dacă a funcționat.
Reguli de orchestrare (de pus în CLAUDE.md la implementare)
- Agenți Sonnet (tool
Agent): judecată, cod critic, nevoie de contextul sesiunii. Consumă Max. - Agenți GLM (
Bash: tools/claude-glm.sh task "..."): sarcini mari, delimitate, verificabile mecanic — implementare după spec, teste, refactorizări repetitive. Nu consumă Max. - Minimum ~10 min de lucru per lansare GLM; sub asta pornirea domină.
- Maximum 4 procese GLM simultane (186MB fiecare; cgroup-ul LXC 171 are istoric de OOM).
- Pentru fan-out larg: un singur proces GLM căruia îi ceri să folosească subagenți — ei moștenesc GLM. Nu multiplica procesele din orchestrator.
- Briefing complet în prompt: agentul GLM nu vede contextul orchestratorului.
- Verifică mecanic rezultatul. Flash e modelul mic; rulează testele, nu accepta raportul lui.
Rezerve
- Orchestrarea rămâne pe Max. Fiecare lansare și citire de rezultat consumă cotă Opus. Câștigul e proporțional cu autonomia sarcinilor date lui GLM.
- Deficitul de +32% e conservator — presupune ritm median în zilele blocate, nu ritmul zilelor bune (peste 850M). Cererea suprimată reală e probabil mai mare.
claude-agentare doar 5 zile din 35 cu transcripturi păstrate (retenție + recreare director pe 2026-08-30). Nu s-a extrapolat.- Prompturile de pe Windows sunt estimate din raportul 7,14 măsurat pe Linux — singura extrapolare din analiză.
- Promoția Flash expiră 2026-09-09; tarifele per-token se dublează (irelevant dacă se merge pe abonament).