# Paste This Into Claude Code, Never Run Out Of Tokens Again **Sursa:** https://youtu.be/kHtOSJRUkLs?si=FwT-zVeNfVrlqUjj **Data:** 2026-09-01 **Format:** Video (~19:47 min) **Tags:** @work @growth @scout --- ## TL;DR Video despre de ce Claude Code "termină" limita de utilizare mult mai repede decât ar sugera cât ai scris tu efectiv — autorul zice că doar 0.01% din consum vine din input-ul propriu. Motivul: fiecare mesaj retrimite TOT istoricul conversației de la zero (modelele n-au memorie), deci un fișier de 3000 tokens citit la turul 4 dintr-o sesiune de 40 de tururi nu costă 3000 tokens, costă de 37 de ori mai mult pentru că e retrimis la fiecare tur următor. Video-ul oferă un prompt de audit de lipit în Claude Code (măsoară, nu estimează) + 7 fix-uri pentru reducerea consumului: clear între joburi diferite, nu schimba modelul mid-session (resetează cache-ul), filtrează output masiv de la tool-uri, dezactivează servere MCP nefolosite, subagenți (uneori economisesc, uneori nu), alege modelul corect de la început, și capcana task-urilor programate care rulează peste noapte fără cache cald. ## Puncte cheie - **Compounding:** fiecare "enter" retrimite toată conversația de sus — mesajul 20 include costul complet al istoricului precedent, nu doar ce ai scris acum. - **Fix 1 — Clear între joburi:** context nefolosit de la un job vechi rămâne "plătit" la fiecare tur ulterior dacă nu faci `/clear`. - **Fix 2 — Nu schimba modelul mid-sesiune:** orice switch de model reconstruiește tot cache-ul (prompt caching se pierde). - **Fix 3 — Filtrează output masiv de tool-uri:** output brut de test/build necurățat ajunge verbatim în context și se retrimite tot restul sesiunii — recomandă hooks PreToolUse care rescriu comenzi zgomotoase. - **Fix 4 — Dezactivează servere MCP nefolosite:** fiecare tool expus de un MCP server costă tokens la fiecare tur; verifică dacă tool deferral e activ (un proxy/gateway — ANTHROPIC_BASE_URL etc. — poate dezactiva silențios deferral-ul). - **Subagenți:** uneori economisesc tokens (izolează context), uneori risipesc — depinde de task. - **Capcana task-urilor programate (cron):** dacă intervalul unui job programat e mai lung decât durata de viață a cache-ului de prompt, fiecare rulare ratează cache-ul → cost dublat silențios peste noapte. Relevant direct pentru cron-urile Echo Core. - **Promptul de audit** (inclus în transcript, disponibil la cerere) verifică: mărimea CLAUDE.md-urilor (flag >5k tokens/fișier, >10k total), servere MCP + tool deferral, modelul curent și dacă se schimbă automat, hooks PreToolUse existente, modelul fiecărui subagent (explicit vs. moștenit), intervalele joburilor programate vs. durata cache-ului, și un breakdown cache_read/cache_creation/input/output tokens din ultimul session log. --- ## Relevanță pentru Echo Core Punctul cu task-urile programate + cache lifetime e direct aplicabil — Echo are destule cron jobs (morning-report, heartbeat, anaf-monitor etc.). Ar merita rulat promptul de audit din video pe repo-ul echo-core ca să vedem dacă vreun job programat ratează sistematic cache-ul. ## Transcrierea Transcript complet disponibil via `tools/youtube_subs.py` (nu reprodus aici pentru lungime).