Files
echo-core/memory/kb/youtube/2026-09-01_never-run-out-of-claude-code-tokens.md

3.2 KiB

Paste This Into Claude Code, Never Run Out Of Tokens Again

Sursa: https://youtu.be/kHtOSJRUkLs?si=FwT-zVeNfVrlqUjj Data: 2026-09-01 Format: Video (~19:47 min) Tags: @work @growth @scout


TL;DR

Video despre de ce Claude Code "termină" limita de utilizare mult mai repede decât ar sugera cât ai scris tu efectiv — autorul zice că doar 0.01% din consum vine din input-ul propriu. Motivul: fiecare mesaj retrimite TOT istoricul conversației de la zero (modelele n-au memorie), deci un fișier de 3000 tokens citit la turul 4 dintr-o sesiune de 40 de tururi nu costă 3000 tokens, costă de 37 de ori mai mult pentru că e retrimis la fiecare tur următor. Video-ul oferă un prompt de audit de lipit în Claude Code (măsoară, nu estimează) + 7 fix-uri pentru reducerea consumului: clear între joburi diferite, nu schimba modelul mid-session (resetează cache-ul), filtrează output masiv de la tool-uri, dezactivează servere MCP nefolosite, subagenți (uneori economisesc, uneori nu), alege modelul corect de la început, și capcana task-urilor programate care rulează peste noapte fără cache cald.

Puncte cheie

  • Compounding: fiecare "enter" retrimite toată conversația de sus — mesajul 20 include costul complet al istoricului precedent, nu doar ce ai scris acum.
  • Fix 1 — Clear între joburi: context nefolosit de la un job vechi rămâne "plătit" la fiecare tur ulterior dacă nu faci /clear.
  • Fix 2 — Nu schimba modelul mid-sesiune: orice switch de model reconstruiește tot cache-ul (prompt caching se pierde).
  • Fix 3 — Filtrează output masiv de tool-uri: output brut de test/build necurățat ajunge verbatim în context și se retrimite tot restul sesiunii — recomandă hooks PreToolUse care rescriu comenzi zgomotoase.
  • Fix 4 — Dezactivează servere MCP nefolosite: fiecare tool expus de un MCP server costă tokens la fiecare tur; verifică dacă tool deferral e activ (un proxy/gateway — ANTHROPIC_BASE_URL etc. — poate dezactiva silențios deferral-ul).
  • Subagenți: uneori economisesc tokens (izolează context), uneori risipesc — depinde de task.
  • Capcana task-urilor programate (cron): dacă intervalul unui job programat e mai lung decât durata de viață a cache-ului de prompt, fiecare rulare ratează cache-ul → cost dublat silențios peste noapte. Relevant direct pentru cron-urile Echo Core.
  • Promptul de audit (inclus în transcript, disponibil la cerere) verifică: mărimea CLAUDE.md-urilor (flag >5k tokens/fișier, >10k total), servere MCP + tool deferral, modelul curent și dacă se schimbă automat, hooks PreToolUse existente, modelul fiecărui subagent (explicit vs. moștenit), intervalele joburilor programate vs. durata cache-ului, și un breakdown cache_read/cache_creation/input/output tokens din ultimul session log.

Relevanță pentru Echo Core

Punctul cu task-urile programate + cache lifetime e direct aplicabil — Echo are destule cron jobs (morning-report, heartbeat, anaf-monitor etc.). Ar merita rulat promptul de audit din video pe repo-ul echo-core ca să vedem dacă vreun job programat ratează sistematic cache-ul.

Transcrierea

Transcript complet disponibil via tools/youtube_subs.py (nu reprodus aici pentru lungime).