Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_01SiJGsZVSEGjRHZEJiXaxCC
3.2 KiB
Paste This Into Claude Code, Never Run Out Of Tokens Again
Sursa: https://youtu.be/kHtOSJRUkLs?si=FwT-zVeNfVrlqUjj Data: 2026-09-01 Format: Video (~19:47 min) Tags: @work @growth @scout
TL;DR
Video despre de ce Claude Code "termină" limita de utilizare mult mai repede decât ar sugera cât ai scris tu efectiv — autorul zice că doar 0.01% din consum vine din input-ul propriu. Motivul: fiecare mesaj retrimite TOT istoricul conversației de la zero (modelele n-au memorie), deci un fișier de 3000 tokens citit la turul 4 dintr-o sesiune de 40 de tururi nu costă 3000 tokens, costă de 37 de ori mai mult pentru că e retrimis la fiecare tur următor. Video-ul oferă un prompt de audit de lipit în Claude Code (măsoară, nu estimează) + 7 fix-uri pentru reducerea consumului: clear între joburi diferite, nu schimba modelul mid-session (resetează cache-ul), filtrează output masiv de la tool-uri, dezactivează servere MCP nefolosite, subagenți (uneori economisesc, uneori nu), alege modelul corect de la început, și capcana task-urilor programate care rulează peste noapte fără cache cald.
Puncte cheie
- Compounding: fiecare "enter" retrimite toată conversația de sus — mesajul 20 include costul complet al istoricului precedent, nu doar ce ai scris acum.
- Fix 1 — Clear între joburi: context nefolosit de la un job vechi rămâne "plătit" la fiecare tur ulterior dacă nu faci
/clear. - Fix 2 — Nu schimba modelul mid-sesiune: orice switch de model reconstruiește tot cache-ul (prompt caching se pierde).
- Fix 3 — Filtrează output masiv de tool-uri: output brut de test/build necurățat ajunge verbatim în context și se retrimite tot restul sesiunii — recomandă hooks PreToolUse care rescriu comenzi zgomotoase.
- Fix 4 — Dezactivează servere MCP nefolosite: fiecare tool expus de un MCP server costă tokens la fiecare tur; verifică dacă tool deferral e activ (un proxy/gateway — ANTHROPIC_BASE_URL etc. — poate dezactiva silențios deferral-ul).
- Subagenți: uneori economisesc tokens (izolează context), uneori risipesc — depinde de task.
- Capcana task-urilor programate (cron): dacă intervalul unui job programat e mai lung decât durata de viață a cache-ului de prompt, fiecare rulare ratează cache-ul → cost dublat silențios peste noapte. Relevant direct pentru cron-urile Echo Core.
- Promptul de audit (inclus în transcript, disponibil la cerere) verifică: mărimea CLAUDE.md-urilor (flag >5k tokens/fișier, >10k total), servere MCP + tool deferral, modelul curent și dacă se schimbă automat, hooks PreToolUse existente, modelul fiecărui subagent (explicit vs. moștenit), intervalele joburilor programate vs. durata cache-ului, și un breakdown cache_read/cache_creation/input/output tokens din ultimul session log.
Relevanță pentru Echo Core
Punctul cu task-urile programate + cache lifetime e direct aplicabil — Echo are destule cron jobs (morning-report, heartbeat, anaf-monitor etc.). Ar merita rulat promptul de audit din video pe repo-ul echo-core ca să vedem dacă vreun job programat ratează sistematic cache-ul.
Transcrierea
Transcript complet disponibil via tools/youtube_subs.py (nu reprodus aici pentru lungime).