2.7 KiB
I Cut My OpenCode Token Usage by 96% - Here's How
URL: https://youtu.be/FX7jcd3GYtI Durata: 9:42 Data salvat: 2026-07-10 Tags: @work @growth @ai @agents @llm
TL;DR
Autorul folosește un proxy man-in-the-middle pentru a vedea exact ce trimite OpenCode (agent de coding AI) către LLM la un simplu "hello" — și găsește 8.000 de tokeni: system prompt de 9.500 caractere + 11 definiții de tool-uri (bash, task, edit, read etc.) trimise la FIECARE request, plus un al doilea apel LLM ascuns doar pentru titlul conversației. Soluția: creează un agent custom minimal (fără tools, system prompt scurt) → 300-500 tokeni, reducere ~90-96%. Recomandare: pornește minimal, adaugă tools doar când chiar ai nevoie de ele.
Puncte cheie
- 8.000 tokeni pentru "hello" — 0,025% e mesajul propriu-zis, restul e scaffolding (system prompt + tool definitions)
- OpenCode face 2 apeluri LLM per mesaj: unul ascuns doar ca să genereze titlul conversației (~2.000 tokeni, pt un titlu de 1 cuvânt)
- System prompt default: ~114 linii, spune LLM-ului tot ce poate/nu poate face, format, emoji, etc.
- 11 tool definitions trimise mereu — bash tool singur = 4.700 caractere, task tool = 3.000 caractere
- Cache-ul providerului NU te ajută pe tine — reduce costul $ pentru provider, dar tot trimiți full payload pe rețea, tot consumi context window și latență
- Soluție: agenți custom minimali (folder
.opencode/agents/*.md) cu system prompt scurt și zero/puține tools, setați caprimary— switch cu Tab între agent complet (build) și agent lean - Trade-off: agentul lean nu are task/sub-agents, web fetch, etc. — dar poți adăuga selectiv doar ce ai nevoie
- Filosofie: start minimal, expand when necessary — nu monta toate tool-urile/MCP-urile by default
Quote-uri relevante
"8,000 tokens. That's what it cost me to say hello to an AI coding agent."
"Cached tokens are a cost optimization for the provider, not you. For you, it's still 8,000 tokens of latency and context window usage."
"Start minimal and expand when necessary."
Idei acționabile pentru Marius
- Relevant pentru Claude Code / echo-core: verifică dacă subagenții custom (
Agenttool) pot fi definiți cu scope minim (fără tool-uri inutile) pentru task-uri simple, ca să reduci tokeni pe apelurile dese (heartbeat, routine checks) @work - Ideea de "agent lean vs agent complet, switch la nevoie" se mapează pe strategia ta Haiku/Sonnet din AGENTS.md — poate merită un al treilea nivel: agent minimal fără tools pentru întrebări simple @growth
Surse menționate
- Repo GitHub cu scriptul proxy + config agent (menționat, link nu apare explicit în transcript)