--- title: "Cactus Needle - The 26M Function Calling Model" url: https://youtu.be/tt9UJ0NiOzU duration: 14:29 tags: [@work, @growth] date: 2026-07-12 --- ## TL;DR Cactus a lansat **Needle** — un model open source de doar **26 milioane de parametri** specializat exclusiv pe function calling (tool calling), distilat din Gemini 3.1 Flash Lite. Arhitectură neobișnuită: doar attention + gating, **fără layere FFN/MLP** (acolo unde modelele mari stochează "cunoștințele generale") — de asta e atât de mic, dar tot performant pe apeluri de tool single-shot. Bate modele de 10-20x mai mari (Function Gemma, IBM Granite, Qwen 600M) pe single-shot function calling. Rulează pe CPU, ~1200 tokens/sec pe device consumer, se poate fine-tune și fără GPU. Nu are "inteligență" generală — nu ține de raționament complex sau multi-tool, dar pentru task-uri simple (on/off, seteaza timer, trimite email, control smart home) merge foarte bine. ## Insights - **Idee cheie**: tool calling = retrieval + assembly (potrivire query→nume funcție + extragere argumente în JSON), nu necesită raționament greu → nu ai nevoie de model mare pentru asta. @growth - **Aplicabilitate potențială pt Echo/ROA**: pentru comenzi simple repetitive (ex: rutare intent-uri Discord/Telegram/WhatsApp, clasificare "ce vrea userul" înainte de a apela un model mare) — un model mic dedicat de tool-routing ar putea reduce costul/latența, cu fallback la model mare pt cazuri complexe (cascadă). @work - Demo arată că merge bine și pe seturi de funcții custom (smart home) fără fine-tuning, doar cu descrieri bune ale funcțiilor — sugerează că **calitatea descrierilor tool-urilor contează mult** mai mult decât mărimea modelului pentru cazuri simple. @work - Model gratuit, repo pe GitHub + Hugging Face, fine-tuning posibil doar cu CPU + cheie Gemini pentru generare dataset sintetic. Linkuri: https://youtu.be/tt9UJ0NiOzU