Files
echo-core/memory/kb/youtube/2026-07-12_cactus-needle-26m-function-calling-model.md

1.9 KiB

title: "Cactus Needle - The 26M Function Calling Model" url: https://youtu.be/tt9UJ0NiOzU duration: 14:29 tags: [@work, @growth] date: 2026-07-12

TL;DR

Cactus a lansat Needle — un model open source de doar 26 milioane de parametri specializat exclusiv pe function calling (tool calling), distilat din Gemini 3.1 Flash Lite. Arhitectură neobișnuită: doar attention + gating, fără layere FFN/MLP (acolo unde modelele mari stochează "cunoștințele generale") — de asta e atât de mic, dar tot performant pe apeluri de tool single-shot. Bate modele de 10-20x mai mari (Function Gemma, IBM Granite, Qwen 600M) pe single-shot function calling. Rulează pe CPU, ~1200 tokens/sec pe device consumer, se poate fine-tune și fără GPU. Nu are "inteligență" generală — nu ține de raționament complex sau multi-tool, dar pentru task-uri simple (on/off, seteaza timer, trimite email, control smart home) merge foarte bine.

Insights

  • Idee cheie: tool calling = retrieval + assembly (potrivire query→nume funcție + extragere argumente în JSON), nu necesită raționament greu → nu ai nevoie de model mare pentru asta. @growth
  • Aplicabilitate potențială pt Echo/ROA: pentru comenzi simple repetitive (ex: rutare intent-uri Discord/Telegram/WhatsApp, clasificare "ce vrea userul" înainte de a apela un model mare) — un model mic dedicat de tool-routing ar putea reduce costul/latența, cu fallback la model mare pt cazuri complexe (cascadă). @work
  • Demo arată că merge bine și pe seturi de funcții custom (smart home) fără fine-tuning, doar cu descrieri bune ale funcțiilor — sugerează că calitatea descrierilor tool-urilor contează mult mai mult decât mărimea modelului pentru cazuri simple. @work
  • Model gratuit, repo pe GitHub + Hugging Face, fine-tuning posibil doar cu CPU + cheie Gemini pentru generare dataset sintetic.

Linkuri: https://youtu.be/tt9UJ0NiOzU