1.9 KiB
TL;DR
Cactus a lansat Needle — un model open source de doar 26 milioane de parametri specializat exclusiv pe function calling (tool calling), distilat din Gemini 3.1 Flash Lite. Arhitectură neobișnuită: doar attention + gating, fără layere FFN/MLP (acolo unde modelele mari stochează "cunoștințele generale") — de asta e atât de mic, dar tot performant pe apeluri de tool single-shot. Bate modele de 10-20x mai mari (Function Gemma, IBM Granite, Qwen 600M) pe single-shot function calling. Rulează pe CPU, ~1200 tokens/sec pe device consumer, se poate fine-tune și fără GPU. Nu are "inteligență" generală — nu ține de raționament complex sau multi-tool, dar pentru task-uri simple (on/off, seteaza timer, trimite email, control smart home) merge foarte bine.
Insights
- Idee cheie: tool calling = retrieval + assembly (potrivire query→nume funcție + extragere argumente în JSON), nu necesită raționament greu → nu ai nevoie de model mare pentru asta. @growth
- Aplicabilitate potențială pt Echo/ROA: pentru comenzi simple repetitive (ex: rutare intent-uri Discord/Telegram/WhatsApp, clasificare "ce vrea userul" înainte de a apela un model mare) — un model mic dedicat de tool-routing ar putea reduce costul/latența, cu fallback la model mare pt cazuri complexe (cascadă). @work
- Demo arată că merge bine și pe seturi de funcții custom (smart home) fără fine-tuning, doar cu descrieri bune ale funcțiilor — sugerează că calitatea descrierilor tool-urilor contează mult mai mult decât mărimea modelului pentru cazuri simple. @work
- Model gratuit, repo pe GitHub + Hugging Face, fine-tuning posibil doar cu CPU + cheie Gemini pentru generare dataset sintetic.
Linkuri: https://youtu.be/tt9UJ0NiOzU