chore: auto-commit from dashboard

This commit is contained in:
2026-07-12 19:28:42 +00:00
parent 80eb8034b3
commit 4d2dbfb8a7
22 changed files with 582 additions and 520 deletions

View File

@@ -0,0 +1,45 @@
# Local Embedding Server with 150 AI Models | Superlinked SIE
**URL:** https://youtu.be/wavL-C6C994
**Durata:** 9:01
**Data salvat:** 2026-07-11
**Tags:** @work @growth @ai @rag @self-hosted
---
## TL;DR
Prezentare SIE (Superlinked Inference Engine) — un container Docker unic care înlocuiește cele trei servere separate necesare de obicei într-un pipeline RAG (embedding, reranker, entity extraction), fiecare cu propriul setup și management GPU. SIE vine cu 85+ modele pre-configurate (dense, sparse, multi-vector, vision, cross-encoder) expuse prin 3 funcții simple: `encode` (text → vector), `score` (rerank rezultate), `extract` (zero-shot NER — extragere entități fără antrenare, doar specifici label-urile la query time). Modelele sunt mici, rulează și pe CPU, nu necesită GPU.
---
## Puncte cheie
- Problema pe care o rezolvă: majoritatea plătesc per-token la OpenAI/Anthropic pentru embeddings SAU rulează 3 servere separate (embedding + reranker + entity extractor), fiecare cu setup/GPU/API propriu — devine complicat rapid, plus latență
- SIE = un singur container Docker, 150 modele încărcate, servit pe port 8080
- 3 funcții: **encode** (text→vector, 1024 dimensiuni pentru BGE, cu flag `query` pentru a distinge search query de document), **score** (reranker — compară query + document direct, mai precis decât similaritate vectorială simplă), **extract** (NER zero-shot — dai label-uri la query time, ex. "person", "organization", "location", fără training)
- Modelele sunt mici, rulează pe CPU fără probleme (nu necesită GPU puternic)
- Instalare simplă via Docker; SDK Python separat pentru apeluri
- Demo: encode "what is machine learning" → vector 1024 dim; rerank 3 candidați → scor 1.0 pentru cel relevant, 0.001 pentru cel irelevant; extract entități dintr-o propoziție despre Elon Musk → person/organization/location cu confidence scores
---
## Quote-uri relevante
> "Every RAG pipeline you build needs at least three things: an embedding model, a re-ranker, and often an entity extractor... most people are either paying OpenAI/Anthropic per token or running three separate model servers."
> "One container, three primitives, 150 models, on your own system, quite lightweight stuff."
---
## Idei acționabile pentru Marius
- [ ] Dacă vreodată apare nevoie de RAG/semantic search self-hosted mai avansat decât Ollama all-minilm actual (ex. reranking pentru memory_search sau roa2web), SIE e o opțiune de investigat — rulează pe CPU, un singur container @work @growth
- [ ] Nu e o prioritate acum (memory_search cu Ollama embeddings funcționează), dar util de reținut ca referință dacă apare nevoie de reranking sau NER zero-shot @growth
---
## Surse menționate
- Superlinked SIE (Superlinked Inference Engine) — open-source, Docker
- Coupon code menționat în video: FahdMirza (sponsor Master Compute pentru VM/GPU cheap)

View File

@@ -0,0 +1,20 @@
---
title: "Cactus Needle - The 26M Function Calling Model"
url: https://youtu.be/tt9UJ0NiOzU
duration: 14:29
tags: [@work, @growth]
date: 2026-07-12
---
## TL;DR
Cactus a lansat **Needle** — un model open source de doar **26 milioane de parametri** specializat exclusiv pe function calling (tool calling), distilat din Gemini 3.1 Flash Lite. Arhitectură neobișnuită: doar attention + gating, **fără layere FFN/MLP** (acolo unde modelele mari stochează "cunoștințele generale") — de asta e atât de mic, dar tot performant pe apeluri de tool single-shot. Bate modele de 10-20x mai mari (Function Gemma, IBM Granite, Qwen 600M) pe single-shot function calling. Rulează pe CPU, ~1200 tokens/sec pe device consumer, se poate fine-tune și fără GPU. Nu are "inteligență" generală — nu ține de raționament complex sau multi-tool, dar pentru task-uri simple (on/off, seteaza timer, trimite email, control smart home) merge foarte bine.
## Insights
- **Idee cheie**: tool calling = retrieval + assembly (potrivire query→nume funcție + extragere argumente în JSON), nu necesită raționament greu → nu ai nevoie de model mare pentru asta. @growth
- **Aplicabilitate potențială pt Echo/ROA**: pentru comenzi simple repetitive (ex: rutare intent-uri Discord/Telegram/WhatsApp, clasificare "ce vrea userul" înainte de a apela un model mare) — un model mic dedicat de tool-routing ar putea reduce costul/latența, cu fallback la model mare pt cazuri complexe (cascadă). @work
- Demo arată că merge bine și pe seturi de funcții custom (smart home) fără fine-tuning, doar cu descrieri bune ale funcțiilor — sugerează că **calitatea descrierilor tool-urilor contează mult** mai mult decât mărimea modelului pentru cazuri simple. @work
- Model gratuit, repo pe GitHub + Hugging Face, fine-tuning posibil doar cu CPU + cheie Gemini pentru generare dataset sintetic.
Linkuri: https://youtu.be/tt9UJ0NiOzU

View File

@@ -1,6 +1,6 @@
# Index — youtube/
> 159 note. Citește acest index întâi; deschide doar fișierele relevante.
> 161 note. Citește acest index întâi; deschide doar fișierele relevante.
- **[Talk to Claude on 3CX Phone System Tutorial (Full Setup)](2025-02-13_talk-to-claude-3cx-phone.md)** `@work`
Tutorial complet pentru a vorbi cu Claude Code prin telefon, folosind 3CX (sistem telefonic cloud gratuit) + un proiect GitHub custom. Setup
@@ -318,5 +318,9 @@
Tutorial complet despre cum se fine-tunează modele AI masive (ex: Kimi K2.7 — 1 trilion parametri) pe date proprii, fără hardware de sute de
- **[I Cut My OpenCode Token Usage by 96% - Here's How](2026-07-10_opencode-token-usage-96-percent.md)** `@work @growth`
Autorul folosește un proxy man-in-the-middle pentru a vedea exact ce trimite OpenCode (agent de coding AI) către LLM la un simplu "hello" —
- **[Local Embedding Server with 150 AI Models | Superlinked SIE](2026-07-11_local-embedding-server-sie.md)** `@work @growth`
Prezentare SIE (Superlinked Inference Engine) — un container Docker unic care înlocuiește cele trei servere separate necesare de obicei într
- **[2026-07-12_cactus-needle-26m-function-calling-model](2026-07-12_cactus-needle-26m-function-calling-model.md)** `@work @growth`
Cactus a lansat **Needle** — un model open source de doar **26 milioane de parametri** specializat exclusiv pe function calling (tool callin
- **[thinking-on-paper](thinking-on-paper.md)** `@growth`
Metoda "Thinking on Paper" — 3 principii: **Make it Wrong** (scrie repede, fără perfecționism), **Make it Shorter** (doar keywords), **Make