--- title: "FREE 32GB VRAM Server for Running AI Models Locally" url: https://youtu.be/sAJkIBURfBo duration: "7:36" tags: [@growth, @project] date: 2026-09-20 --- ## TL;DR Tutorial arată cum să folosești gratuit un notebook Kaggle cu 2x GPU T4 (32GB VRAM combinat) ca server pentru a rula modele Ollama, expus prin tunel Cloudflare și accesat local prin Hermes (client desktop). Practic: Kaggle rulează inferența, tu te conectezi de acasă prin URL-ul de tunel + API key "ollama". ## Pași cheie 1. Cont Kaggle + verificare telefon (necesară pentru GPU gratuit) 2. Notebook nou → Settings → Accelerator → GPU T4 x2 3. În celule cod: instalează `jstd`, apoi Ollama (`curl` install script), pornește serviciul Ollama 4. Alege model de pe Hugging Face (filtru "text generation" + tag Ollama), copiază comanda `ollama run ` de pe pagina modelului 5. Rulează tunel Cloudflare → generează URL public temporar către instanța Ollama din Kaggle 6. Local: aplicația "Hermes" (client desktop, alt video al aceluiași canal) → custom endpoint = URL Cloudflare + `/api/v1`, API key = `ollama` 7. Selectezi modelul detectat automat, setezi reasoning effort, gata ## Observații - Nu e cod/tool propriu, e workaround pentru GPU gratuit temporar (sesiune Kaggle, tunel expiră). - Relevanță pentru Marius: alternativă la Ollama local (LXC 104) când ai nevoie de un model mai mare temporar, fără cost — dar sesiunea Kaggle e efemeră și necesită re-pornire manuală. - Nu recomand adopție: infra proprie (LXC 104) e deja stabilă și fără dependență de tunel extern/sesiune expirabilă. ## Insights - [ ] @growth — de reținut ca opțiune "burst compute" gratuit dacă apare vreodată nevoie de un model mare one-off, nu pentru uz continuu