Files
echo-core/memory/kb/youtube/2026-09-20_kaggle-32gb-vram-ollama-local-ai.md

1.7 KiB

title: "FREE 32GB VRAM Server for Running AI Models Locally" url: https://youtu.be/sAJkIBURfBo duration: "7:36" tags: [@growth, @project] date: 2026-09-20

TL;DR

Tutorial arată cum să folosești gratuit un notebook Kaggle cu 2x GPU T4 (32GB VRAM combinat) ca server pentru a rula modele Ollama, expus prin tunel Cloudflare și accesat local prin Hermes (client desktop). Practic: Kaggle rulează inferența, tu te conectezi de acasă prin URL-ul de tunel + API key "ollama".

Pași cheie

  1. Cont Kaggle + verificare telefon (necesară pentru GPU gratuit)
  2. Notebook nou → Settings → Accelerator → GPU T4 x2
  3. În celule cod: instalează jstd, apoi Ollama (curl install script), pornește serviciul Ollama
  4. Alege model de pe Hugging Face (filtru "text generation" + tag Ollama), copiază comanda ollama run <model> de pe pagina modelului
  5. Rulează tunel Cloudflare → generează URL public temporar către instanța Ollama din Kaggle
  6. Local: aplicația "Hermes" (client desktop, alt video al aceluiași canal) → custom endpoint = URL Cloudflare + /api/v1, API key = ollama
  7. Selectezi modelul detectat automat, setezi reasoning effort, gata

Observații

  • Nu e cod/tool propriu, e workaround pentru GPU gratuit temporar (sesiune Kaggle, tunel expiră).
  • Relevanță pentru Marius: alternativă la Ollama local (LXC 104) când ai nevoie de un model mai mare temporar, fără cost — dar sesiunea Kaggle e efemeră și necesită re-pornire manuală.
  • Nu recomand adopție: infra proprie (LXC 104) e deja stabilă și fără dependență de tunel extern/sesiune expirabilă.

Insights

  • @growth — de reținut ca opțiune "burst compute" gratuit dacă apare vreodată nevoie de un model mare one-off, nu pentru uz continuu