1.7 KiB
1.7 KiB
title: "FREE 32GB VRAM Server for Running AI Models Locally"
url: https://youtu.be/sAJkIBURfBo
duration: "7:36"
tags: [@growth, @project]
date: 2026-09-20
TL;DR
Tutorial arată cum să folosești gratuit un notebook Kaggle cu 2x GPU T4 (32GB VRAM combinat) ca server pentru a rula modele Ollama, expus prin tunel Cloudflare și accesat local prin Hermes (client desktop). Practic: Kaggle rulează inferența, tu te conectezi de acasă prin URL-ul de tunel + API key "ollama".
Pași cheie
- Cont Kaggle + verificare telefon (necesară pentru GPU gratuit)
- Notebook nou → Settings → Accelerator → GPU T4 x2
- În celule cod: instalează
jstd, apoi Ollama (curlinstall script), pornește serviciul Ollama - Alege model de pe Hugging Face (filtru "text generation" + tag Ollama), copiază comanda
ollama run <model>de pe pagina modelului - Rulează tunel Cloudflare → generează URL public temporar către instanța Ollama din Kaggle
- Local: aplicația "Hermes" (client desktop, alt video al aceluiași canal) → custom endpoint = URL Cloudflare +
/api/v1, API key =ollama - Selectezi modelul detectat automat, setezi reasoning effort, gata
Observații
- Nu e cod/tool propriu, e workaround pentru GPU gratuit temporar (sesiune Kaggle, tunel expiră).
- Relevanță pentru Marius: alternativă la Ollama local (LXC 104) când ai nevoie de un model mai mare temporar, fără cost — dar sesiunea Kaggle e efemeră și necesită re-pornire manuală.
- Nu recomand adopție: infra proprie (LXC 104) e deja stabilă și fără dependență de tunel extern/sesiune expirabilă.
Insights
- @growth — de reținut ca opțiune "burst compute" gratuit dacă apare vreodată nevoie de un model mare one-off, nu pentru uz continuu