--- title: "Getting the Same Results with Smaller \"Cheaper\" Dual Sparks AI as the More Expensive Clusters" url: https://youtu.be/tmcn1-jFLWY date: 2026-09-18 tags: [@work, insights] --- ## TL;DR Testere pe forumul Level1Techs a comparat DeepSeek 0731 rulat pe două NVIDIA DGX Spark (Dell, ~4-5.000$ bucata, 256GB LPDDR5 total, NVFP4 quant) vs. același model pe un sistem cu patru RTX Pro 6000 (~10.000$/GPU, de 7x mai scump și 7x mai rapid). Rezultatul-surpriză: la task-uri reale (code review, breakout-clone, audit securitate router, agentic tool-use), calitatea output-ului a fost aproape identică — singura categorie unde dual-Spark a picat clar a fost numărarea (ex. "câte R-uri are strawberry"). Concluzia autorului: NVFP4 e motivul principal — quantizarea la 4-bit pe DeepSeek păstrează coerența mult mai bine decât se aștepta, iar diferența de preț/performanță nu mai justifică sistemele mari decât pentru uz comercial cu utilizare la capacitate. ## Idei cheie - Setup dual DGX Spark: 256GB memorie unificată, peste 1M tokeni context per stream (multipli stream în paralel, ~1.5M context agregat), 60-80 tok/s decode cu VLM patch-uit (out-of-box doar 10-15 tok/s — optimizările software au făcut diferența, nu hardware-ul). - Diferența reală RTX Pro 6000 vs. dual Spark: doar viteză (7x), nu calitate — pentru workflow agentic (harness + task descompus în sub-task-uri), diferența de viteză contează mai puțin decât la chat interactiv. - Recomandare cost: pentru cineva care vrea doar să învețe/experimenteze, un cont OpenRouter la 20$/lună dă acces la modele comparabile — hardware-ul propriu (50-120k$) se justifică doar cu utilizare comercială susținută (se amortizează în săptămâni la $25/1M tokeni, nu ani). - "Agentic" ≠ chatbot: diferența e un harness (ex. Turnstone, succesorul mai organizat al OpenClaw) care descompune un task mare în sub-task-uri supervizate — asta a rulat breakout-clone-ul de test, nu conversație directă. - Bit-flip / non-determinism hardware: chiar la parametri identici, kernel-urile matematice diferă între arhitecturi (SM120 Blackwell vs. Hopper/GH200) — ordinea operațiilor floating-point diferă, deci același model+prompt poate diverge după câteva mii de tokeni în funcție de hardware. Relevant pentru oricine rulează modele cuantizate (Q4 pe 3090/4090) și se întreabă de ce coerența variază. - Predicție autor: prețul per token va continua să scadă rapid (modele noi, mai mici, ating performanța celor mari de acum 6 luni) — "race to the bottom" pe cost, benefic pentru rulare locală/offline. ## Relevanță pentru Echo/Marius Zero acțiune directă — Echo rulează deja local doar embeddings (Ollama all-minilm pe LXC 104), nu modele de conversație grele, deci nu e un caz de folosit hardware dedicat AI. Notă informativă: confirmă că fallback-ul local (Qwen 2B) e pe drumul corect — modele mici, bine optimizate, pot ajunge surprinzător de aproape de cele mari pe task-uri concrete (nu pe benchmark-uri sintetice), exact ce s-a observat empiric la scorul 36/36 al fallback-ului RO. Linkuri: https://youtu.be/tmcn1-jFLWY