Vlasnik RTX 4080 suočio se sa poznatim problemom: njegova grafička kartica savršeno pokreće najzahtevnije AAA naslove, ali za lokalno pokretanje velikih jezičkih modela (LLM) jednostavno nema dovoljno VRAM-a. Rešenje je pronašao u NVIDIA Tesla V100 – servitskom GPU-u koji je nabavio po ceni od svega oko 266 dolara.

SXM2-to-PCIe adapter kao ključ rešenja
Tesla V100 nije dizajnovan za desktop matične ploče, pa ga nije moguće priključiti kao standardnu grafičku karticu. Modder poznat kao Tymscar morao je da nabavi SXM2-to-PCIe adapter kako bi GPU uopšte mogao da funkcioniše u njegovom sistemu. Karta dolazi sa 16GB HBM2 memorije, 5.120 CUDA jezgara i 4.096-bitnom magistralom koja obezbeđuje propusnost od 900GB/s.

Buka i hlađenje – neočekivani izazov
Jedan od većih problema bio je rashladni sistem. Tesla V100 radi na čak 82dB, što ga čini nepodnošljivim za svakodnevnu upotrebu. Tymscar je problem rešio korišćenjem 9V baterije i PWM džampera, čime je smanjio broj obrtaja ventilatora na svega 10% maksimalnog RPM-a.

32GB VRAM za Qwen3 27B model
Kombinacijom RTX 4080 i Tesla V100, sistem sada raspolaže sa 32GB upotrebljivog VRAM-a. To je sasvim dovoljno za pokretanje modela Qwen3.6-27B kvantizovanog na Q5_K_M formatu koji zauzima 19GB, uz kontekst od 128K tokena. Brzina generisanja iznosi 32 tokena u sekundi, a obrada upita između 133 i 160 tokena u sekundi – solidne performanse za kućno AI rešenje.
Za manje od 300 dolara, ovaj modder je izgradio sistem sposoban da lokalno pokreće srednje velike AI modele – bez interneta i bez troškova pretplate.



