"AI के लिए कौन-सा GPU चाहिए?" गलत पहला सवाल है। सही सवाल है "क्या मेरे मौजूदा machine पर LLM चलेगा?" – और जवाब product pick नहीं, checklist है। VRAM तय करती है कि model load होगा या नहीं; system RAM, CPU, storage और power तय करते हैं कि वह अच्छी तरह चलेगा या नहीं। यह guide पूरी checklist क्रम से बताती है, हमारे VRAM guide और 12 GB RX 6800M पर Lab benchmarks के numbers के साथ।
अगर आखिर में नया card चाहिए, तो best GPU for local LLMs वहीं से आगे बढ़ता है जहाँ यह खत्म होता है। अपने setup का exact number चाहिए तो LLM VRAM Calculator आपके GPU के लिए fit verdict के साथ गणित करता है।
संक्षेप में
- सबसे पहले VRAM: 8 GB पर 7B, 12–16 GB पर 14B, 24 GB पर 32B – सब 4-bit quantization पर। बाकी सब बाद में।
- दूसरे system RAM: minimum 16 GB, CPU offload fallback चाहिए तो 32 GB।
- तीसरे CPU: 6+ आधुनिक cores; prompt speed और offloaded layers वही संभालता है।
- चौथे Storage: model files 5–40 GB की होती हैं – 512 GB NVMe SSD practical minimum है।
- आखिर में PSU और cooling: load पर GPU घंटों full TDP खींचता है; थका PSU सबसे अजीब "AI crashes" देता है।
1. VRAM: गेटकीपर
Model या तो VRAM में fit होता है या नहीं – 8 GB card पर 70B चलाने वाला कोई "minimum
settings" mode नहीं है। Community-standard Q4_K_M quantization पर, साथ में
KV cache और overhead के ~1–3 GB:
| Model size | Q4 weights | कुल ज़रूरत | किस पर चलेगा |
|---|---|---|---|
| 7–8B | ~4–5 GB | ~6 GB | 8 GB card (RTX 4060, RX 7600) |
| 13–14B | ~9–10 GB | ~11 GB | 12–16 GB card |
| 27–32B | ~18–21 GB | ~22 GB | 24 GB card (RTX 4090, RX 7900 XTX) |
| 70B | ~40–45 GB | ~48 GB | Datacenter card या cloud – घर का hardware नहीं |
दो footnotes जो beginners को काटती हैं: लंबा context VRAM खाता है (128K context अकेले 3–6 GB KV cache जोड़ सकता है – पूरा एक tier), और बेहतर quantization ज़्यादा VRAM लेती है (Q8 में weights column लगभग दोगुना)। इसके बदले क्या मिलता है, यह हमारी quantization guide दिखाती है।
2. System RAM: safety net
System RAM दो जगह काम आती है: OS, browser और engine को अपना हिस्सा चाहिए (साँस लेने भर को 8 GB), और VRAM खत्म होने पर overflow RAM में जाता है। किसी भी local-AI machine के लिए 16 GB minimum है; CPU offload fallback चाहिए तो 32 GB – 16 GB card पर 30B Q4 32 GB system RAM के साथ लंगड़ाते हुए चल सकता है, 5–15 tok/s पर। धीमा, पर चलता है, जो न चलने से बेहतर है।
3. CPU: speed, fit नहीं
CPU तय नहीं करता कि model load होगा या नहीं – पर prompt-eval speed (लंबे documents कितनी तेज़ी से absorb होंगे) और offload का दर्द तय करता है। Rule of thumb: 6+ आधुनिक cores (पिछले पाँच साल का कोई भी Ryzen 5 / Core i5)। इससे नीचे, लंबे prompts पर अच्छा GPU भी सुस्त लगता है क्योंकि CPU उसे feed नहीं कर पाता।
4. Storage: सोच से बड़ा और तेज़
Model files बड़ी होती हैं और आप जमा करेंगे: 7B quant ~5 GB, 32B quant ~20 GB, और compare करने को तीन "बस यूँ ही" रखेंगे। 512 GB NVMe minimum, 1 TB आरामदायक। Speed load time पर मायने रखती है (NVMe vs SATA = सेकंड बनाम प्रति model load एक मिनट) और offload swap पर – models को कभी उस spinning drive पर न रखें जिससे आप boot करते हैं।
5. PSU, cooling, OS: अलंकारहीन तिकड़ी
- PSU: full inference load पर GPU घंटों TDP के करीब खींचता है। Mid-range cards के लिए 650W quality unit, 24 GB flagships के लिए 850W+। Load पर random crashes – जब तक साबित न हो, मरता PSU समझें।
- Cooling: घंटों 100% GPU utilization gaming bursts से ज़्यादा गर्म है। Radeon undervolt करने पर ~5% speed की कीमत पर ~20% कम गर्मी – खासकर laptops पर फायदेमंद।
- OS और drivers: AMD के लिए Linux + ROCm, NVIDIA के लिए कोई भी OS + CUDA। AMD रास्ते के लिए हमारी ROCm vs Vulkan guide और ROCm install guide step by step कवर करती हैं।
तीन machines, फैसले
- Thin-and-light laptop (integrated graphics, 16 GB RAM): CPU से 7B Q4 कुछ tok/s पर, या सिर्फ छोटे models। Chat के लिए ठीक, agents के लिए दर्दनाक।
- 2021 gaming laptop (RTX 3060 / RX 6800M, 12 GB VRAM, 32 GB RAM): sweet spot – 14B पूरी तरह, tuned quants के साथ 27–32B (हमारा Lab रोज़ ठीक इसी class पर चलता है)।
- 24 GB card वाला Desktop: लंबे context के साथ 32B पूरी तरह। वह बिंदु जहाँ ज़्यादातर काम के लिए local समझौता नहीं लगता।
Bottom line
क्रम से check करें: VRAM → RAM → CPU → storage → PSU। ज़्यादातर "क्या मुझ पर local AI चलेगा?" सवालों का जवाब पहले step पर मिल जाता है – 8 GB मतलब 7B, 16 GB मतलब 14B, 24 GB मतलब 32B। पैसे खर्च करने से पहले अपना exact model VRAM calculator में चलाएँ, और तभी पूछें कि कौन-सा card खरीदें।