"AI के लिए कौन-सा GPU चाहिए?" गलत पहला सवाल है। सही सवाल है "क्या मेरे मौजूदा machine पर LLM चलेगा?" – और जवाब product pick नहीं, checklist है। VRAM तय करती है कि model load होगा या नहीं; system RAM, CPU, storage और power तय करते हैं कि वह अच्छी तरह चलेगा या नहीं। यह guide पूरी checklist क्रम से बताती है, हमारे VRAM guide और 12 GB RX 6800M पर Lab benchmarks के numbers के साथ।

अगर आखिर में नया card चाहिए, तो best GPU for local LLMs वहीं से आगे बढ़ता है जहाँ यह खत्म होता है। अपने setup का exact number चाहिए तो LLM VRAM Calculator आपके GPU के लिए fit verdict के साथ गणित करता है।

संक्षेप में

1. VRAM: गेटकीपर

Model या तो VRAM में fit होता है या नहीं – 8 GB card पर 70B चलाने वाला कोई "minimum settings" mode नहीं है। Community-standard Q4_K_M quantization पर, साथ में KV cache और overhead के ~1–3 GB:

Model sizeQ4 weightsकुल ज़रूरतकिस पर चलेगा
7–8B~4–5 GB~6 GB8 GB card (RTX 4060, RX 7600)
13–14B~9–10 GB~11 GB12–16 GB card
27–32B~18–21 GB~22 GB24 GB card (RTX 4090, RX 7900 XTX)
70B~40–45 GB~48 GBDatacenter card या cloud – घर का hardware नहीं

दो footnotes जो beginners को काटती हैं: लंबा context VRAM खाता है (128K context अकेले 3–6 GB KV cache जोड़ सकता है – पूरा एक tier), और बेहतर quantization ज़्यादा VRAM लेती है (Q8 में weights column लगभग दोगुना)। इसके बदले क्या मिलता है, यह हमारी quantization guide दिखाती है।

2. System RAM: safety net

System RAM दो जगह काम आती है: OS, browser और engine को अपना हिस्सा चाहिए (साँस लेने भर को 8 GB), और VRAM खत्म होने पर overflow RAM में जाता है। किसी भी local-AI machine के लिए 16 GB minimum है; CPU offload fallback चाहिए तो 32 GB – 16 GB card पर 30B Q4 32 GB system RAM के साथ लंगड़ाते हुए चल सकता है, 5–15 tok/s पर। धीमा, पर चलता है, जो न चलने से बेहतर है।

3. CPU: speed, fit नहीं

CPU तय नहीं करता कि model load होगा या नहीं – पर prompt-eval speed (लंबे documents कितनी तेज़ी से absorb होंगे) और offload का दर्द तय करता है। Rule of thumb: 6+ आधुनिक cores (पिछले पाँच साल का कोई भी Ryzen 5 / Core i5)। इससे नीचे, लंबे prompts पर अच्छा GPU भी सुस्त लगता है क्योंकि CPU उसे feed नहीं कर पाता।

4. Storage: सोच से बड़ा और तेज़

Model files बड़ी होती हैं और आप जमा करेंगे: 7B quant ~5 GB, 32B quant ~20 GB, और compare करने को तीन "बस यूँ ही" रखेंगे। 512 GB NVMe minimum, 1 TB आरामदायक। Speed load time पर मायने रखती है (NVMe vs SATA = सेकंड बनाम प्रति model load एक मिनट) और offload swap पर – models को कभी उस spinning drive पर न रखें जिससे आप boot करते हैं।

5. PSU, cooling, OS: अलंकारहीन तिकड़ी

तीन machines, फैसले

Bottom line

क्रम से check करें: VRAM → RAM → CPU → storage → PSU। ज़्यादातर "क्या मुझ पर local AI चलेगा?" सवालों का जवाब पहले step पर मिल जाता है – 8 GB मतलब 7B, 16 GB मतलब 14B, 24 GB मतलब 32B। पैसे खर्च करने से पहले अपना exact model VRAM calculator में चलाएँ, और तभी पूछें कि कौन-सा card खरीदें।