local AI में सबसे आम सवाल है "क्या मेरा GPU यह model चला सकता है?" जवाब एक number पर आता है: VRAM। यहाँ बताया गया है कि आप खुद लगभग तीस सेकंड में इसका अंदाज़ा कैसे लगाएँ – और popular model sizes के लिए एक cheat sheet।
अपना model, quantization और context चुनें और अपने GPU के लिए exact VRAM estimate के साथ fit check पाएँ।
Open the LLM VRAM Calculator →Quick answer
model के लिए ज़रूरी VRAM (weights), साथ में 8K context पर KV cache + overhead के लिए ~1–3 GB:
Model size Q4_K_M Q8_0 FP16 ────────────────────────────────────────────── 7–8B ~4–5 GB ~8–9 GB ~15–16 GB 13–14B ~9–10 GB ~16–17 GB ~30 GB 27–32B ~18–21 GB ~32–35 GB ~60+ GB 70B ~40–45 GB ~75 GB cloud only
इसे GPUs में बदलें: 8 GB कार्ड 7B Q4 चलाता है। 16 GB कार्ड sweet spot है – 14B Q4 पूरी तरह, 32B हल्के offload के साथ। 24 GB कार्ड 32B Q4 पूरी तरह चलाता है। इसीलिए "16 GB" हमारे best GPU for local LLMs picks में बार-बार आता है।
VRAM असल में क्या खाता है
तीन चीज़ें, और आपको सभी को जोड़ना होगा:
- Model weights – सबसे बड़ा हिस्सा। लगभग
parameters × bytes per weight। Q4_K_M पर यह ~0.6 bytes/weight है; Q8_0 पर ~1.06; FP16 पर बिल्कुल 2। - KV cache – context length और batch size के साथ बढ़ता है। 8K पर छोटा, 128K पर बड़ा। 7B के लिए यह 8K पर ~0.5 GB और 64K+ पर ~3–4 GB है।
- Overhead – CUDA context, engine buffers, tokenizer: आमतौर पर ऊपर से ~0.5–1.5 GB।
तो 8K context के साथ Q4_K_M पर 7B ≈ 4.5 GB weights + 0.5 GB KV + ~0.5 GB overhead ≈ 5.5 GB। 8 GB कार्ड पर आरामदायक, 6 GB वाले पर tight।
7B models: entry level
- Q4_K_M (~4.5 GB) – context के लिए जगह के साथ 8 GB GPU (RTX 4060, RX 7600) पर चलता है।
- Q8_0 (~8 GB) – 8 GB कार्ड बिल्कुल edge पर है; 12 GB आरामदायक है।
- FP16 (~16 GB) – 16 GB कार्ड चाहिए; उस point पर आप आमतौर पर 14B Q4 चलाना पसंद करेंगे।
13–14B models: practical sweet spot
- Q4_K_M (~9–10 GB) – 12 GB चलाता है; 16 GB (RTX 4060 Ti 16 GB, RX 7600 XT) लंबे context के साथ चलाता है।
- Q8_0 (~16 GB) – 16 GB कार्ड इसे छोटे context के साथ चलाता है; 24 GB आरामदायक है।
- FP16 (~30 GB) – 24 GB कार्ड offload के साथ चाहिए, या cloud।
14B Q4 ~40–50 tok/s पर वह point है जहाँ local model demo जैसा लगना बंद करके एक useful assistant जैसा लगने लगता है।
27–32B models: जहाँ 24 GB अपना मूल्य साबित करता है
- Q4_K_M (~20 GB + KV) – 24 GB GPU (RTX 4090, RX 7900 XTX) 32B Q4 को 8–16K context के साथ चलाता है। 32K context पर आप बिल्कुल edge पर हैं।
- Q8_0 (~32 GB) – consumer cards से बाहर; 32 GB कार्ड या cloud चाहिए।
16 GB कार्ड 30B Q4 को partial offload के साथ चला सकता है अगर आपके पास 16–32 GB system RAM हो – काम करता है, पर generation crawl करने लगता है (अक्सर 5–15 tok/s)।
Context length छिपा हुआ variable है
context double करने से KV cache लगभग double हो जाता है। 128K context पर, अकेला KV cache 3–6 GB हो सकता है – यह एक पूरी quantization tier जितनी memory है। अगर आप लंबे documents की योजना बना रहे हैं, तो बड़ा कार्ड लें या context छोटा करें।
FAQ
क्या मैं weights से कम VRAM के साथ model चला सकता हूँ?
सिर्फ कुछ layers को system RAM पर offload करके। काम करता है, पर हर offloaded layer generation को धीमा करता है। ज़्यादा RAM मदद करती है; यह VRAM की जगह नहीं लेती।
क्या CPU या GPU speed ऊपर के numbers के लिए मायने रखती है?
fit के लिए नहीं – VRAM capacity की बात है। speed अलग से tokens/sec के लिए मायने रखती है।
Minimum usable setup क्या है?
8 GB VRAM + 16 GB system RAM से आपको decent 7B Q4 local assistant मिल जाता है। वहाँ से, VRAM ही वह upgrade है जो मायने रखता है।
Bottom line
8 GB → 7B। 16 GB → 14B। 24 GB → 32B। लंबे context के लिए ~1–3 GB जोड़ें, और quantization जाने बिना कभी VRAM के दावे पर भरोसा न करें। card पर पैसा खर्च करने से पहले अपने exact model को नीचे दिए calculator से check करें।
LLM VRAM Calculator – weights + KV cache + fit verdict। फिर देखें कि GPU AI Performance Calculator से यह कितना तेज़ चलेगा।
Open calculator →