local AI में सबसे आम सवाल है "क्या मेरा GPU यह model चला सकता है?" जवाब एक number पर आता है: VRAM। यहाँ बताया गया है कि आप खुद लगभग तीस सेकंड में इसका अंदाज़ा कैसे लगाएँ – और popular model sizes के लिए एक cheat sheet।

🔧 गणित छोड़ें – calculator इस्तेमाल करें

अपना model, quantization और context चुनें और अपने GPU के लिए exact VRAM estimate के साथ fit check पाएँ।

Open the LLM VRAM Calculator →

Quick answer

model के लिए ज़रूरी VRAM (weights), साथ में 8K context पर KV cache + overhead के लिए ~1–3 GB:

Model size   Q4_K_M        Q8_0          FP16
──────────────────────────────────────────────
7–8B         ~4–5 GB      ~8–9 GB      ~15–16 GB
13–14B       ~9–10 GB     ~16–17 GB    ~30 GB
27–32B       ~18–21 GB    ~32–35 GB    ~60+ GB
70B          ~40–45 GB    ~75 GB       cloud only

इसे GPUs में बदलें: 8 GB कार्ड 7B Q4 चलाता है। 16 GB कार्ड sweet spot है – 14B Q4 पूरी तरह, 32B हल्के offload के साथ। 24 GB कार्ड 32B Q4 पूरी तरह चलाता है। इसीलिए "16 GB" हमारे best GPU for local LLMs picks में बार-बार आता है।

VRAM असल में क्या खाता है

तीन चीज़ें, और आपको सभी को जोड़ना होगा:

  1. Model weights – सबसे बड़ा हिस्सा। लगभग parameters × bytes per weight। Q4_K_M पर यह ~0.6 bytes/weight है; Q8_0 पर ~1.06; FP16 पर बिल्कुल 2।
  2. KV cache – context length और batch size के साथ बढ़ता है। 8K पर छोटा, 128K पर बड़ा। 7B के लिए यह 8K पर ~0.5 GB और 64K+ पर ~3–4 GB है।
  3. Overhead – CUDA context, engine buffers, tokenizer: आमतौर पर ऊपर से ~0.5–1.5 GB।

तो 8K context के साथ Q4_K_M पर 7B ≈ 4.5 GB weights + 0.5 GB KV + ~0.5 GB overhead ≈ 5.5 GB। 8 GB कार्ड पर आरामदायक, 6 GB वाले पर tight।

7B models: entry level

13–14B models: practical sweet spot

14B Q4 ~40–50 tok/s पर वह point है जहाँ local model demo जैसा लगना बंद करके एक useful assistant जैसा लगने लगता है।

27–32B models: जहाँ 24 GB अपना मूल्य साबित करता है

16 GB कार्ड 30B Q4 को partial offload के साथ चला सकता है अगर आपके पास 16–32 GB system RAM हो – काम करता है, पर generation crawl करने लगता है (अक्सर 5–15 tok/s)।

Context length छिपा हुआ variable है

context double करने से KV cache लगभग double हो जाता है। 128K context पर, अकेला KV cache 3–6 GB हो सकता है – यह एक पूरी quantization tier जितनी memory है। अगर आप लंबे documents की योजना बना रहे हैं, तो बड़ा कार्ड लें या context छोटा करें।

FAQ

क्या मैं weights से कम VRAM के साथ model चला सकता हूँ?

सिर्फ कुछ layers को system RAM पर offload करके। काम करता है, पर हर offloaded layer generation को धीमा करता है। ज़्यादा RAM मदद करती है; यह VRAM की जगह नहीं लेती।

क्या CPU या GPU speed ऊपर के numbers के लिए मायने रखती है?

fit के लिए नहीं – VRAM capacity की बात है। speed अलग से tokens/sec के लिए मायने रखती है।

Minimum usable setup क्या है?

8 GB VRAM + 16 GB system RAM से आपको decent 7B Q4 local assistant मिल जाता है। वहाँ से, VRAM ही वह upgrade है जो मायने रखता है।

Bottom line

8 GB → 7B। 16 GB → 14B। 24 GB → 32B। लंबे context के लिए ~1–3 GB जोड़ें, और quantization जाने बिना कभी VRAM के दावे पर भरोसा न करें। card पर पैसा खर्च करने से पहले अपने exact model को नीचे दिए calculator से check करें।

🔧 अपने model के लिए exact number पाएँ

LLM VRAM Calculator – weights + KV cache + fit verdict। फिर देखें कि GPU AI Performance Calculator से यह कितना तेज़ चलेगा।

Open calculator →