# How much VRAM do you need for 7B, 14B, and 32B models?

> VRAM needed for 7B, 14B, and 32B LLMs – weights, quantization, KV cache, and context length, with a quick-reference table.

*Source: https://velstech.net/how-much-vram-for-llm.hi (Hindi translation of https://velstech.net/how-much-vram-for-llm) · Updated: 2026-08-27*

*Markdown version. [Read the interactive guide](https://velstech.net/how-much-vram-for-llm.hi). English Markdown: https://velstech.net/how-much-vram-for-llm.md.*

---

local AI में सबसे आम सवाल है "क्या मेरा GPU यह model चला सकता है?" जवाब एक number पर आता है: **VRAM**। यहाँ बताया गया है कि आप खुद लगभग तीस सेकंड में इसका अंदाज़ा कैसे लगाएँ – और popular model sizes के लिए एक cheat sheet।

🔧 गणित छोड़ें – calculator इस्तेमाल करें

अपना model, quantization और context चुनें और अपने GPU के लिए exact VRAM estimate के साथ fit check पाएँ।

[Open the LLM VRAM Calculator →](https://velstech.net/llm-vram-calculator)

## Quick answer

model के लिए ज़रूरी VRAM (weights), साथ में 8K context पर KV cache + overhead के लिए ~1–3 GB:

```
Model size   Q4_K_M        Q8_0          FP16
──────────────────────────────────────────────
7–8B         ~4–5 GB      ~8–9 GB      ~15–16 GB
13–14B       ~9–10 GB     ~16–17 GB    ~30 GB
27–32B       ~18–21 GB    ~32–35 GB    ~60+ GB
70B          ~40–45 GB    ~75 GB       cloud only
```

इसे GPUs में बदलें: **8 GB** कार्ड 7B Q4 चलाता है। **16 GB** कार्ड sweet spot है – 14B Q4 पूरी तरह, 32B हल्के offload के साथ। **24 GB** कार्ड 32B Q4 पूरी तरह चलाता है। इसीलिए "16 GB" हमारे [best GPU for local LLMs](https://velstech.net/best-gpu-for-local-llm) picks में बार-बार आता है।

## VRAM असल में क्या खाता है

तीन चीज़ें, और आपको सभी को जोड़ना होगा:

- Model weights – सबसे बड़ा हिस्सा। लगभग parameters × bytes per weight। Q4_K_M पर यह ~0.6 bytes/weight है; Q8_0 पर ~1.06; FP16 पर बिल्कुल 2।

- KV cache – context length और batch size के साथ बढ़ता है। 8K पर छोटा, 128K पर बड़ा। 7B के लिए यह 8K पर ~0.5 GB और 64K+ पर ~3–4 GB है।

- Overhead – CUDA context, engine buffers, tokenizer: आमतौर पर ऊपर से ~0.5–1.5 GB।

तो 8K context के साथ Q4_K_M पर 7B ≈ 4.5 GB weights + 0.5 GB KV + ~0.5 GB overhead ≈ **5.5 GB**। 8 GB कार्ड पर आरामदायक, 6 GB वाले पर tight।

## 7B models: entry level

- Q4_K_M (~4.5 GB) – context के लिए जगह के साथ 8 GB GPU (RTX 4060, RX 7600) पर चलता है।

- Q8_0 (~8 GB) – 8 GB कार्ड बिल्कुल edge पर है; 12 GB आरामदायक है।

- FP16 (~16 GB) – 16 GB कार्ड चाहिए; उस point पर आप आमतौर पर 14B Q4 चलाना पसंद करेंगे।

## 13–14B models: practical sweet spot

- Q4_K_M (~9–10 GB) – 12 GB चलाता है; 16 GB (RTX 4060 Ti 16 GB, RX 7600 XT) लंबे context के साथ चलाता है।

- Q8_0 (~16 GB) – 16 GB कार्ड इसे छोटे context के साथ चलाता है; 24 GB आरामदायक है।

- FP16 (~30 GB) – 24 GB कार्ड offload के साथ चाहिए, या cloud।

14B Q4 ~40–50 tok/s पर वह point है जहाँ local model demo जैसा लगना बंद करके एक useful assistant जैसा लगने लगता है।

## 27–32B models: जहाँ 24 GB अपना मूल्य साबित करता है

- Q4_K_M (~20 GB + KV) – 24 GB GPU (RTX 4090, RX 7900 XTX) 32B Q4 को 8–16K context के साथ चलाता है। 32K context पर आप बिल्कुल edge पर हैं।

- Q8_0 (~32 GB) – consumer cards से बाहर; 32 GB कार्ड या cloud चाहिए।

16 GB कार्ड 30B Q4 को **partial offload** के साथ चला सकता है अगर आपके पास 16–32 GB system RAM हो – काम करता है, पर generation crawl करने लगता है (अक्सर 5–15 tok/s)।

## Context length छिपा हुआ variable है

context double करने से KV cache लगभग double हो जाता है। 128K context पर, अकेला KV cache 3–6 GB हो सकता है – यह एक पूरी quantization tier जितनी memory है। अगर आप लंबे documents की योजना बना रहे हैं, तो बड़ा कार्ड लें या context छोटा करें।

## FAQ

### क्या मैं weights से कम VRAM के साथ model चला सकता हूँ?

सिर्फ कुछ layers को system RAM पर offload करके। काम करता है, पर हर offloaded layer generation को धीमा करता है। ज़्यादा RAM मदद करती है; यह VRAM की जगह नहीं लेती।

### क्या CPU या GPU speed ऊपर के numbers के लिए मायने रखती है?

fit के लिए नहीं – VRAM capacity की बात है। speed अलग से tokens/sec के लिए मायने रखती है।

### Minimum usable setup क्या है?

8 GB VRAM + 16 GB system RAM से आपको decent 7B Q4 local assistant मिल जाता है। वहाँ से, VRAM ही वह upgrade है जो मायने रखता है।

## Bottom line

8 GB → 7B। 16 GB → 14B। 24 GB → 32B। लंबे context के लिए ~1–3 GB जोड़ें, और quantization जाने बिना कभी VRAM के दावे पर भरोसा न करें। card पर पैसा खर्च करने से पहले अपने exact model को नीचे दिए calculator से check करें।

🔧 अपने model के लिए exact number पाएँ

LLM VRAM Calculator – weights + KV cache + fit verdict। फिर देखें कि GPU AI Performance Calculator से यह कितना तेज़ चलेगा।

[Open calculator →](https://velstech.net/llm-vram-calculator)

---

*VelsTech – https://velstech.net/how-much-vram-for-llm.hi.md*
