# LLM Hardware Requirements Checklist: VRAM, RAM, CPU & PSU

> Will an LLM run on your machine? VRAM by model size, system RAM, CPU, SSD and PSU checklist for running 7B-70B models locally, with calculator links.

*Source: https://velstech.net/llm-hardware-requirements.hi (Hindi translation of https://velstech.net/llm-hardware-requirements) · Updated: 2026-09-22*

*Markdown version. [Read the interactive guide](https://velstech.net/llm-hardware-requirements.hi). English Markdown: https://velstech.net/llm-hardware-requirements.md.*

---

"AI के लिए कौन-सा GPU चाहिए?" गलत पहला सवाल है। सही सवाल है
**"क्या मेरे मौजूदा machine पर LLM चलेगा?"** – और जवाब product pick नहीं,
checklist है। VRAM तय करती है कि model load होगा या नहीं; system RAM, CPU, storage और
power तय करते हैं कि वह अच्छी तरह चलेगा या नहीं। यह guide पूरी checklist क्रम से बताती
है, हमारे [VRAM guide](https://velstech.net/how-much-vram-for-llm) और 12 GB RX 6800M पर
[Lab benchmarks](https://velstech.net/benchmarks/index) के numbers के साथ।

अगर आखिर में नया card चाहिए, तो [best GPU for local
LLMs](https://velstech.net/best-gpu-for-local-llm) वहीं से आगे बढ़ता है जहाँ यह खत्म होता है। अपने setup का exact number चाहिए तो
[LLM VRAM Calculator](https://velstech.net/llm-vram-calculator) आपके GPU के लिए fit verdict के
साथ गणित करता है।

## संक्षेप में

- सबसे पहले VRAM: 8 GB पर 7B, 12–16 GB पर 14B, 24 GB पर 32B – सब 4-bit quantization पर। बाकी सब बाद में।

- दूसरे system RAM: minimum 16 GB, CPU offload fallback चाहिए तो 32 GB।

- तीसरे CPU: 6+ आधुनिक cores; prompt speed और offloaded layers वही संभालता है।

- चौथे Storage: model files 5–40 GB की होती हैं – 512 GB NVMe SSD practical minimum है।

- आखिर में PSU और cooling: load पर GPU घंटों full TDP खींचता है; थका PSU सबसे अजीब "AI crashes" देता है।

## 1. VRAM: गेटकीपर

Model या तो VRAM में fit होता है या नहीं – 8 GB card पर 70B चलाने वाला कोई "minimum
settings" mode नहीं है। Community-standard `Q4_K_M` quantization पर, साथ में
KV cache और overhead के ~1–3 GB:

| Model size | Q4 weights | कुल ज़रूरत | किस पर चलेगा |
| --- | --- | --- | --- |
| 7–8B | ~4–5 GB | ~6 GB | 8 GB card (RTX 4060, RX 7600) |
| 13–14B | ~9–10 GB | ~11 GB | 12–16 GB card |
| 27–32B | ~18–21 GB | ~22 GB | 24 GB card (RTX 4090, RX 7900 XTX) |
| 70B | ~40–45 GB | ~48 GB | Datacenter card या cloud – घर का hardware नहीं |

दो footnotes जो beginners को काटती हैं: **लंबा context VRAM खाता है** (128K
context अकेले 3–6 GB KV cache जोड़ सकता है – पूरा एक tier), और **बेहतर quantization
ज़्यादा VRAM लेती है** (Q8 में weights column लगभग दोगुना)। इसके बदले क्या मिलता है,
यह हमारी [quantization guide](https://velstech.net/quantization-deep-dive) दिखाती है।

## 2. System RAM: safety net

System RAM दो जगह काम आती है: OS, browser और engine को अपना हिस्सा चाहिए (साँस लेने भर को
8 GB), और VRAM खत्म होने पर overflow RAM में जाता है। **किसी भी local-AI machine के
लिए 16 GB minimum** है; CPU offload fallback चाहिए तो **32 GB** – 16 GB
card पर 30B Q4 32 GB system RAM के साथ लंगड़ाते हुए चल सकता है, 5–15 tok/s पर। धीमा, पर
चलता है, जो न चलने से बेहतर है।

## 3. CPU: speed, fit नहीं

CPU तय नहीं करता कि model load होगा या नहीं – पर prompt-eval speed (लंबे documents कितनी
तेज़ी से absorb होंगे) और offload का दर्द तय करता है। Rule of thumb: **6+ आधुनिक
cores** (पिछले पाँच साल का कोई भी Ryzen 5 / Core i5)। इससे नीचे, लंबे prompts पर
अच्छा GPU भी सुस्त लगता है क्योंकि CPU उसे feed नहीं कर पाता।

## 4. Storage: सोच से बड़ा और तेज़

Model files बड़ी होती हैं और आप जमा करेंगे: 7B quant ~5 GB, 32B quant ~20 GB, और compare
करने को तीन "बस यूँ ही" रखेंगे। **512 GB NVMe minimum, 1 TB आरामदायक।** Speed
load time पर मायने रखती है (NVMe vs SATA = सेकंड बनाम प्रति model load एक मिनट) और offload
swap पर – models को कभी उस spinning drive पर न रखें जिससे आप boot करते हैं।

## 5. PSU, cooling, OS: अलंकारहीन तिकड़ी

- PSU: full inference load पर GPU घंटों TDP के करीब खींचता है। Mid-range cards के लिए 650W quality unit, 24 GB flagships के लिए 850W+। Load पर random crashes – जब तक साबित न हो, मरता PSU समझें।

- Cooling: घंटों 100% GPU utilization gaming bursts से ज़्यादा गर्म है। Radeon undervolt करने पर ~5% speed की कीमत पर ~20% कम गर्मी – खासकर laptops पर फायदेमंद।

- OS और drivers: AMD के लिए Linux + ROCm, NVIDIA के लिए कोई भी OS + CUDA। AMD रास्ते के लिए हमारी ROCm vs Vulkan guide और ROCm install guide step by step कवर करती हैं।

## तीन machines, फैसले

- Thin-and-light laptop (integrated graphics, 16 GB RAM): CPU से 7B Q4 कुछ tok/s पर, या सिर्फ छोटे models। Chat के लिए ठीक, agents के लिए दर्दनाक।

- 2021 gaming laptop (RTX 3060 / RX 6800M, 12 GB VRAM, 32 GB RAM): sweet spot – 14B पूरी तरह, tuned quants के साथ 27–32B (हमारा Lab रोज़ ठीक इसी class पर चलता है)।

- 24 GB card वाला Desktop: लंबे context के साथ 32B पूरी तरह। वह बिंदु जहाँ ज़्यादातर काम के लिए local समझौता नहीं लगता।

## Bottom line

क्रम से check करें: VRAM → RAM → CPU → storage → PSU। ज़्यादातर "क्या मुझ पर local AI
चलेगा?" सवालों का जवाब पहले step पर मिल जाता है – 8 GB मतलब 7B, 16 GB मतलब 14B, 24 GB
मतलब 32B। पैसे खर्च करने से पहले अपना exact model
[VRAM calculator](https://velstech.net/llm-vram-calculator) में चलाएँ, और तभी पूछें कि कौन-सा
card खरीदें।

---

*VelsTech – https://velstech.net/llm-hardware-requirements.hi.md*
