# How much VRAM do you need for 7B, 14B, and 32B models?

> VRAM needed for 7B, 14B, and 32B LLMs – weights, quantization, KV cache, and context length, with a quick-reference table.

*Source: https://velstech.net/how-much-vram-for-llm.ta (Tamil translation of https://velstech.net/how-much-vram-for-llm) · Updated: 2026-08-27*

*Markdown version. [Read the interactive guide](https://velstech.net/how-much-vram-for-llm.ta). English Markdown: https://velstech.net/how-much-vram-for-llm.md.*

---

உள்ளூர் AI இல் மிகவும் பொதுவான கேள்வி "என் GPU இந்த மாடலை இயக்க முடியுமா?" என்பதே.
பதில் ஒரே ஒரு எண்ணைச் சார்ந்துள்ளது: **VRAM**. சுமார் முப்பது வினாடிகளில்
அதை நீங்களே எவ்வாறு மதிப்பிடுவது என்பது இங்கே – மேலும் பிரபலமான மாடல் அளவுகளுக்கான
ஏமாற்றுத் தாளும்.

🔧 கணிதத்தைத் தவிர்க்கவும் – கால்குலேட்டரைப் பயன்படுத்தவும்

உங்கள் GPU க்கு பொருந்துகிறதா என்பதைச் சரிபார்த்து, உங்கள் மாடல், குவாண்டைசேஷன், கான்டெக்ஸ்ட் ஆகியவற்றைத் தேர்ந்தெடுத்து சரியான VRAM மதிப்பீட்டைப் பெறுங்கள்.

[LLM VRAM கால்குலேட்டரைத் திற →](https://velstech.net/llm-vram-calculator)

## விரைவான பதில்

8K கான்டெக்ஸ்ட்டில் மாடலுக்கு மட்டுமே (எடைகள்) தேவையான VRAM, கூடுதலாக KV கேச் + ஓவர்ஹெட்டுக்கு ~1–3 GB:

```
Model size   Q4_K_M        Q8_0          FP16
──────────────────────────────────────────────
7–8B         ~4–5 GB      ~8–9 GB      ~15–16 GB
13–14B       ~9–10 GB     ~16–17 GB    ~30 GB
27–32B       ~18–21 GB    ~32–35 GB    ~60+ GB
70B          ~40–45 GB    ~75 GB       cloud only
```

அதை GPU களுக்கு மொழிபெயர்க்க: **8 GB** கார்டு 7B Q4 ஐ இயக்கும்.
**16 GB** கார்டு சிறந்த தேர்வு – 14B Q4 முழுமையாக, 32B ஐ லேசான
ஆஃப்லோடுடன் இயக்கும். **24 GB** கார்டு 32B Q4 ஐ முழுமையாக இயக்கும்.
அதனால்தான் எங்கள் [உள்ளூர் LLM களுக்கான சிறந்த
GPU](https://velstech.net/best-gpu-for-local-llm) தேர்வுகளில் "16 GB" தொடர்ந்து இடம்பெறுகிறது.

## VRAM ஐ உண்மையில் எது சாப்பிடுகிறது

மூன்று விஷயங்கள், அவை அனைத்தையும் நீங்கள் கூட்ட வேண்டும்:

- மாடல் எடைகள் – முக்கியமானது. ஏறத்தாழ parameters × bytes per weight.
Q4_K_M இல் அது ~0.6 பைட்டுகள்/எடை; Q8_0 இல் ~1.06; FP16 இல் சரியாக 2.

- KV கேச் – கான்டெக்ஸ்ட் நீளம் மற்றும் பேட்ச் அளவுடன் வளர்கிறது. 8K இல் சிறியது, 128K இல் குறிப்பிடத்தக்கது. 7B க்கு அது 8K இல் ~0.5 GB, 64K+ இல் ~3–4 GB.

- ஓவர்ஹெட் – CUDA கான்டெக்ஸ்ட், எஞ்சின் பஃபர்கள், டோக்கனைசர்: பொதுவாக கூடுதலாக ~0.5–1.5 GB.

எனவே 8K கான்டெக்ஸ்ட்டுடன் Q4_K_M இல் உள்ள 7B ≈ 4.5 GB எடைகள் + 0.5 GB KV + ~0.5 GB
ஓவர்ஹெட் ≈ **5.5 GB**. 8 GB கார்டில் வசதியாக இயங்கும், 6 GB இல் இறுக்கமாக
இருக்கும்.

## 7B மாடல்கள்: அடிப்படை நிலை

- Q4_K_M (~4.5 GB) – 8 GB GPU (RTX 4060, RX 7600) இல் கான்டெக்ஸ்டுக்கு இடம் அளித்து இயங்கும்.

- Q8_0 (~8 GB) – 8 GB கார்டு விளிம்பில் உள்ளது; 12 GB வசதியானது.

- FP16 (~16 GB) – உங்களுக்கு 16 GB கார்டு தேவை; அந்த நிலையில் பொதுவாக 14B Q4 ஐ இயக்குவதே நல்லது.

## 13–14B மாடல்கள்: நடைமுறைச் சிறந்த தேர்வு

- Q4_K_M (~9–10 GB) – 12 GB இயக்கும்; 16 GB (RTX 4060 Ti 16 GB, RX 7600 XT) நீண்ட கான்டெக்ஸ்டுடன் இயக்கும்.

- Q8_0 (~16 GB) – 16 GB கார்டு குறுகிய கான்டெக்ஸ்டுடன் இயக்கும்; 24 GB வசதியானது.

- FP16 (~30 GB) – ஆஃப்லோடுடன் 24 GB கார்டு, அல்லது கிளவுட் தேவை.

~40–50 tok/s இல் உள்ள 14B Q4, உள்ளூர் மாடல் டெமோ போல் உணர்வதை நிறுத்தி, பயனுள்ள
உதவியாளராக உணரத் தொடங்கும் இடமாகும்.

## 27–32B மாடல்கள்: 24 GB மதிப்பு பெறும் இடம்

- Q4_K_M (~20 GB + KV) – 24 GB GPU (RTX 4090, RX 7900 XTX) 32B Q4 ஐ 8–16K கான்டெக்ஸ்ட்டுடன் இயக்கும். 32K கான்டெக்ஸ்ட்டில் நீங்கள் சரியாக விளிம்பில் இருக்கிறீர்கள்.

- Q8_0 (~32 GB) – நுகர்வோர் கார்டுகளுக்கு அப்பால்; 32 GB கார்டு அல்லது கிளவுட் தேவை.

16–32 GB சிஸ்டம் RAM இருந்தால், 16 GB கார்டு **பகுதி ஆஃப்லோடு** மூலம்
30B Q4 ஐ இயக்க முடியும் – இது வேலை செய்யும், ஆனால் உருவாக்கம் மிகவும் மெதுவாகும்
(பெரும்பாலும் 5–15 tok/s).

## கான்டெக்ஸ்ட் நீளம் மறைந்திருக்கும் மாறி

கான்டெக்ஸ்ட்டை இரட்டிப்பாக்குவது KV கேச்யை ஏறத்தாழ இரட்டிப்பாக்கும். 128K கான்டெக்ஸ்ட்டில்,
KV கேச் மட்டுமே 3–6 GB ஆக இருக்கலாம் – அது முழு குவாண்டைசேஷன் நிலையின் நினைவக அளவு.
நீண்ட ஆவணங்களைத் திட்டமிடுகிறீர்கள் என்றால், பெரிய கார்டை வாங்குங்கள் அல்லது உங்கள்
கான்டெக்ஸ்ட்டைக் குறைக்கவும்.

## அடிக்கடி கேட்கப்படும் கேள்விகள்

### எடைகளுக்கு தேவையானதை விட குறைந்த VRAM உடன் மாடலை இயக்க முடியுமா?

சில அடுக்குகளை சிஸ்டம் RAM க்கு ஆஃப்லோடு செய்வதன் மூலம் மட்டுமே. அது வேலை செய்யும், ஆனால் ஒவ்வொரு ஆஃப்லோடு செய்யப்பட்ட அடுக்கும் உருவாக்கத்தை மெதுவாக்கும். அதிக RAM உதவும்; அது VRAM ஐ மாற்றாது.

### CPU அல்லது GPU வேகம் மேற்கண்ட எண்களுக்கு முக்கியமா?

பொருத்தத்திற்கு இல்லை – VRAM திறன் பற்றியது. வேகம் தனித்தனியாக tokens/sec க்கு முக்கியம்.

### குறைந்தபட்ச பயன்படுத்தக்கூடிய அமைப்பு எது?

8 GB VRAM + 16 GB சிஸ்டம் RAM, 7B Q4 உள்ளூர் உதவியாளரை நன்றாக இயக்கும். அங்கிருந்து, VRAM தான் முக்கியமான மேம்படுத்தல்.

## இறுதி முடிவு

8 GB → 7B. 16 GB → 14B. 24 GB → 32B. நீண்ட கான்டெக்ஸ்ட்டுக்கு ~1–3 GB சேர்க்கவும்,
மேலும் குவாண்டைசேஷனை அறியாமல் எந்த VRAM கூற்றையும் நம்ப வேண்டாம். கார்டு வாங்குவதற்கு
முன் கீழே உள்ள கால்குலேட்டருடன் உங்கள் சரியான மாடலைச் சரிபார்க்கவும்.

🔧 உங்கள் மாடலுக்கான சரியான எண்ணைப் பெறுங்கள்

LLM VRAM கால்குலேட்டர் – எடைகள் + KV கேச் + பொருத்துதல் முடிவு. பிறகு GPU AI செயல்திறன் கால்குலேட்டருடன் எவ்வளவு வேகமாக இயங்கும் என்று பாருங்கள்.

[கால்குலேட்டரைத் திற →](https://velstech.net/llm-vram-calculator)

---

*VelsTech – https://velstech.net/how-much-vram-for-llm.ta.md*
