"AI-க்கு எந்த GPU வேண்டும்?" தவறான முதல் கேள்வி. சரியானது "என் தற்போதைய machine-ல் LLM இயங்குமா?" – பதில் product அல்ல, checklist. VRAM மாடல் load ஆகுமா என்பதை முடிவு செய்யும்; system RAM, CPU, storage, power அது நன்றாக இயங்குமா என்பதை முடிவு செய்யும். இந்த guide முழு checklist-ஐ வரிசையாக விளக்குகிறது, எங்கள் VRAM வழிகாட்டி மற்றும் 12 GB RX 6800M-ல் Lab benchmark எண்களுடன்.
முடிவில் புது card தேவைப்பட்டால், best GPU for local LLMs இது முடியும் இடத்திலிருந்து தொடர்கிறது. உங்கள் setup-க்கான சரியான எண் வேண்டுமானால் LLM VRAM Calculator உங்கள் GPU-க்கான fit முடிவுடன் கணக்கிடுகிறது.
சுருக்கம்
- முதலில் VRAM: 8 GB-ல் 7B, 12–16 GB-ல் 14B, 24 GB-ல் 32B – அனைத்தும் 4-bit quantization-ல். மற்றவை பிறகு.
- இரண்டாவது system RAM: குறைந்தது 16 GB, CPU offload backup வேண்டுமானால் 32 GB.
- மூன்றாவது CPU: 6+ நவீன cores; prompt வேகம், offload சுமை இதன் பொறுப்பு.
- நான்காவது Storage: மாடல் கோப்புகள் 5–40 GB – 512 GB NVMe SSD நடைமுறை குறைந்தபட்சம்.
- இறுதியில் PSU, cooling: load-இல் GPU மணிக்கணக்கில் முழு TDP இழுக்கும்; சோர்ந்த PSU விசித்திர "AI crash"-கள் தரும்.
1. VRAM: வாயிற்காவலன்
மாடல் VRAM-ல் பொருந்தும் அல்லது பொருந்தாது – 8 GB card-ல் 70B இயக்கும் "minimum settings"
mode இல்லை. Community-standard Q4_K_M quantization-ல், KV cache/overhead ~1–3 GB உடன்:
| Model size | Q4 weights | மொத்த தேவை | எதில் இயங்கும் |
|---|---|---|---|
| 7–8B | ~4–5 GB | ~6 GB | 8 GB card (RTX 4060, RX 7600) |
| 13–14B | ~9–10 GB | ~11 GB | 12–16 GB card |
| 27–32B | ~18–21 GB | ~22 GB | 24 GB card (RTX 4090, RX 7900 XTX) |
| 70B | ~40–45 GB | ~48 GB | Datacenter card/cloud – வீட்டு hardware அல்ல |
ஆரம்பநிலையினரை கடிக்கும் இரு குறிப்புகள்: நீண்ட context VRAM தின்னும் (128K context 3–6 GB KV cache சேர்க்கலாம் – முழு tier), உயர் quantization அதிக VRAM (Q8-ல் weights இரட்டிப்பு). பதிலுக்கு என்ன கிடைக்கும் என்பதை எங்கள் quantization வழிகாட்டி காட்டுகிறது.
2. System RAM: பாதுகாப்பு வலை
System RAM இரு இடங்களில் உதவும்: OS/browser/engine பங்கு (மூச்சுக்கே 8 GB), VRAM தீர்ந்தால் overflow RAM-க்கு போகும். எந்த local-AI machine-க்கும் 16 GB குறைந்தபட்சம்; CPU offload backup வேண்டுமானால் 32 GB – 16 GB card-ல் 30B Q4 32 GB system RAM-உடன் 5–15 tok/s-ல் நகரும். மெதுவு, ஆனால் இயங்கும் – இயங்காததை விட மேல்.
3. CPU: வேகம், fit அல்ல
CPU மாடல் load ஆகுமா என்பதை முடிவு செய்யாது – ஆனால் prompt-eval வேகம் (நீண்ட ஆவணங்கள் எவ்வளவு வேகமாக உள்வாங்கப்படும்), offload வலி ஆகியவற்றை முடிவு செய்யும். விதி: 6+ நவீன cores (கடந்த ஐந்தாண்டு Ryzen 5 / Core i5 எதுவும்). அதற்குக் கீழே, நீண்ட prompt-களில் நல்ல GPU கூட மந்தமாகத் தெரியும் – CPU feed செய்ய முடியாது.
4. Storage: நினைப்பதை விட பெரிது, வேகம்
மாடல் கோப்புகள் பெரியவை, சேர்த்துக்கொண்டே இருப்பீர்கள்: 7B quant ~5 GB, 32B quant ~20 GB, ஒப்பிட "சும்மா" மூன்று வைப்பீர்கள். 512 GB NVMe குறைந்தபட்சம், 1 TB வசதி. Load நேரத்தில் வேகம் முக்கியம் (NVMe vs SATA = நொடிகள் vs நிமிடம்), offload swap-லும் – மாடல்களை boot செய்யும் spinning drive-ல் வைக்காதீர்கள்.
5. PSU, cooling, OS: அலங்காரமில்லா மூவர்
- PSU: முழு inference load-இல் GPU மணிக்கணக்கில் TDP அருகே இழுக்கும். Mid-range-க்கு 650W தரமான unit, 24 GB flagship-களுக்கு 850W+. Load-இல் random crash = நிரூபிக்கும்வரை சாகும் PSU.
- Cooling: மணிக்கணக்கு 100% GPU பயன் gaming burst-களை விட சூடு. Radeon undervolt ~5% வேக இழப்பில் ~20% குறைவான சூடு – laptop-களில் மதிப்பு.
- OS/drivers: AMD-க்கு Linux + ROCm, NVIDIA-க்கு எந்த OS + CUDA. AMD பாதைக்கு எங்கள் ROCm vs Vulkan வழிகாட்டி, ROCm நிறுவல் வழிகாட்டி படிப்படியாக உள்ளன.
மூன்று machine-கள், தீர்ப்புகள்
- Thin laptop (integrated graphics, 16 GB RAM): CPU-ல் 7B Q4 சில tok/s, அல்லது சிறு மாடல்கள் மட்டும். Chat-க்கு சரி, agent-களுக்கு வேதனை.
- 2021 gaming laptop (RTX 3060 / RX 6800M, 12 GB VRAM, 32 GB RAM): sweet spot – 14B முழுதும், tuned quant-களுடன் 27–32B (எங்கள் Lab தினமும் இதே வகையில் இயங்குகிறது).
- 24 GB card Desktop: நீண்ட context-உடன் 32B முழுதும். பெரும்பாலான வேலைக்கு local சமரசமாகத் தெரியாத புள்ளி.
Bottom line
வரிசையாக சரிபார்க்கவும்: VRAM → RAM → CPU → storage → PSU. பெரும்பாலான "என்னில் local AI இயங்குமா?" கேள்விகளுக்கு முதல் படியில் விடை – 8 GB என்றால் 7B, 16 GB என்றால் 14B, 24 GB என்றால் 32B. பணம் செலவழிக்கும் முன் உங்கள் மாடலை VRAM calculator-ல் இயக்கி, பிறகே எந்த card என்று கேளுங்கள்.