ஒரு LLM-ஐ உள்ளூரில் இயக்குவது AI-இல் மிகச் சிறந்த தனியுரிமை/விலை ஒப்பந்தம் – சரியான GPU-ஐ தேர்வு செய்தால். இதை தவறாக செய்தால் நீங்கள் அதிக அட்டையை (வீண் பணம்) அல்லது குறைவாக (உங்கள் மாடல் பொருந்தாது) வாங்குகிறீர்கள். பட்ஜெட்டிலிருந்து ஆர்வலர் வரையிலான 2026-இன் நேர்மையான தேர்வு இதோ.
LLM VRAM கால்குலேட்டர் – உங்கள் இலக்கு மாதிரி பொருந்துமா? · GPU AI செயல்திறன் கால்குலேட்டர் – இது எவ்வளவு வேகமாக இயங்கும்?
கால்குலேட்டர்களை திறக்கவும் →விரைவான பதில்
- ஒட்டுமொத்தமாக சிறந்தது: RTX 4090 (24 GB) – 2026-இல் இன்னும் sweet spot.
- சிறந்த மதிப்பு நடுத்தர வரம்பு: RTX 5070 Ti (16 GB) அல்லது RX 9070 XT (16 GB) – வேகமானவை மற்றும் 14B மாதிரிகளை இடமிருந்து பொருத்துகின்றன.
- சிறந்த பட்ஜெட் நுழைவு: RTX 4060 Ti 16 GB – குறிப்பாக 16 GB பதிப்பு. இது 14B Q4-ஐ இயக்க முடியும், offload உடன் சிறிய 30B கூட.
- சிறந்த Radeon: RX 7900 XTX (24 GB) – AMD பக்கத்தில் ஒரு ரூபாய்க்கு அதிக VRAM.
- சிறந்த பயன்படுத்திய பேரம்: RX 6800M (12 GB) அல்லது விலை சரியாக இருந்தால் பயன்படுத்திய 3090 (24 GB).
உள்ளூர் LLMகளுக்கு உண்மையில் எது முக்கியம்
இந்த வரிசையில் மூன்று விஷயங்கள்:
- VRAM தான் எல்லாம். மாதிரி மற்றும் அதன் KV கேச் VRAM-இல் பொருந்த வேண்டும், இல்லையெனில் நீங்கள் RAM-க்கு offload செய்து தவழ்கிறீர்கள். எந்த மாதிரிகளை இயக்க முடியும் என்பதை தீர்மானிக்கும் கடினமான வரம்பு இதுவே.
- மெமரி பேண்ட்விட்த் உங்கள் வேகத்தை நிர்ணயிக்கிறது. உரை உருவாக்கம் (decode) மெமரி-சார்ந்தது – GPU ஒவ்வொரு டோக்கனிலும் முழு மாதிரியையும் படிக்கிறது. அதிக பேண்ட்விட்த் = ஒரு நொடிக்கு அதிக டோக்கன்கள்.
- கம்ப்யூட் குறைவாக முக்கியம். மூல TFLOPS ப்ராம்ப்ட் பிராசசிங்கின் போது (prefill) மட்டுமே பிரகாசிக்கிறது. அரட்டைக்கு, நிறைய பேண்ட்விட்த் கொண்ட அட்டை நிறைய கம்ப்யூட் கொண்டதை விட வெல்லும்.
எனவே வாங்கும் விதி எளிது: உங்களால் முடிந்த அதிக VRAM-ஐ வாங்குங்கள், பின்னர் அந்த VRAM வகுப்பில் அதிக மெமரி பேண்ட்விட்த்.
2026 வரிசை, ஒப்பிடப்பட்டது
Q4_K_M இல் ஒரு 14B மாதிரிக்கான மதிப்பிடப்பட்ட decode வேகங்கள் (llama.cpp வழியாக). உங்கள் முடிவுகள் காண்டெக்ஸ்ட், எஞ்சின், மற்றும் குளிரூட்டலைப் பொறுத்து மாறுபடும்.
GPU VRAM Bandwidth Qwen 7B Q4 Qwen 14B Q4 Qwen 27B Q4 ~Price (INR) ──────────────────────────────────────────────────────────────────────────────────────── RTX 4060 8 GB 272 GB/s ~40 tok/s offload only ✗ ₹30,000 RTX 4060 Ti 16 GB 288 GB/s ~42 tok/s ~40 tok/s offload only ₹48,000 RX 7600 XT 16 GB 288 GB/s ~42 tok/s ~40 tok/s offload only ₹38,000 RX 7700 XT 12 GB 432 GB/s ~55 tok/s offload only ✗ ₹40,000 RTX 5070 Ti 16 GB 896 GB/s ~95 tok/s ~90 tok/s offload only ₹80,000 RX 9070 XT 16 GB 644 GB/s ~72 tok/s ~68 tok/s offload only ₹65,000 RTX 4090 24 GB 1008 GB/s ~160 tok/s ~120 tok/s ~60 tok/s ₹1,50,000+ RX 7900 XTX 24 GB 960 GB/s ~150 tok/s ~115 tok/s ~58 tok/s ₹1,20,000
"Offload only" = VRAM-இல் முழுமையாக பொருந்தாது; பாகங்கள் சிஸ்டம் RAM-இல் இயங்கும், இது மிகவும் மெதுவானது. எண்கள் GPU AI செயல்திறன் கால்குலேட்டரில் இருந்து மதிப்பீடுகள்.
ஒட்டுமொத்தமாக சிறந்தது: RTX 4090 (24 GB)
4090 2026-இல் இன்னும் பெஞ்ச்மார்க். 24 GB VRAM, மிகப்பெரிய காண்டெக்ஸ்டுடன் 14B Q4-ஐ இயக்குகிறது, 27B-வகை மாதிரிகளை முழுவதுமாக GPU-இல், மேலும் இது ப்ராம்ப்ட் பிராசசிங்கிற்கு மிக வேகமான கன்ஸ்யூமர் அட்டை. RTX 5090 (32 GB) வேகமானது மற்றும் பெரிய மாதிரிகளை பொருத்துகிறது, ஆனால் அது அதிக செலவாகும் – பெரும்பாலான மக்களுக்கு 4090 (அல்லது பயன்படுத்தியது) புத்திசாலித்தனமான வாங்கல்.
Amazon-இல் தற்போதைய விலையை சரிபார்க்கவும் →
சிறந்த மதிப்பு நடுத்தர வரம்பு: RTX 5070 Ti / RX 9070 XT (16 GB)
4090-ஐ நியாயப்படுத்த முடியாவிட்டால், நான் வாங்கும் வகுப்பு இது. 16 GB 14B Q4_K_M-ஐ 16–32K காண்டெக்ஸ்டுடன் வசதியாக பொருத்துகிறது, மற்றும் இலகுவான offload உடன் 27B Q4 கூட. RTX 5070 Ti-க்கு 4060 Ti-ஐ விட கிட்டத்தட்ட இரட்டை பேண்ட்விட்த் உள்ளது – அது ஒரு நொடிக்கு தோராயமாக 2× டோக்கன்களாக தோன்றும். AMD பக்கத்தில் RX 9070 XT வலுவான ROCm ஆதரவுடன் ஒரு திடமான மாற்று.
RTX 5070 Ti Amazon-இல் → · RX 9070 XT Amazon-இல் →
சிறந்த பட்ஜெட்: RTX 4060 Ti 16 GB
AI-க்கு வாங்க வேண்டியது 16 GB பதிப்பு. ஆம், இது 8 GB மாடலை விட மெதுவாக இருக்கிறது – ஆனால் 8 GB பதிப்பு 14B Q4-ஐ முழுவதுமாக GPU-இல் இயக்க முடியாது, 16 GB பதிப்பு அதை இன்னும் மரியாதைக்குரிய ~40 tok/s இல் செய்ய முடியும். ஒரு பொம்மைக்கும் பயன்படக்கூடிய உள்ளூர் உதவியாளருக்கும் இடையிலான வித்தியாசம் அதுவே. RX 7600 XT 16 GB Radeon சமமானது மற்றும் பொதுவாக மலிவானது.
RTX 4060 Ti 16 GB Amazon-இல் → · RX 7600 XT 16 GB Amazon-இல் →
உள்ளூர் AI-க்கு AMD vs NVIDIA
பழைய "AMD AI-க்கு நம்பிக்கையற்றது" ஆலோசனை காலாவதியானது. RDNA2/RDNA3 அட்டைகளுக்கு llama.cpp, Ollama, மற்றும் LM Studio உடன் ROCm நன்றாக வேலை செய்கிறது – எங்கள் ROCm நிறுவல் வழிகாட்டியை பார்க்கவும். VRAM per rupee இல் AMD இன்னும் வெற்றி பெறுகிறது (RX 7900 XTX சுற்றி மிக மலிவான 24 GB அட்டை), மென்பொருள் நேர்த்தி, CUDA லைப்ரரிகள், மற்றும் prefill வேகத்தில் NVIDIA வெற்றி பெறுகிறது. தூய உள்ளூர்-அரட்டை அமைப்பிற்கு, இரண்டும் நன்றாக இருக்கின்றன.
பயன்படுத்திய சந்தை எப்படி?
- RX 6800M (12 GB) – மலிவான பயன்படுத்திய பலகைகளில் தோன்றும் லேப்டாப் சிப்; 7B–14B வேலைக்கு சிறந்த விலை/VRAM. இதை நாங்கள் முன்பே உள்ளடக்கியுள்ளோம் – இது ஒரு சிறந்த முதல் உள்ளூர்-AI அட்டை.
- பயன்படுத்திய RTX 3090 (24 GB) – ₹60–70k அருகே ஒன்றை கண்டால், அது AI-க்கு ஒரு பட்ஜெட் 4090.
- 7B-க்கு மேல் எதற்கும் 8 GB அட்டைகளை தவிர்க்கவும் – தொடர்ந்து offload உடன் போராடுவீர்கள்.
RX 6800M Amazon-இல் தேடுங்கள் →
கட்டமைப்பின் மற்ற பகுதிகளை மறக்காதீர்கள்
VRAM தான் நட்சத்திரம், ஆனால் மெதுவான CPU அல்லது போதுமான சிஸ்டம் RAM இல்லாதது நீங்கள் offload செய்யும்போது தடையாக மாறும். 16–32 GB சிஸ்டம் RAM மற்றும் மாதிரி கோப்புகளை ஏற்றுவதற்கு ஒரு நல்ல NVMe ஐ இலக்காக கொள்ளுங்கள். அந்த 4090-ஐ வாங்குவதற்கு முன் PSU கால்குலேட்டருடன் உங்கள் முழு கட்டமைப்பை சரிபார்க்கவும்.
FAQ
கன்ஸ்யூமர் வன்பொருளில் 70B மாதிரியை இயக்க முடியுமா?
GPU-இல் உண்மையில் இல்லை. 70B Q4-க்கு ~40–45 GB தேவை – அது கிளவுட் GPU எல்லை. 4090 அதை கனமான offload உடன் இயக்க முடியும், ஆனால் அரட்டைக்கு பயன்படுத்த முடியாத அளவுக்கு மெதுவாக இருக்கும்.
8 GB VRAM போதுமானதா?
7B Q4 மாதிரிகளுக்கு, ஆம் – கடினமாக. அதைவிட பெரியதற்கு, இல்லை. அதனால்தான் இந்த பக்கத்தில் உள்ள ஒவ்வொரு பட்ஜெட் தேர்வும் 16 GB.
NVIDIA CUDA அவ்வளவு முக்கியமா?
Prefill வேகம் மற்றும் விசித்திர லைப்ரரிகளுக்கு, ஆம். அன்றாட llama.cpp/Ollama அரட்டைக்கு, வித்தியாசம் நிறைய குறைந்துள்ளது – Radeon நன்றாக உள்ளது.
Apple Silicon பற்றி என்ன?
Unified memory Macகள் (M-சீரிஸ் 32–64 GB உடன்) உள்ளூர் LLMகளுக்கு உண்மையில் சிறந்தவை – அது ஒரு தனி கட்டுரை. டெஸ்க்டாப் பக்கத்தில், இந்த பக்கம் NVIDIA/AMD GPUகளை பற்றியது.
இறுதி முடிவு
இந்த வரிசையில் உங்களால் முடிந்த அதிக VRAM-ஐ வாங்குங்கள்: 24 GB (4090/7900 XTX) → 16 GB (5070 Ti / 9070 XT / 4060 Ti) → 12 GB பயன்படுத்தியது (6800M) → மற்றவை அனைத்தும் சமரசம். பின்னர் உங்கள் சரியான மாதிரி மற்றும் காண்டெக்ஸ்டை கீழே உள்ள கால்குலேட்டர்களில் இணைத்து நம்பிக்கையுடன் வாங்குங்கள்.
LLM VRAM கால்குலேட்டர் + GPU AI செயல்திறன் கால்குலேட்டர் – உங்கள் மாதிரி, குவாண்ட், மற்றும் காண்டெக்ஸ்டிற்கான சரியான எண்கள்.
அனைத்து கருவிகளையும் பாருங்கள் →