ஒரு LLM-ஐ உள்ளூரில் இயக்குவது AI-இல் மிகச் சிறந்த தனியுரிமை/விலை ஒப்பந்தம் – சரியான GPU-ஐ தேர்வு செய்தால். இதை தவறாக செய்தால் நீங்கள் அதிக அட்டையை (வீண் பணம்) அல்லது குறைவாக (உங்கள் மாடல் பொருந்தாது) வாங்குகிறீர்கள். பட்ஜெட்டிலிருந்து ஆர்வலர் வரையிலான 2026-இன் நேர்மையான தேர்வு இதோ.

🔧 முதலில், உங்கள் அமைப்பிற்கான எண்களை சரிபார்க்கவும்

LLM VRAM கால்குலேட்டர் – உங்கள் இலக்கு மாதிரி பொருந்துமா? · GPU AI செயல்திறன் கால்குலேட்டர் – இது எவ்வளவு வேகமாக இயங்கும்?

கால்குலேட்டர்களை திறக்கவும் →

விரைவான பதில்

உள்ளூர் LLMகளுக்கு உண்மையில் எது முக்கியம்

இந்த வரிசையில் மூன்று விஷயங்கள்:

  1. VRAM தான் எல்லாம். மாதிரி மற்றும் அதன் KV கேச் VRAM-இல் பொருந்த வேண்டும், இல்லையெனில் நீங்கள் RAM-க்கு offload செய்து தவழ்கிறீர்கள். எந்த மாதிரிகளை இயக்க முடியும் என்பதை தீர்மானிக்கும் கடினமான வரம்பு இதுவே.
  2. மெமரி பேண்ட்விட்த் உங்கள் வேகத்தை நிர்ணயிக்கிறது. உரை உருவாக்கம் (decode) மெமரி-சார்ந்தது – GPU ஒவ்வொரு டோக்கனிலும் முழு மாதிரியையும் படிக்கிறது. அதிக பேண்ட்விட்த் = ஒரு நொடிக்கு அதிக டோக்கன்கள்.
  3. கம்ப்யூட் குறைவாக முக்கியம். மூல TFLOPS ப்ராம்ப்ட் பிராசசிங்கின் போது (prefill) மட்டுமே பிரகாசிக்கிறது. அரட்டைக்கு, நிறைய பேண்ட்விட்த் கொண்ட அட்டை நிறைய கம்ப்யூட் கொண்டதை விட வெல்லும்.

எனவே வாங்கும் விதி எளிது: உங்களால் முடிந்த அதிக VRAM-ஐ வாங்குங்கள், பின்னர் அந்த VRAM வகுப்பில் அதிக மெமரி பேண்ட்விட்த்.

2026 வரிசை, ஒப்பிடப்பட்டது

Q4_K_M இல் ஒரு 14B மாதிரிக்கான மதிப்பிடப்பட்ட decode வேகங்கள் (llama.cpp வழியாக). உங்கள் முடிவுகள் காண்டெக்ஸ்ட், எஞ்சின், மற்றும் குளிரூட்டலைப் பொறுத்து மாறுபடும்.

GPU             VRAM   Bandwidth   Qwen 7B Q4   Qwen 14B Q4   Qwen 27B Q4   ~Price (INR)
────────────────────────────────────────────────────────────────────────────────────────
RTX 4060       8 GB    272 GB/s    ~40 tok/s    offload only   ✗             ₹30,000
RTX 4060 Ti    16 GB   288 GB/s    ~42 tok/s    ~40 tok/s     offload only  ₹48,000
RX 7600 XT     16 GB   288 GB/s    ~42 tok/s    ~40 tok/s     offload only  ₹38,000
RX 7700 XT     12 GB   432 GB/s    ~55 tok/s    offload only  ✗             ₹40,000
RTX 5070 Ti    16 GB   896 GB/s    ~95 tok/s    ~90 tok/s     offload only  ₹80,000
RX 9070 XT     16 GB   644 GB/s    ~72 tok/s    ~68 tok/s     offload only  ₹65,000
RTX 4090       24 GB  1008 GB/s   ~160 tok/s   ~120 tok/s    ~60 tok/s     ₹1,50,000+
RX 7900 XTX    24 GB   960 GB/s   ~150 tok/s   ~115 tok/s    ~58 tok/s     ₹1,20,000

"Offload only" = VRAM-இல் முழுமையாக பொருந்தாது; பாகங்கள் சிஸ்டம் RAM-இல் இயங்கும், இது மிகவும் மெதுவானது. எண்கள் GPU AI செயல்திறன் கால்குலேட்டரில் இருந்து மதிப்பீடுகள்.

ஒட்டுமொத்தமாக சிறந்தது: RTX 4090 (24 GB)

4090 2026-இல் இன்னும் பெஞ்ச்மார்க். 24 GB VRAM, மிகப்பெரிய காண்டெக்ஸ்டுடன் 14B Q4-ஐ இயக்குகிறது, 27B-வகை மாதிரிகளை முழுவதுமாக GPU-இல், மேலும் இது ப்ராம்ப்ட் பிராசசிங்கிற்கு மிக வேகமான கன்ஸ்யூமர் அட்டை. RTX 5090 (32 GB) வேகமானது மற்றும் பெரிய மாதிரிகளை பொருத்துகிறது, ஆனால் அது அதிக செலவாகும் – பெரும்பாலான மக்களுக்கு 4090 (அல்லது பயன்படுத்தியது) புத்திசாலித்தனமான வாங்கல்.

Amazon-இல் தற்போதைய விலையை சரிபார்க்கவும் →

சிறந்த மதிப்பு நடுத்தர வரம்பு: RTX 5070 Ti / RX 9070 XT (16 GB)

4090-ஐ நியாயப்படுத்த முடியாவிட்டால், நான் வாங்கும் வகுப்பு இது. 16 GB 14B Q4_K_M-ஐ 16–32K காண்டெக்ஸ்டுடன் வசதியாக பொருத்துகிறது, மற்றும் இலகுவான offload உடன் 27B Q4 கூட. RTX 5070 Ti-க்கு 4060 Ti-ஐ விட கிட்டத்தட்ட இரட்டை பேண்ட்விட்த் உள்ளது – அது ஒரு நொடிக்கு தோராயமாக 2× டோக்கன்களாக தோன்றும். AMD பக்கத்தில் RX 9070 XT வலுவான ROCm ஆதரவுடன் ஒரு திடமான மாற்று.

RTX 5070 Ti Amazon-இல் → · RX 9070 XT Amazon-இல் →

சிறந்த பட்ஜெட்: RTX 4060 Ti 16 GB

AI-க்கு வாங்க வேண்டியது 16 GB பதிப்பு. ஆம், இது 8 GB மாடலை விட மெதுவாக இருக்கிறது – ஆனால் 8 GB பதிப்பு 14B Q4-ஐ முழுவதுமாக GPU-இல் இயக்க முடியாது, 16 GB பதிப்பு அதை இன்னும் மரியாதைக்குரிய ~40 tok/s இல் செய்ய முடியும். ஒரு பொம்மைக்கும் பயன்படக்கூடிய உள்ளூர் உதவியாளருக்கும் இடையிலான வித்தியாசம் அதுவே. RX 7600 XT 16 GB Radeon சமமானது மற்றும் பொதுவாக மலிவானது.

RTX 4060 Ti 16 GB Amazon-இல் → · RX 7600 XT 16 GB Amazon-இல் →

உள்ளூர் AI-க்கு AMD vs NVIDIA

பழைய "AMD AI-க்கு நம்பிக்கையற்றது" ஆலோசனை காலாவதியானது. RDNA2/RDNA3 அட்டைகளுக்கு llama.cpp, Ollama, மற்றும் LM Studio உடன் ROCm நன்றாக வேலை செய்கிறது – எங்கள் ROCm நிறுவல் வழிகாட்டியை பார்க்கவும். VRAM per rupee இல் AMD இன்னும் வெற்றி பெறுகிறது (RX 7900 XTX சுற்றி மிக மலிவான 24 GB அட்டை), மென்பொருள் நேர்த்தி, CUDA லைப்ரரிகள், மற்றும் prefill வேகத்தில் NVIDIA வெற்றி பெறுகிறது. தூய உள்ளூர்-அரட்டை அமைப்பிற்கு, இரண்டும் நன்றாக இருக்கின்றன.

பயன்படுத்திய சந்தை எப்படி?

RX 6800M Amazon-இல் தேடுங்கள் →

கட்டமைப்பின் மற்ற பகுதிகளை மறக்காதீர்கள்

VRAM தான் நட்சத்திரம், ஆனால் மெதுவான CPU அல்லது போதுமான சிஸ்டம் RAM இல்லாதது நீங்கள் offload செய்யும்போது தடையாக மாறும். 16–32 GB சிஸ்டம் RAM மற்றும் மாதிரி கோப்புகளை ஏற்றுவதற்கு ஒரு நல்ல NVMe ஐ இலக்காக கொள்ளுங்கள். அந்த 4090-ஐ வாங்குவதற்கு முன் PSU கால்குலேட்டருடன் உங்கள் முழு கட்டமைப்பை சரிபார்க்கவும்.

FAQ

கன்ஸ்யூமர் வன்பொருளில் 70B மாதிரியை இயக்க முடியுமா?

GPU-இல் உண்மையில் இல்லை. 70B Q4-க்கு ~40–45 GB தேவை – அது கிளவுட் GPU எல்லை. 4090 அதை கனமான offload உடன் இயக்க முடியும், ஆனால் அரட்டைக்கு பயன்படுத்த முடியாத அளவுக்கு மெதுவாக இருக்கும்.

8 GB VRAM போதுமானதா?

7B Q4 மாதிரிகளுக்கு, ஆம் – கடினமாக. அதைவிட பெரியதற்கு, இல்லை. அதனால்தான் இந்த பக்கத்தில் உள்ள ஒவ்வொரு பட்ஜெட் தேர்வும் 16 GB.

NVIDIA CUDA அவ்வளவு முக்கியமா?

Prefill வேகம் மற்றும் விசித்திர லைப்ரரிகளுக்கு, ஆம். அன்றாட llama.cpp/Ollama அரட்டைக்கு, வித்தியாசம் நிறைய குறைந்துள்ளது – Radeon நன்றாக உள்ளது.

Apple Silicon பற்றி என்ன?

Unified memory Macகள் (M-சீரிஸ் 32–64 GB உடன்) உள்ளூர் LLMகளுக்கு உண்மையில் சிறந்தவை – அது ஒரு தனி கட்டுரை. டெஸ்க்டாப் பக்கத்தில், இந்த பக்கம் NVIDIA/AMD GPUகளை பற்றியது.

இறுதி முடிவு

இந்த வரிசையில் உங்களால் முடிந்த அதிக VRAM-ஐ வாங்குங்கள்: 24 GB (4090/7900 XTX) → 16 GB (5070 Ti / 9070 XT / 4060 Ti) → 12 GB பயன்படுத்தியது (6800M) → மற்றவை அனைத்தும் சமரசம். பின்னர் உங்கள் சரியான மாதிரி மற்றும் காண்டெக்ஸ்டை கீழே உள்ள கால்குலேட்டர்களில் இணைத்து நம்பிக்கையுடன் வாங்குங்கள்.

🔧 செலவு செய்வதற்கு முன் பொருத்தத்தை கணக்கிடுங்கள்

LLM VRAM கால்குலேட்டர் + GPU AI செயல்திறன் கால்குலேட்டர் – உங்கள் மாதிரி, குவாண்ட், மற்றும் காண்டெக்ஸ்டிற்கான சரியான எண்கள்.

அனைத்து கருவிகளையும் பாருங்கள் →