உள்ளூர் AI இல் மிகவும் பொதுவான கேள்வி "என் GPU இந்த மாடலை இயக்க முடியுமா?" என்பதே. பதில் ஒரே ஒரு எண்ணைச் சார்ந்துள்ளது: VRAM. சுமார் முப்பது வினாடிகளில் அதை நீங்களே எவ்வாறு மதிப்பிடுவது என்பது இங்கே – மேலும் பிரபலமான மாடல் அளவுகளுக்கான ஏமாற்றுத் தாளும்.
உங்கள் GPU க்கு பொருந்துகிறதா என்பதைச் சரிபார்த்து, உங்கள் மாடல், குவாண்டைசேஷன், கான்டெக்ஸ்ட் ஆகியவற்றைத் தேர்ந்தெடுத்து சரியான VRAM மதிப்பீட்டைப் பெறுங்கள்.
LLM VRAM கால்குலேட்டரைத் திற →விரைவான பதில்
8K கான்டெக்ஸ்ட்டில் மாடலுக்கு மட்டுமே (எடைகள்) தேவையான VRAM, கூடுதலாக KV கேச் + ஓவர்ஹெட்டுக்கு ~1–3 GB:
Model size Q4_K_M Q8_0 FP16 ────────────────────────────────────────────── 7–8B ~4–5 GB ~8–9 GB ~15–16 GB 13–14B ~9–10 GB ~16–17 GB ~30 GB 27–32B ~18–21 GB ~32–35 GB ~60+ GB 70B ~40–45 GB ~75 GB cloud only
அதை GPU களுக்கு மொழிபெயர்க்க: 8 GB கார்டு 7B Q4 ஐ இயக்கும். 16 GB கார்டு சிறந்த தேர்வு – 14B Q4 முழுமையாக, 32B ஐ லேசான ஆஃப்லோடுடன் இயக்கும். 24 GB கார்டு 32B Q4 ஐ முழுமையாக இயக்கும். அதனால்தான் எங்கள் உள்ளூர் LLM களுக்கான சிறந்த GPU தேர்வுகளில் "16 GB" தொடர்ந்து இடம்பெறுகிறது.
VRAM ஐ உண்மையில் எது சாப்பிடுகிறது
மூன்று விஷயங்கள், அவை அனைத்தையும் நீங்கள் கூட்ட வேண்டும்:
- மாடல் எடைகள் – முக்கியமானது. ஏறத்தாழ
parameters × bytes per weight. Q4_K_M இல் அது ~0.6 பைட்டுகள்/எடை; Q8_0 இல் ~1.06; FP16 இல் சரியாக 2. - KV கேச் – கான்டெக்ஸ்ட் நீளம் மற்றும் பேட்ச் அளவுடன் வளர்கிறது. 8K இல் சிறியது, 128K இல் குறிப்பிடத்தக்கது. 7B க்கு அது 8K இல் ~0.5 GB, 64K+ இல் ~3–4 GB.
- ஓவர்ஹெட் – CUDA கான்டெக்ஸ்ட், எஞ்சின் பஃபர்கள், டோக்கனைசர்: பொதுவாக கூடுதலாக ~0.5–1.5 GB.
எனவே 8K கான்டெக்ஸ்ட்டுடன் Q4_K_M இல் உள்ள 7B ≈ 4.5 GB எடைகள் + 0.5 GB KV + ~0.5 GB ஓவர்ஹெட் ≈ 5.5 GB. 8 GB கார்டில் வசதியாக இயங்கும், 6 GB இல் இறுக்கமாக இருக்கும்.
7B மாடல்கள்: அடிப்படை நிலை
- Q4_K_M (~4.5 GB) – 8 GB GPU (RTX 4060, RX 7600) இல் கான்டெக்ஸ்டுக்கு இடம் அளித்து இயங்கும்.
- Q8_0 (~8 GB) – 8 GB கார்டு விளிம்பில் உள்ளது; 12 GB வசதியானது.
- FP16 (~16 GB) – உங்களுக்கு 16 GB கார்டு தேவை; அந்த நிலையில் பொதுவாக 14B Q4 ஐ இயக்குவதே நல்லது.
13–14B மாடல்கள்: நடைமுறைச் சிறந்த தேர்வு
- Q4_K_M (~9–10 GB) – 12 GB இயக்கும்; 16 GB (RTX 4060 Ti 16 GB, RX 7600 XT) நீண்ட கான்டெக்ஸ்டுடன் இயக்கும்.
- Q8_0 (~16 GB) – 16 GB கார்டு குறுகிய கான்டெக்ஸ்டுடன் இயக்கும்; 24 GB வசதியானது.
- FP16 (~30 GB) – ஆஃப்லோடுடன் 24 GB கார்டு, அல்லது கிளவுட் தேவை.
~40–50 tok/s இல் உள்ள 14B Q4, உள்ளூர் மாடல் டெமோ போல் உணர்வதை நிறுத்தி, பயனுள்ள உதவியாளராக உணரத் தொடங்கும் இடமாகும்.
27–32B மாடல்கள்: 24 GB மதிப்பு பெறும் இடம்
- Q4_K_M (~20 GB + KV) – 24 GB GPU (RTX 4090, RX 7900 XTX) 32B Q4 ஐ 8–16K கான்டெக்ஸ்ட்டுடன் இயக்கும். 32K கான்டெக்ஸ்ட்டில் நீங்கள் சரியாக விளிம்பில் இருக்கிறீர்கள்.
- Q8_0 (~32 GB) – நுகர்வோர் கார்டுகளுக்கு அப்பால்; 32 GB கார்டு அல்லது கிளவுட் தேவை.
16–32 GB சிஸ்டம் RAM இருந்தால், 16 GB கார்டு பகுதி ஆஃப்லோடு மூலம் 30B Q4 ஐ இயக்க முடியும் – இது வேலை செய்யும், ஆனால் உருவாக்கம் மிகவும் மெதுவாகும் (பெரும்பாலும் 5–15 tok/s).
கான்டெக்ஸ்ட் நீளம் மறைந்திருக்கும் மாறி
கான்டெக்ஸ்ட்டை இரட்டிப்பாக்குவது KV கேச்யை ஏறத்தாழ இரட்டிப்பாக்கும். 128K கான்டெக்ஸ்ட்டில், KV கேச் மட்டுமே 3–6 GB ஆக இருக்கலாம் – அது முழு குவாண்டைசேஷன் நிலையின் நினைவக அளவு. நீண்ட ஆவணங்களைத் திட்டமிடுகிறீர்கள் என்றால், பெரிய கார்டை வாங்குங்கள் அல்லது உங்கள் கான்டெக்ஸ்ட்டைக் குறைக்கவும்.
அடிக்கடி கேட்கப்படும் கேள்விகள்
எடைகளுக்கு தேவையானதை விட குறைந்த VRAM உடன் மாடலை இயக்க முடியுமா?
சில அடுக்குகளை சிஸ்டம் RAM க்கு ஆஃப்லோடு செய்வதன் மூலம் மட்டுமே. அது வேலை செய்யும், ஆனால் ஒவ்வொரு ஆஃப்லோடு செய்யப்பட்ட அடுக்கும் உருவாக்கத்தை மெதுவாக்கும். அதிக RAM உதவும்; அது VRAM ஐ மாற்றாது.
CPU அல்லது GPU வேகம் மேற்கண்ட எண்களுக்கு முக்கியமா?
பொருத்தத்திற்கு இல்லை – VRAM திறன் பற்றியது. வேகம் தனித்தனியாக tokens/sec க்கு முக்கியம்.
குறைந்தபட்ச பயன்படுத்தக்கூடிய அமைப்பு எது?
8 GB VRAM + 16 GB சிஸ்டம் RAM, 7B Q4 உள்ளூர் உதவியாளரை நன்றாக இயக்கும். அங்கிருந்து, VRAM தான் முக்கியமான மேம்படுத்தல்.
இறுதி முடிவு
8 GB → 7B. 16 GB → 14B. 24 GB → 32B. நீண்ட கான்டெக்ஸ்ட்டுக்கு ~1–3 GB சேர்க்கவும், மேலும் குவாண்டைசேஷனை அறியாமல் எந்த VRAM கூற்றையும் நம்ப வேண்டாம். கார்டு வாங்குவதற்கு முன் கீழே உள்ள கால்குலேட்டருடன் உங்கள் சரியான மாடலைச் சரிபார்க்கவும்.
LLM VRAM கால்குலேட்டர் – எடைகள் + KV கேச் + பொருத்துதல் முடிவு. பிறகு GPU AI செயல்திறன் கால்குலேட்டருடன் எவ்வளவு வேகமாக இயங்கும் என்று பாருங்கள்.
கால்குலேட்டரைத் திற →