உள்ளூர் AI இல் மிகவும் பொதுவான கேள்வி "என் GPU இந்த மாடலை இயக்க முடியுமா?" என்பதே. பதில் ஒரே ஒரு எண்ணைச் சார்ந்துள்ளது: VRAM. சுமார் முப்பது வினாடிகளில் அதை நீங்களே எவ்வாறு மதிப்பிடுவது என்பது இங்கே – மேலும் பிரபலமான மாடல் அளவுகளுக்கான ஏமாற்றுத் தாளும்.

🔧 கணிதத்தைத் தவிர்க்கவும் – கால்குலேட்டரைப் பயன்படுத்தவும்

உங்கள் GPU க்கு பொருந்துகிறதா என்பதைச் சரிபார்த்து, உங்கள் மாடல், குவாண்டைசேஷன், கான்டெக்ஸ்ட் ஆகியவற்றைத் தேர்ந்தெடுத்து சரியான VRAM மதிப்பீட்டைப் பெறுங்கள்.

LLM VRAM கால்குலேட்டரைத் திற →

விரைவான பதில்

8K கான்டெக்ஸ்ட்டில் மாடலுக்கு மட்டுமே (எடைகள்) தேவையான VRAM, கூடுதலாக KV கேச் + ஓவர்ஹெட்டுக்கு ~1–3 GB:

Model size   Q4_K_M        Q8_0          FP16
──────────────────────────────────────────────
7–8B         ~4–5 GB      ~8–9 GB      ~15–16 GB
13–14B       ~9–10 GB     ~16–17 GB    ~30 GB
27–32B       ~18–21 GB    ~32–35 GB    ~60+ GB
70B          ~40–45 GB    ~75 GB       cloud only

அதை GPU களுக்கு மொழிபெயர்க்க: 8 GB கார்டு 7B Q4 ஐ இயக்கும். 16 GB கார்டு சிறந்த தேர்வு – 14B Q4 முழுமையாக, 32B ஐ லேசான ஆஃப்லோடுடன் இயக்கும். 24 GB கார்டு 32B Q4 ஐ முழுமையாக இயக்கும். அதனால்தான் எங்கள் உள்ளூர் LLM களுக்கான சிறந்த GPU தேர்வுகளில் "16 GB" தொடர்ந்து இடம்பெறுகிறது.

VRAM ஐ உண்மையில் எது சாப்பிடுகிறது

மூன்று விஷயங்கள், அவை அனைத்தையும் நீங்கள் கூட்ட வேண்டும்:

  1. மாடல் எடைகள் – முக்கியமானது. ஏறத்தாழ parameters × bytes per weight. Q4_K_M இல் அது ~0.6 பைட்டுகள்/எடை; Q8_0 இல் ~1.06; FP16 இல் சரியாக 2.
  2. KV கேச் – கான்டெக்ஸ்ட் நீளம் மற்றும் பேட்ச் அளவுடன் வளர்கிறது. 8K இல் சிறியது, 128K இல் குறிப்பிடத்தக்கது. 7B க்கு அது 8K இல் ~0.5 GB, 64K+ இல் ~3–4 GB.
  3. ஓவர்ஹெட் – CUDA கான்டெக்ஸ்ட், எஞ்சின் பஃபர்கள், டோக்கனைசர்: பொதுவாக கூடுதலாக ~0.5–1.5 GB.

எனவே 8K கான்டெக்ஸ்ட்டுடன் Q4_K_M இல் உள்ள 7B ≈ 4.5 GB எடைகள் + 0.5 GB KV + ~0.5 GB ஓவர்ஹெட் ≈ 5.5 GB. 8 GB கார்டில் வசதியாக இயங்கும், 6 GB இல் இறுக்கமாக இருக்கும்.

7B மாடல்கள்: அடிப்படை நிலை

13–14B மாடல்கள்: நடைமுறைச் சிறந்த தேர்வு

~40–50 tok/s இல் உள்ள 14B Q4, உள்ளூர் மாடல் டெமோ போல் உணர்வதை நிறுத்தி, பயனுள்ள உதவியாளராக உணரத் தொடங்கும் இடமாகும்.

27–32B மாடல்கள்: 24 GB மதிப்பு பெறும் இடம்

16–32 GB சிஸ்டம் RAM இருந்தால், 16 GB கார்டு பகுதி ஆஃப்லோடு மூலம் 30B Q4 ஐ இயக்க முடியும் – இது வேலை செய்யும், ஆனால் உருவாக்கம் மிகவும் மெதுவாகும் (பெரும்பாலும் 5–15 tok/s).

கான்டெக்ஸ்ட் நீளம் மறைந்திருக்கும் மாறி

கான்டெக்ஸ்ட்டை இரட்டிப்பாக்குவது KV கேச்யை ஏறத்தாழ இரட்டிப்பாக்கும். 128K கான்டெக்ஸ்ட்டில், KV கேச் மட்டுமே 3–6 GB ஆக இருக்கலாம் – அது முழு குவாண்டைசேஷன் நிலையின் நினைவக அளவு. நீண்ட ஆவணங்களைத் திட்டமிடுகிறீர்கள் என்றால், பெரிய கார்டை வாங்குங்கள் அல்லது உங்கள் கான்டெக்ஸ்ட்டைக் குறைக்கவும்.

அடிக்கடி கேட்கப்படும் கேள்விகள்

எடைகளுக்கு தேவையானதை விட குறைந்த VRAM உடன் மாடலை இயக்க முடியுமா?

சில அடுக்குகளை சிஸ்டம் RAM க்கு ஆஃப்லோடு செய்வதன் மூலம் மட்டுமே. அது வேலை செய்யும், ஆனால் ஒவ்வொரு ஆஃப்லோடு செய்யப்பட்ட அடுக்கும் உருவாக்கத்தை மெதுவாக்கும். அதிக RAM உதவும்; அது VRAM ஐ மாற்றாது.

CPU அல்லது GPU வேகம் மேற்கண்ட எண்களுக்கு முக்கியமா?

பொருத்தத்திற்கு இல்லை – VRAM திறன் பற்றியது. வேகம் தனித்தனியாக tokens/sec க்கு முக்கியம்.

குறைந்தபட்ச பயன்படுத்தக்கூடிய அமைப்பு எது?

8 GB VRAM + 16 GB சிஸ்டம் RAM, 7B Q4 உள்ளூர் உதவியாளரை நன்றாக இயக்கும். அங்கிருந்து, VRAM தான் முக்கியமான மேம்படுத்தல்.

இறுதி முடிவு

8 GB → 7B. 16 GB → 14B. 24 GB → 32B. நீண்ட கான்டெக்ஸ்ட்டுக்கு ~1–3 GB சேர்க்கவும், மேலும் குவாண்டைசேஷனை அறியாமல் எந்த VRAM கூற்றையும் நம்ப வேண்டாம். கார்டு வாங்குவதற்கு முன் கீழே உள்ள கால்குலேட்டருடன் உங்கள் சரியான மாடலைச் சரிபார்க்கவும்.

🔧 உங்கள் மாடலுக்கான சரியான எண்ணைப் பெறுங்கள்

LLM VRAM கால்குலேட்டர் – எடைகள் + KV கேச் + பொருத்துதல் முடிவு. பிறகு GPU AI செயல்திறன் கால்குலேட்டருடன் எவ்வளவு வேகமாக இயங்கும் என்று பாருங்கள்.

கால்குலேட்டரைத் திற →