model.Q4_K_M.gguf போன்ற கோப்பைப் பார்க்கும்போது, Q4 நிறைய
வேலை செய்கிறது. அது குவாண்டைசேஷன் நிலை – மாடல் அளவு மற்றும் வேகத்தை பதில் தரத்துடன்
பரிமாறிக் கொள்ளும் குமிழ். GGUF விளக்கம் இல் எழுத்துக்கள்
எதைக் குறிக்கின்றன என்பதைப் பார்த்தோம். இங்கே ஆழமான பதிப்பு: குவாண்டைசேஷன் மாடலுக்கு
உண்மையில் என்ன செய்கிறது, எவ்வளவு தரத்தை இழக்கிறீர்கள், அது உண்மையான வேக எண்களில்
எப்படி வெளிப்படுகிறது.
குவாண்டைசேஷன் உண்மையில் என்ன செய்கிறது
ஒரு நரம்பியல் வலையமைப்பின் எடைகள் எண்கள் – பொதுவாக 16-பிட் மிதவை புள்ளியாக
(அல்லது 32-பிட் கூட) சேமிக்கப்படுகின்றன. குவாண்டைசேஷன் அந்த எண்களை குறைந்த
துல்லியத்தில் சேமிக்கிறது. ஒரு எடை 0.7321024… ஆக இருப்பதற்கு பதிலாக,
அது 0.73 போன்றதாக மாறுகிறது, அல்லது 16 சாத்தியமான மதிப்புகளில் (4 பிட்கள்)
ஒன்றாக சுருக்கப்படுகிறது.
அது அழிவுகரமானதாகத் தோன்றுகிறது, அதுவும் உண்மைதான் – ஆனால் தந்திரம் என்னவென்றால் மாடல்கள் அதற்கு மிகவும் உறுதியானவை. நரம்பியல் வலையமைப்புகளில் மகத்தான பணிநீக்கம் உள்ளது, எனவே மாடலின் நடத்தை அர்த்தமுள்ள வகையில் மோசமடைவதற்கு முன்பே எடைகளில் உள்ள பெரும்பாலான துல்லியத்தை நீங்கள் தூக்கி எறியலாம். அதனால்தான் ஒரு 4-பிட் மாடல் குறிப்பிடத்தக்க அளவு நன்றாக இருக்க முடியும்.
அளவு கணிதம் எளிமையானது. 16 பிட்களில் ஒரு 7-பில்லியன் அளவுரு மாடல் தோராயமாக
7B × 2 bytes ≈ 14 GB. 4 பிட்களில் அது 7B × 0.5 bytes ≈ 3.5 GB.
"என் லேப்டாப்பில் பொருந்தாது" என்பதற்கும் "என் லேப்டாப்பில் நன்றாக இயங்குகிறது"
என்பதற்கும் இடையேயான வித்தியாசம் அதுவே.
பரிமாற்றம், அளவிடப்பட்டது
குவாண்டைசேஷன் நிலை மூன்று விஷயங்களைப் பாதிக்கிறது: கோப்பு அளவு, வேகம், மற்றும் தரம். அளவும் வேகமும் எளிதில் புரிந்துகொள்ளக்கூடியவை; தரம்தான் தெளிவற்றது.
| நிலை | ஒரு எடைக்கு பிட்கள் | ஒப்பீட்டு அளவு | தரம் |
|---|---|---|---|
| Q2_K | ~2.6 | ~25% | மோசம் – மிகச் சிறிய பட்ஜெட்டிற்கு மட்டும் |
| Q3_K | ~3.4 | ~32% | மிதமானது – தெரியும் சிதைவு |
| Q4_K_M | ~4.3 | ~42% | நல்லது – இயல்புநிலை |
| Q5_K_M | ~4.8 | ~49% | மிகவும் நல்லது – கவனிக்கத்தக்க அளவு தெளிவானது |
| Q6_K | ~6.0 | ~58% | கிட்டத்தட்ட அசல் |
| Q8_0 | ~8.0 | ~78% | பிரித்தறிய முடியாதது |
| F16 | 16 | 100% | அசல் எடைகள் |
முக்கியமான நுணுக்கம்: Q4, Q5, Q6 மற்றும் Q8 இடையேயான வேறுபாடுகள் பெரும்பாலும் கடினமான பணிகளில் தெரியும் – நீண்ட சிந்தனைச் சங்கிலிகள், சிக்கலான குறியீடு, கணிதம் அல்லது ஒரு தவறான டோக்கன் அடுக்கடுக்காகச் செல்லும் உண்மை நினைவு. சாதாரண அரட்டை மற்றும் சுருக்கத்திற்கு, Q4 ஐ Q6 இலிருந்து வேறுபடுத்துவது கடினமாக இருக்கும். அதனால்தான் Q4_K_M எல்லோருக்கும் இயல்புநிலை: பெரும்பாலான உண்மையான பயன்பாட்டிற்கு, தர இடைவெளி புலனாகாது.
வேகத்தில் அது எப்படி வெளிப்படுகிறது
சிறிய எடைகள் வேகமான அனுமானத்தைக் குறிக்கின்றன, ஏனென்றால் இடையூறு நினைவக அலைவரிசை – GPU கணக்கீட்டு அலகுகளுக்கு பைட்டுகளை எவ்வளவு வேகமாக ஊட்ட முடியும் என்பது. டிகோட் வேகம் தோராயமாக:
decode_tok/s ≈ (memory_bandwidth × 0.8) / bytes_per_token
Q4 இல் ஒரு 7B மாடலுக்கு ஒரு டோக்கன் கடவுக்கு ~0.5 bytes/weight × 7B ≈ 3.5 GB தேவை. Q8 இல் அது ~7 GB. எனவே Q4 என்பது Q8 ஐ விட தோராயமாக இரு மடங்கு வேகமானது, மற்ற எல்லாம் சமமாக இருந்தால் – மற்றும் F16 ஐ விட சுமார் 4× வேகமானது. அதனால்தான் ஒரு குவாண்டைஸ் செய்யப்பட்ட மாடல் மிகவும் சுறுசுறுப்பாக உணர்கிறது.
இந்த விளைவை VelsTech அளவீட்டு தரவுத்தளத்தில் காணலாம் – எங்களுடைய சோதனை செய்யப்பட்ட Qwen 27B 3.7bpw 12 GB RX 6800M இல் ~18–22 tok/s இல் இயங்கியது, அதுவும் பகுதி ஆஃப்லோடுடன். பெரிய குவாண்டைசேஷன் குறைவாக பொருந்தும் மற்றும் மெதுவாக இயங்கும்.
K-குவாண்ட்கள் ("K" மற்றும் "_K_M") ஏன் புத்திசாலி
பழைய குவாண்டைசேஷன்கள் ஒவ்வொரு எடைக்கும் ஒரே பிட் அகலத்தைப் பயன்படுத்தின. K-குவாண்டைசேஷன் புத்திசாலியானது: அது குறைவான முக்கிய எடைகளுக்கு குறைவான பிட்களையும், முக்கியமான எடைகளுக்கு அதிக பிட்களையும் பயன்படுத்துகிறது, ஒவ்வொரு எடைத் தொகுதிக்கும் குழுவாக. இதன் விளைவாக, ஒரு "4-பிட்" k-குவாண்ட் கோப்பு அதே அளவுள்ள ஒரு எளிய 4-பிட் கோப்பை விட அடிக்கடி சிறந்ததாக இருக்கும் – சில சமயங்களில் சற்று பெரிய எளிய குவாண்டைசேஷனையும் வெல்லும்.
_S (சிறியது) மற்றும் _M (நடுத்தரம்) பின்னொட்டுகள் இது எவ்வளவு
ஆக்ரோஷமாக பயன்படுத்தப்படுகிறது என்பதை மாற்றுகின்றன. Q4_K_S என்பது மிகச்
சிறிய "நல்ல" 4-பிட் விருப்பம்; Q4_K_M கவனிக்கத்தக்க சிறந்த தரத்திற்காக சற்று
அதிக அளவைச் செலவிடுகிறது. பெரும்பாலான மக்களுக்கு, _M தான் சரியான தேர்வு.
எப்போது உயர்ந்ததற்கு செல்ல வேண்டும் (எப்போது கூடாது)
- Q4_K_M இல் இருங்கள் பொது அரட்டை, எழுத்து மற்றும் பெரும்பாலான குறியீடுகளுக்கு – இயல்புநிலை, மற்றும் சிறந்த அளவு/தர சமநிலை.
- Q5_K_M அல்லது Q6_K க்கு உயருங்கள் மாடல் சிந்தனை-கனமான அல்லது உண்மை-சார்ந்த வேலைக்காக இருக்கும்போது, மற்றும் RAM/VRAM இருப்பு இருந்தால்.
- Q8/F16 ஐ தவிர்க்கவும் நீங்கள் அளவீடு செய்யவோ அல்லது மகத்தான நினைவகம் வைத்திருக்கவோ செய்தால்தான். Q6 மீதான தர ஆதாயம் குறைவு, நீங்கள் இரட்டை அளவு மற்றும் வேக செலவை செலுத்துகிறீர்கள்.
- Q3 க்கு இறங்கவும் மாடல் Q4 இல் பொருந்தவில்லை மற்றும் அது எப்படியாவது இயங்க வேண்டுமென்றால் மட்டுமே.
உங்கள் கார்டில் சரியாக என்ன பொருந்தும் என்று அறிய வேண்டுமா? LLM VRAM கால்குலேட்டரில் எண்களை இயக்கவும்.
இறுதி விளைவு
உள்ளூர் AI எல்லாம் இயங்குவதற்கான காரணம் குவாண்டைசேஷன் தான். அது ஒரு சுருக்கம் – பெரும்பாலான பணிகளுக்கு சிறியதும், கடினமான பணிகளுக்கு மட்டுமே குறிப்பிடத்தக்கதுமான ஒரு தர வரி. Q4_K_M புத்திசாலித்தனமான இயல்புநிலை, Q5_K_M தர மேம்படுத்தல், மற்றும் Q6 க்கு மேலே உள்ள எதுவும் நுகர்வோர் வன்பொருளில் பெரும்பாலும் வீண். அதைப் புரிந்து கொண்டால், ஒருபோதும் டவுன்லோடை வீணாக்க மாட்டீர்கள்.