model.Q4_K_M.gguf போன்ற கோப்பைப் பார்க்கும்போது, Q4 நிறைய வேலை செய்கிறது. அது குவாண்டைசேஷன் நிலை – மாடல் அளவு மற்றும் வேகத்தை பதில் தரத்துடன் பரிமாறிக் கொள்ளும் குமிழ். GGUF விளக்கம் இல் எழுத்துக்கள் எதைக் குறிக்கின்றன என்பதைப் பார்த்தோம். இங்கே ஆழமான பதிப்பு: குவாண்டைசேஷன் மாடலுக்கு உண்மையில் என்ன செய்கிறது, எவ்வளவு தரத்தை இழக்கிறீர்கள், அது உண்மையான வேக எண்களில் எப்படி வெளிப்படுகிறது.

குவாண்டைசேஷன் உண்மையில் என்ன செய்கிறது

ஒரு நரம்பியல் வலையமைப்பின் எடைகள் எண்கள் – பொதுவாக 16-பிட் மிதவை புள்ளியாக (அல்லது 32-பிட் கூட) சேமிக்கப்படுகின்றன. குவாண்டைசேஷன் அந்த எண்களை குறைந்த துல்லியத்தில் சேமிக்கிறது. ஒரு எடை 0.7321024… ஆக இருப்பதற்கு பதிலாக, அது 0.73 போன்றதாக மாறுகிறது, அல்லது 16 சாத்தியமான மதிப்புகளில் (4 பிட்கள்) ஒன்றாக சுருக்கப்படுகிறது.

அது அழிவுகரமானதாகத் தோன்றுகிறது, அதுவும் உண்மைதான் – ஆனால் தந்திரம் என்னவென்றால் மாடல்கள் அதற்கு மிகவும் உறுதியானவை. நரம்பியல் வலையமைப்புகளில் மகத்தான பணிநீக்கம் உள்ளது, எனவே மாடலின் நடத்தை அர்த்தமுள்ள வகையில் மோசமடைவதற்கு முன்பே எடைகளில் உள்ள பெரும்பாலான துல்லியத்தை நீங்கள் தூக்கி எறியலாம். அதனால்தான் ஒரு 4-பிட் மாடல் குறிப்பிடத்தக்க அளவு நன்றாக இருக்க முடியும்.

அளவு கணிதம் எளிமையானது. 16 பிட்களில் ஒரு 7-பில்லியன் அளவுரு மாடல் தோராயமாக 7B × 2 bytes ≈ 14 GB. 4 பிட்களில் அது 7B × 0.5 bytes ≈ 3.5 GB. "என் லேப்டாப்பில் பொருந்தாது" என்பதற்கும் "என் லேப்டாப்பில் நன்றாக இயங்குகிறது" என்பதற்கும் இடையேயான வித்தியாசம் அதுவே.

பரிமாற்றம், அளவிடப்பட்டது

குவாண்டைசேஷன் நிலை மூன்று விஷயங்களைப் பாதிக்கிறது: கோப்பு அளவு, வேகம், மற்றும் தரம். அளவும் வேகமும் எளிதில் புரிந்துகொள்ளக்கூடியவை; தரம்தான் தெளிவற்றது.

நிலைஒரு எடைக்கு பிட்கள்ஒப்பீட்டு அளவுதரம்
Q2_K~2.6~25%மோசம் – மிகச் சிறிய பட்ஜெட்டிற்கு மட்டும்
Q3_K~3.4~32%மிதமானது – தெரியும் சிதைவு
Q4_K_M~4.3~42%நல்லது – இயல்புநிலை
Q5_K_M~4.8~49%மிகவும் நல்லது – கவனிக்கத்தக்க அளவு தெளிவானது
Q6_K~6.0~58%கிட்டத்தட்ட அசல்
Q8_0~8.0~78%பிரித்தறிய முடியாதது
F1616100%அசல் எடைகள்

முக்கியமான நுணுக்கம்: Q4, Q5, Q6 மற்றும் Q8 இடையேயான வேறுபாடுகள் பெரும்பாலும் கடினமான பணிகளில் தெரியும் – நீண்ட சிந்தனைச் சங்கிலிகள், சிக்கலான குறியீடு, கணிதம் அல்லது ஒரு தவறான டோக்கன் அடுக்கடுக்காகச் செல்லும் உண்மை நினைவு. சாதாரண அரட்டை மற்றும் சுருக்கத்திற்கு, Q4 ஐ Q6 இலிருந்து வேறுபடுத்துவது கடினமாக இருக்கும். அதனால்தான் Q4_K_M எல்லோருக்கும் இயல்புநிலை: பெரும்பாலான உண்மையான பயன்பாட்டிற்கு, தர இடைவெளி புலனாகாது.

வேகத்தில் அது எப்படி வெளிப்படுகிறது

சிறிய எடைகள் வேகமான அனுமானத்தைக் குறிக்கின்றன, ஏனென்றால் இடையூறு நினைவக அலைவரிசை – GPU கணக்கீட்டு அலகுகளுக்கு பைட்டுகளை எவ்வளவு வேகமாக ஊட்ட முடியும் என்பது. டிகோட் வேகம் தோராயமாக:

decode_tok/s ≈ (memory_bandwidth × 0.8) / bytes_per_token

Q4 இல் ஒரு 7B மாடலுக்கு ஒரு டோக்கன் கடவுக்கு ~0.5 bytes/weight × 7B ≈ 3.5 GB தேவை. Q8 இல் அது ~7 GB. எனவே Q4 என்பது Q8 ஐ விட தோராயமாக இரு மடங்கு வேகமானது, மற்ற எல்லாம் சமமாக இருந்தால் – மற்றும் F16 ஐ விட சுமார் 4× வேகமானது. அதனால்தான் ஒரு குவாண்டைஸ் செய்யப்பட்ட மாடல் மிகவும் சுறுசுறுப்பாக உணர்கிறது.

இந்த விளைவை VelsTech அளவீட்டு தரவுத்தளத்தில் காணலாம் – எங்களுடைய சோதனை செய்யப்பட்ட Qwen 27B 3.7bpw 12 GB RX 6800M இல் ~18–22 tok/s இல் இயங்கியது, அதுவும் பகுதி ஆஃப்லோடுடன். பெரிய குவாண்டைசேஷன் குறைவாக பொருந்தும் மற்றும் மெதுவாக இயங்கும்.

K-குவாண்ட்கள் ("K" மற்றும் "_K_M") ஏன் புத்திசாலி

பழைய குவாண்டைசேஷன்கள் ஒவ்வொரு எடைக்கும் ஒரே பிட் அகலத்தைப் பயன்படுத்தின. K-குவாண்டைசேஷன் புத்திசாலியானது: அது குறைவான முக்கிய எடைகளுக்கு குறைவான பிட்களையும், முக்கியமான எடைகளுக்கு அதிக பிட்களையும் பயன்படுத்துகிறது, ஒவ்வொரு எடைத் தொகுதிக்கும் குழுவாக. இதன் விளைவாக, ஒரு "4-பிட்" k-குவாண்ட் கோப்பு அதே அளவுள்ள ஒரு எளிய 4-பிட் கோப்பை விட அடிக்கடி சிறந்ததாக இருக்கும் – சில சமயங்களில் சற்று பெரிய எளிய குவாண்டைசேஷனையும் வெல்லும்.

_S (சிறியது) மற்றும் _M (நடுத்தரம்) பின்னொட்டுகள் இது எவ்வளவு ஆக்ரோஷமாக பயன்படுத்தப்படுகிறது என்பதை மாற்றுகின்றன. Q4_K_S என்பது மிகச் சிறிய "நல்ல" 4-பிட் விருப்பம்; Q4_K_M கவனிக்கத்தக்க சிறந்த தரத்திற்காக சற்று அதிக அளவைச் செலவிடுகிறது. பெரும்பாலான மக்களுக்கு, _M தான் சரியான தேர்வு.

எப்போது உயர்ந்ததற்கு செல்ல வேண்டும் (எப்போது கூடாது)

உங்கள் கார்டில் சரியாக என்ன பொருந்தும் என்று அறிய வேண்டுமா? LLM VRAM கால்குலேட்டரில் எண்களை இயக்கவும்.

இறுதி விளைவு

உள்ளூர் AI எல்லாம் இயங்குவதற்கான காரணம் குவாண்டைசேஷன் தான். அது ஒரு சுருக்கம் – பெரும்பாலான பணிகளுக்கு சிறியதும், கடினமான பணிகளுக்கு மட்டுமே குறிப்பிடத்தக்கதுமான ஒரு தர வரி. Q4_K_M புத்திசாலித்தனமான இயல்புநிலை, Q5_K_M தர மேம்படுத்தல், மற்றும் Q6 க்கு மேலே உள்ள எதுவும் நுகர்வோர் வன்பொருளில் பெரும்பாலும் வீண். அதைப் புரிந்து கொண்டால், ஒருபோதும் டவுன்லோடை வீணாக்க மாட்டீர்கள்.