Ollama, llama.cpp அல்லது வேறு எதையாவது பயன்படுத்தி உள்நாட்டில் இயக்க ஒரு மாடலைப் பதிவிறக்கம் செய்திருந்தால், நீங்கள் கிட்டத்தட்ட நிச்சயமாக GGUF என்ற எழுத்துக்களைச் சந்தித்திருப்பீர்கள். நீங்களே இயக்கக்கூடிய பெரும்பாலான திறந்த-எடை மாடல்களில் இதுவே கோப்பு நீட்டிப்பாகும்: llama-3.2-3b.Q4_K_M.gguf, qwen2.5-7b.Q5_K_M.gguf மற்றும் பல.

GGUF தான் உள்ளூர் AI சாத்தியமாவதற்கான காரணம். அது உண்மையில் என்ன, அந்த Q4_K_M லேபிள்கள் எதைக் குறிக்கின்றன, மற்றும் உங்கள் வன்பொருளுக்கு சரியானதை எவ்வாறு தேர்வு செய்வது என்பதை இங்கே பார்க்கலாம்.

GGUF என்றால் என்ன?

GGUF என்பது குவாண்டைஸ் செய்யப்பட்ட LLM-களை சேமிப்பதற்கான கோப்பு வடிவம் – ஒரு மாடலின் எடைகள், டோக்கனைசர் மற்றும் மெட்டாடேட்டாவை ஒரு கோப்பில் தொகுத்து, llama.cpp மற்றும் அதன் வழித்தோன்றல்கள் (Ollama, LM Studio போன்றவை) நேரடியாக ஏற்ற முடியும். இது GGML-க்கு பின் வந்தது, மேலும் நுகர்வோர் வன்பொருளில் மாடல்களை இயக்குவதற்கான உண்மையான தரமாக மாறியுள்ளது.

"குவாண்டைஸ் செய்யப்பட்ட" என்பதன் புத்திசாலித்தனமான பகுதி இதுதான். ஒரு மாடலின் எடைகள் பொதுவாக 16-பிட் மிதவை-புள்ளி எண்களாக சேமிக்கப்படுகின்றன. GGUF கோப்புகள் அவற்றை மிகக் குறைந்த துல்லியத்தில் – 8-பிட், 4-பிட், 2-பிட் கூட – சேமிக்கின்றன, இது கோப்பை வியத்தகு முறையில் சுருக்குகிறது. அதுதான் 27-பில்லியன் அளவுரு மாடலை 50+ GB தேவைப்படுவதற்கு பதிலாக 12 GB VRAM-இல் பொருந்த வைக்கிறது.

வர்த்தகம்: அளவு vs தரம்

குவாண்டைசேஷன் என்பது விலையுடன் கூடிய சுருக்கமாகும். குறைந்த துல்லியம் = சிறிய கோப்பு + வேகமான இன்ஃபரன்ஸ் + குறைந்த தரம். அதிக துல்லியம் = பெரிய கோப்பு + மெதுவானது + சிறந்த தரம். தரம் பாதுகாக்கப்படும் ஆனால் மாடல் உங்கள் வன்பொருளுக்கு பொருந்தும் இனிமையான இடத்தைக் கண்டுபிடிப்பதே திறமை.

GGUF கோப்புகள் இதை தங்கள் பெயரில் குறியாக்கம் செய்கின்றன. qwen2.5-7b.Q4_K_M.gguf ஐ எடுத்துக்கொள்ளுங்கள்:

எனவே Q4_K_M என்றால் "4-பிட் k-குவாண்ட், நடுத்தரம்" – மிகவும் பிரபலமான அனைத்து-சுற்று வீரர், மற்றும் பெரும்பாலான மக்களுக்கு இயல்புநிலை பரிந்துரை.

பொதுவான குவாண்டைசேஷன் நிலைகள்

நிலைமுழு அளவுடன் ஒப்பீடுதரம்எப்போது பயன்படுத்த வேண்டும்
Q2_K~25%மோசம்மிகவும் சிறிய RAM-இல் நிர்ப்பந்திக்கப்படும்போது மட்டும்
Q3_K~32%சராசரிமிகவும் இறுக்கமான பட்ஜெட்டுகள்
Q4_K_S / Q4_K_M~40–44%நல்லதுஇயல்புநிலை தேர்வு – சிறந்த அளவு/தர சமநிலை
Q5_K_M~49%மிகவும் நல்லதுகூடுதல் இடம் இருக்கும்போது; குறிப்பிடத்தக்க கூர்மை
Q6_K~58%அசலுக்கு நெருக்கமானதுநிறைய RAM உள்ளது, தரம் வேண்டும்
Q8_0~78%~பிரித்தறிய முடியாததுKV கேச் அல்லது அளவு ஒரு பொருட்டல்லாதபோது மட்டும்
F16 / F32100%அசல்இன்ஃபரன்ஸுக்கு அரிதாக தேவை; மிகப்பெரிய கோப்புகள்

எதை பதிவிறக்க வேண்டும்?

கட்டைவிரல் விதி எளிமையானது: Q4_K_M-ல் தொடங்குங்கள். இது சிறந்த தரம்-ஒரு-ஜிகாபைட், பெரும்பாலான வன்பொருளில் இயங்குகிறது, மேலும் பெரும்பாலான பணிகளுக்கு Q5 அல்லது Q6-ல் இருந்து தர வேறுபாட்டை கவனிப்பது கடினம். மாடல் வசதியாக இயங்கி உங்களிடம் கூடுதல் RAM இருந்தால், Q5_K_M ஐ முயற்சித்து வித்தியாசத்தை சொல்ல முடியுமா என்று பார்க்கவும். அது மிகவும் மெதுவாக இருந்தால் அல்லது பொருந்தவில்லை என்றால், Q4_K_S அல்லது Q3_K_M க்கு குறைக்கவும்.

உங்கள் கார்டுக்கு சரியாக என்ன பொருந்தும் என்பதை கண்டுபிடிக்க, LLM VRAM கால்குலேட்டரில் எண்களை இயக்கவும் – இது எடைகள், KV கேச் மற்றும் குவாண்டைசேஷனை கணக்கில் எடுத்துக்கொள்கிறது, எனவே பதிவிறக்கும் முன் தெரிந்துகொள்ளலாம்.

GGUF + llama.cpp

GGUF கோப்புகள் llama.cpp ஆல் இயக்கப்பட வடிவமைக்கப்பட்டுள்ளன – Ollama மற்றும் LM Studio-வின் கீழ் உள்ள எஞ்சின். நீங்கள் Ollama ஐப் பயன்படுத்தினால் GGUF கோப்புகளுடன் நேரடியாக தொடர்பு கொள்வது அரிது (அது பதிவிறக்கம் மற்றும் வடிவத்தை உங்களுக்காக கையாளுகிறது), ஆனால் கருத்துக்கள் ஒரே மாதிரியானவை: நீங்கள் எப்போதும் ஒரு மாடல் அளவு மற்றும் குவாண்டைசேஷனை தேர்வு செய்கிறீர்கள். கட்டளை-வரி விவரங்களுக்கு llama.cpp வழிகாட்டியை பார்க்கவும்.

இறுதி வரி

GGUF என்பது உள்ளூர் AI-ஐ நடைமுறைக்குரியதாக மாற்றும் கொள்கலன் ஆகும். கோப்பின் பெயரில் உள்ள எழுத்துக்கள் உங்களுக்கு எல்லாவற்றையும் சொல்கின்றன: Q4_K_M பாதுகாப்பான இயல்புநிலை, Q5_K_M கூடுதல் இடம் இருந்தால் பயனுள்ள மேம்படுத்தல், மற்றும் அதைவிட சிறியது இறுக்கமான வன்பொருளில் நிர்ப்பந்திப்பதற்கானது. Q4_K_M ஐ தேர்வு செய்து, VRAM கால்குலேட்டரில் சரிபார்த்து, நிமிடங்களில் உள்ளூர் மாடலை இயக்கலாம்.