# GGUF explained: the format that makes local LLMs work

> GGUF is the file format that makes running LLMs locally possible. Here's what it is, what quantization levels mean, and how to pick the right one for your hardware.

*Source: https://velstech.net/gguf-explained.ta (Tamil translation of https://velstech.net/gguf-explained) · Updated: 2026-08-30*

*Markdown version. [Read the interactive guide](https://velstech.net/gguf-explained.ta). English Markdown: https://velstech.net/gguf-explained.md.*

---

Ollama, llama.cpp அல்லது வேறு எதையாவது பயன்படுத்தி உள்நாட்டில் இயக்க ஒரு மாடலைப் பதிவிறக்கம் செய்திருந்தால், நீங்கள் கிட்டத்தட்ட நிச்சயமாக **GGUF** என்ற எழுத்துக்களைச் சந்தித்திருப்பீர்கள்.
நீங்களே இயக்கக்கூடிய பெரும்பாலான திறந்த-எடை மாடல்களில் இதுவே கோப்பு நீட்டிப்பாகும்:
`llama-3.2-3b.Q4_K_M.gguf`, `qwen2.5-7b.Q5_K_M.gguf` மற்றும் பல.

GGUF தான் உள்ளூர் AI சாத்தியமாவதற்கான காரணம். அது உண்மையில் என்ன, அந்த
`Q4_K_M` லேபிள்கள் எதைக் குறிக்கின்றன, மற்றும் உங்கள் வன்பொருளுக்கு சரியானதை எவ்வாறு தேர்வு செய்வது என்பதை இங்கே பார்க்கலாம்.

## GGUF என்றால் என்ன?

GGUF என்பது **குவாண்டைஸ் செய்யப்பட்ட LLM-களை சேமிப்பதற்கான கோப்பு வடிவம்** – ஒரு மாடலின் எடைகள், டோக்கனைசர் மற்றும் மெட்டாடேட்டாவை ஒரு கோப்பில் தொகுத்து, llama.cpp மற்றும் அதன் வழித்தோன்றல்கள் (Ollama, LM Studio போன்றவை) நேரடியாக ஏற்ற முடியும். இது GGML-க்கு பின் வந்தது, மேலும் நுகர்வோர் வன்பொருளில் மாடல்களை இயக்குவதற்கான உண்மையான தரமாக மாறியுள்ளது.

"குவாண்டைஸ் செய்யப்பட்ட" என்பதன் புத்திசாலித்தனமான பகுதி இதுதான். ஒரு மாடலின் எடைகள் பொதுவாக 16-பிட் மிதவை-புள்ளி எண்களாக சேமிக்கப்படுகின்றன. GGUF கோப்புகள் அவற்றை மிகக் குறைந்த துல்லியத்தில் – 8-பிட்,
4-பிட், 2-பிட் கூட – சேமிக்கின்றன, இது கோப்பை வியத்தகு முறையில் சுருக்குகிறது. அதுதான் 27-பில்லியன்
அளவுரு மாடலை 50+ GB தேவைப்படுவதற்கு பதிலாக 12 GB VRAM-இல் பொருந்த வைக்கிறது.

## வர்த்தகம்: அளவு vs தரம்

குவாண்டைசேஷன் என்பது விலையுடன் கூடிய சுருக்கமாகும். குறைந்த துல்லியம் = சிறிய கோப்பு + வேகமான
இன்ஃபரன்ஸ் + குறைந்த தரம். அதிக துல்லியம் = பெரிய கோப்பு + மெதுவானது + சிறந்த தரம்.
தரம் பாதுகாக்கப்படும் ஆனால் மாடல் உங்கள் வன்பொருளுக்கு பொருந்தும் இனிமையான இடத்தைக் கண்டுபிடிப்பதே திறமை.

GGUF கோப்புகள் இதை தங்கள் பெயரில் குறியாக்கம் செய்கின்றன. `qwen2.5-7b.Q4_K_M.gguf` ஐ எடுத்துக்கொள்ளுங்கள்:

- Q4 – 4-பிட் குவாண்டைசேஷன் ("Q" குவாண்டைசேஷனைக் குறிக்கிறது).

- K – "k-குவாண்ட்" (k-குவாண்டைசேஷன்), குறைவான முக்கியமான எடைகளில் குறைந்த பிட்களைப் பயன்படுத்தும் புத்திசாலித்தனமான திட்டம்.

- M – அளவு: S (சிறிய), M (நடுத்தரம்), L (பெரிய). பெரியது = முழு தரத்திற்கு நெருக்கமானது.

எனவே `Q4_K_M` என்றால் "4-பிட் k-குவாண்ட், நடுத்தரம்" – மிகவும் பிரபலமான அனைத்து-சுற்று வீரர்,
மற்றும் பெரும்பாலான மக்களுக்கு இயல்புநிலை பரிந்துரை.

## பொதுவான குவாண்டைசேஷன் நிலைகள்

| நிலை | முழு அளவுடன் ஒப்பீடு | தரம் | எப்போது பயன்படுத்த வேண்டும் |
| --- | --- | --- | --- |
| Q2_K | ~25% | மோசம் | மிகவும் சிறிய RAM-இல் நிர்ப்பந்திக்கப்படும்போது மட்டும் |
| Q3_K | ~32% | சராசரி | மிகவும் இறுக்கமான பட்ஜெட்டுகள் |
| Q4_K_S / Q4_K_M | ~40–44% | நல்லது | இயல்புநிலை தேர்வு – சிறந்த அளவு/தர சமநிலை |
| Q5_K_M | ~49% | மிகவும் நல்லது | கூடுதல் இடம் இருக்கும்போது; குறிப்பிடத்தக்க கூர்மை |
| Q6_K | ~58% | அசலுக்கு நெருக்கமானது | நிறைய RAM உள்ளது, தரம் வேண்டும் |
| Q8_0 | ~78% | ~பிரித்தறிய முடியாதது | KV கேச் அல்லது அளவு ஒரு பொருட்டல்லாதபோது மட்டும் |
| F16 / F32 | 100% | அசல் | இன்ஃபரன்ஸுக்கு அரிதாக தேவை; மிகப்பெரிய கோப்புகள் |

## எதை பதிவிறக்க வேண்டும்?

கட்டைவிரல் விதி எளிமையானது: **Q4_K_M-ல் தொடங்குங்கள்.** இது சிறந்த
தரம்-ஒரு-ஜிகாபைட், பெரும்பாலான வன்பொருளில் இயங்குகிறது, மேலும் பெரும்பாலான பணிகளுக்கு Q5 அல்லது Q6-ல் இருந்து தர வேறுபாட்டை கவனிப்பது கடினம். மாடல் வசதியாக இயங்கி உங்களிடம் கூடுதல் RAM இருந்தால்,
Q5_K_M ஐ முயற்சித்து வித்தியாசத்தை சொல்ல முடியுமா என்று பார்க்கவும். அது மிகவும் மெதுவாக இருந்தால் அல்லது பொருந்தவில்லை என்றால்,
Q4_K_S அல்லது Q3_K_M க்கு குறைக்கவும்.

உங்கள் கார்டுக்கு சரியாக என்ன பொருந்தும் என்பதை கண்டுபிடிக்க, [LLM VRAM கால்குலேட்டரில்](https://velstech.net/llm-vram-calculator) எண்களை இயக்கவும் – இது எடைகள்,
KV கேச் மற்றும் குவாண்டைசேஷனை கணக்கில் எடுத்துக்கொள்கிறது, எனவே பதிவிறக்கும் முன் தெரிந்துகொள்ளலாம்.

## GGUF + llama.cpp

GGUF கோப்புகள் llama.cpp ஆல் இயக்கப்பட வடிவமைக்கப்பட்டுள்ளன – Ollama மற்றும்
LM Studio-வின் கீழ் உள்ள எஞ்சின். நீங்கள் Ollama ஐப் பயன்படுத்தினால் GGUF கோப்புகளுடன் நேரடியாக தொடர்பு கொள்வது அரிது (அது பதிவிறக்கம் மற்றும் வடிவத்தை உங்களுக்காக கையாளுகிறது), ஆனால் கருத்துக்கள் ஒரே மாதிரியானவை: நீங்கள் எப்போதும் ஒரு மாடல் அளவு மற்றும் குவாண்டைசேஷனை தேர்வு செய்கிறீர்கள். கட்டளை-வரி விவரங்களுக்கு [llama.cpp வழிகாட்டியை](https://velstech.net/llama-cpp-guide) பார்க்கவும்.

## இறுதி வரி

GGUF என்பது உள்ளூர் AI-ஐ நடைமுறைக்குரியதாக மாற்றும் கொள்கலன் ஆகும். கோப்பின் பெயரில் உள்ள எழுத்துக்கள் உங்களுக்கு எல்லாவற்றையும் சொல்கின்றன: `Q4_K_M` பாதுகாப்பான இயல்புநிலை, `Q5_K_M` கூடுதல் இடம் இருந்தால் பயனுள்ள மேம்படுத்தல், மற்றும் அதைவிட சிறியது இறுக்கமான வன்பொருளில் நிர்ப்பந்திப்பதற்கானது. Q4_K_M ஐ தேர்வு செய்து, [VRAM கால்குலேட்டரில்](https://velstech.net/llm-vram-calculator) சரிபார்த்து, நிமிடங்களில் உள்ளூர் மாடலை இயக்கலாம்.

---

*VelsTech – https://velstech.net/gguf-explained.ta.md*
