# llama.cpp guide: run GGUF models locally

> Complete guide to llama.cpp – install it, run GGUF models, enable GPU acceleration, and read the benchmark output. The engine behind Ollama, explained.

*Source: https://velstech.net/llama-cpp-guide.ta (Tamil translation of https://velstech.net/llama-cpp-guide) · Updated: 2026-08-30*

*Markdown version. [Read the interactive guide](https://velstech.net/llama-cpp-guide.ta). English Markdown: https://velstech.net/llama-cpp-guide.md.*

---

llama.cpp என்பது Ollama, LM Studio, மற்றும் பெரும்பாலான பிற உள்ளூர் AI கருவிகள்
திரையின் பின்னால் இயங்கும் இயந்திரம். இது GGUF மாடல்களை ஏற்றி உங்கள் CPU, GPU,
அல்லது இரண்டிலும் இயக்கும் ஒரு C++ நூலகம், NVIDIA CUDA, AMD ROCm, மற்றும் Vulkan
ஆதரவுடன்.

இந்த வழிகாட்டி அடிப்படைகளை உள்ளடக்குகிறது: அதை எப்படி நிறுவுவது, ஒரு மாடலை
எப்படி இயக்குவது, உங்கள் GPU-வை எப்படி இயக்குவது, மற்றும் பெஞ்ச்மார்க் வெளியீட்டை
எப்படி படிப்பது. முடிவில்
`1713 ms / 373 tok = 4.60 ms/tok = 217.6 tok/s` என்றால் என்ன
(மற்றும் அது போதுமான வேகமானதா என்பது) உங்களுக்கு சரியாகத் தெரியும்.

## நிறுவல்

llama.cpp-ஐ பெறுவதற்கான எளிதான வழி அதை மூலத்திலிருந்து உருவாக்குவது. உங்களுக்கு
ஒரு C++ கம்பைலர் மற்றும் `cmake` தேவை:

```
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DLLAMA_METAL=OFF
make -j$(nproc)
```

GPU முடுக்கத்திற்கு, சரியான கொடியைச் சேர்க்கவும்:

- NVIDIA CUDA: cmake .. -DLLAMA_CUDA=ON

- AMD ROCm: cmake .. -DLLAMA_HIPBLAS=ON

- Vulkan: cmake .. -DLLAMA_VULKAN=ON

- Apple Metal: cmake .. -DLLAMA_METAL=ON

நீங்கள் AMD கார்டுடன் Ubuntu-வில் இருந்தால்,
[ROCm நிறுவல் வழிகாட்டி](https://velstech.net/install-rocm-ubuntu) முன்நிபந்தனைகளை
உள்ளடக்குகிறது.

## ஒரு மாடலை இயக்குவது

ஒரு GGUF கோப்பை பதிவிறக்கவும் (எதை தேர்ந்தெடுக்க வேண்டும் என்பதற்கு
[GGUF விளக்கம்](https://velstech.net/gguf-explained) பார்க்கவும்), பிறகு இயக்கவும்:

```
./build/bin/llama-cli -m path/to/model.q4_k_m.gguf -p "Hello, who are you?" -n 256
```

இது மாடலை ஏற்றி, ப்ராம்ப்டை இயக்கி, 256 டோக்கன்களை உருவாக்குகிறது. வெளியீட்டில்
அது எவ்வளவு வேகமாக இயங்கியது என்பதை சொல்லும் நேரத் தகவல் அடங்கும்:

```
1713 ms / 373 tok = 4.60 ms/tok = 217.6 tok/s
eval time = 1713 ms / 373 tok (4.60 ms/tok, 217.6 tok/s)
```

முதல் எண் **ப்ராம்ப்ட் மதிப்பீடு** (மாடல் உங்கள் கேள்வியை எவ்வளவு
வேகமாக படிக்கிறது). இரண்டாவது **டிகோட்** (அது பதிலை எவ்வளவு வேகமாக
உருவாக்குகிறது). அரட்டைக்கு, டிகோட் வேகம் தான் முக்கியம் – அது நீங்கள் பார்க்கும்
உரை ஸ்ட்ரீம். நீண்ட ஆவணங்களுக்கு, ப்ராம்ப்ட் மதிப்பீடு அதிகம் முக்கியம்.

## GPU முடுக்கம்

இயல்புநிலையாக llama.cpp CPU-வில் இயங்குகிறது. லேயர்களை உங்கள் GPU-வுக்கு மாற்ற,
`-ngl` கொடியைப் பயன்படுத்தவும் (GPU லேயர்களின் எண்ணிக்கை):

```
./build/bin/llama-cli -m model.gguf -p "Hello" -n 256 -ngl 999
```

`-ngl 999` அனைத்து லேயர்களையும் GPU-வுக்கு மாற்றுகிறது. வரையறுக்கப்பட்ட
VRAM இருந்தால், N என்பது பொருந்தக்கூடிய லேயர்களின் எண்ணிக்கையாக இருக்கும்
`-ngl N` ஐ பயன்படுத்தவும். [LLM VRAM
கால்குலேட்டர்](https://velstech.net/llm-vram-calculator) மதிப்பிட உதவும்.

ROCm உடன் AMD GPUகளுக்கு, GPU மற்றும் CPU முழுவதும் எடைகளை பிரிப்பதைத் தவிர்க்க
`--load-mode none` தேவைப்படலாம். [Qwen ROCm vs Vulkan பெஞ்ச்மார்க்](https://velstech.net/qwen-27b-ridge-rocm-vs-vulkan)
நடைமுறையில் இது எப்படி வெளிப்படுகிறது என்பதைக் காட்டுகிறது.

## உங்கள் சொந்த வன்பொருளை பெஞ்ச்மார்க் செய்வது

llama.cpp-வின் உள்ளமைந்த நேர வெளியீடே உங்களுக்கு தேவையானது. அறியப்பட்ட
முடிவுகளுடன் ஒப்பிட, அதே அளவுருக்களை (மாடல், குவாண்டைஸேஷன், கான்டெக்ஸ்ட்,
பேக்எண்ட்) பயன்படுத்தி டிகோட் tok/s-ஐ குறித்துக்கொள்ளுங்கள். பிறகு
[VelsTech பெஞ்ச்மார்க் தரவுத்தளத்தை](https://velstech.net/benchmarks/index) பார்த்து
உங்கள் வன்பொருள் எப்படி இருக்கிறது என்பதைப் பார்க்கவும்.

## முக்கிய கொடிகள் குயிக் ரெஃபரன்ஸ்

| கொடி | அது என்ன செய்கிறது |
| --- | --- |
| -m | GGUF மாடல் கோப்புக்கான பாதை |
| -p | ப்ராம்ப்ட் உரை |
| -n | உருவாக்க வேண்டிய டோக்கன்களின் எண்ணிக்கை |
| -c | கான்டெக்ஸ்ட் அளவு (எ.கா. 16Kக்கு -c 16384) |
| -ngl | GPU-வுக்கு மாற்ற வேண்டிய லேயர்கள் (999 = அனைத்தும்) |
| -t | த்ரெட் எண்ணிக்கை (இயல்புநிலை: அனைத்து கோர்கள்) |
| --repeat-penalty | மறுபடியை தண்டி (இயல்புநிலை 1.1) |
| --temp | மாதிரி வெப்பநிலை (0.0 = உறுதியான, 1.0 = ஆக்கப்பூர்வமான) |

## அடுத்த படிகள்

llama.cpp அடித்தளம். பெரும்பாலான மக்கள் அதை நேரடியாக பயன்படுத்துவதில்லை –
அவர்கள் பயனர் நட்பு CLI மற்றும் API-வில் அதை மூடும் Ollama-வை பயன்படுத்துகிறார்கள்.
ஆனால் llama.cpp எப்படி வேலை செய்கிறது என்பதை அறிவது Ollama என்ன செய்கிறது
என்பதைப் புரிந்துகொள்ள உதவுகிறது, மேலும்
[பெஞ்ச்மார்க்கிங்கிற்கும்](https://velstech.net/benchmarks/index) மற்றும்
ஃபைன்-ட்யூனிங்கிற்கும் அவசியம். உள்ளூர் AI-க்கு புதியவராக இருந்தால்,
[தொடங்குதல்](https://velstech.net/how-to-get-started-local-ai) வழிகாட்டியில் தொடங்குங்கள்
– இது llama.cpp-ல் கட்டப்பட்ட Ollama-வை பயன்படுத்துகிறது.

---

*VelsTech – https://velstech.net/llama-cpp-guide.ta.md*
