llama.cpp என்பது Ollama, LM Studio, மற்றும் பெரும்பாலான பிற உள்ளூர் AI கருவிகள் திரையின் பின்னால் இயங்கும் இயந்திரம். இது GGUF மாடல்களை ஏற்றி உங்கள் CPU, GPU, அல்லது இரண்டிலும் இயக்கும் ஒரு C++ நூலகம், NVIDIA CUDA, AMD ROCm, மற்றும் Vulkan ஆதரவுடன்.

இந்த வழிகாட்டி அடிப்படைகளை உள்ளடக்குகிறது: அதை எப்படி நிறுவுவது, ஒரு மாடலை எப்படி இயக்குவது, உங்கள் GPU-வை எப்படி இயக்குவது, மற்றும் பெஞ்ச்மார்க் வெளியீட்டை எப்படி படிப்பது. முடிவில் 1713 ms / 373 tok = 4.60 ms/tok = 217.6 tok/s என்றால் என்ன (மற்றும் அது போதுமான வேகமானதா என்பது) உங்களுக்கு சரியாகத் தெரியும்.

நிறுவல்

llama.cpp-ஐ பெறுவதற்கான எளிதான வழி அதை மூலத்திலிருந்து உருவாக்குவது. உங்களுக்கு ஒரு C++ கம்பைலர் மற்றும் cmake தேவை:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
mkdir build && cd build
cmake .. -DLLAMA_METAL=OFF
make -j$(nproc)

GPU முடுக்கத்திற்கு, சரியான கொடியைச் சேர்க்கவும்:

நீங்கள் AMD கார்டுடன் Ubuntu-வில் இருந்தால், ROCm நிறுவல் வழிகாட்டி முன்நிபந்தனைகளை உள்ளடக்குகிறது.

ஒரு மாடலை இயக்குவது

ஒரு GGUF கோப்பை பதிவிறக்கவும் (எதை தேர்ந்தெடுக்க வேண்டும் என்பதற்கு GGUF விளக்கம் பார்க்கவும்), பிறகு இயக்கவும்:

./build/bin/llama-cli -m path/to/model.q4_k_m.gguf -p "Hello, who are you?" -n 256

இது மாடலை ஏற்றி, ப்ராம்ப்டை இயக்கி, 256 டோக்கன்களை உருவாக்குகிறது. வெளியீட்டில் அது எவ்வளவு வேகமாக இயங்கியது என்பதை சொல்லும் நேரத் தகவல் அடங்கும்:

1713 ms / 373 tok = 4.60 ms/tok = 217.6 tok/s
eval time = 1713 ms / 373 tok (4.60 ms/tok, 217.6 tok/s)

முதல் எண் ப்ராம்ப்ட் மதிப்பீடு (மாடல் உங்கள் கேள்வியை எவ்வளவு வேகமாக படிக்கிறது). இரண்டாவது டிகோட் (அது பதிலை எவ்வளவு வேகமாக உருவாக்குகிறது). அரட்டைக்கு, டிகோட் வேகம் தான் முக்கியம் – அது நீங்கள் பார்க்கும் உரை ஸ்ட்ரீம். நீண்ட ஆவணங்களுக்கு, ப்ராம்ப்ட் மதிப்பீடு அதிகம் முக்கியம்.

GPU முடுக்கம்

இயல்புநிலையாக llama.cpp CPU-வில் இயங்குகிறது. லேயர்களை உங்கள் GPU-வுக்கு மாற்ற, -ngl கொடியைப் பயன்படுத்தவும் (GPU லேயர்களின் எண்ணிக்கை):

./build/bin/llama-cli -m model.gguf -p "Hello" -n 256 -ngl 999

-ngl 999 அனைத்து லேயர்களையும் GPU-வுக்கு மாற்றுகிறது. வரையறுக்கப்பட்ட VRAM இருந்தால், N என்பது பொருந்தக்கூடிய லேயர்களின் எண்ணிக்கையாக இருக்கும் -ngl N ஐ பயன்படுத்தவும். LLM VRAM கால்குலேட்டர் மதிப்பிட உதவும்.

ROCm உடன் AMD GPUகளுக்கு, GPU மற்றும் CPU முழுவதும் எடைகளை பிரிப்பதைத் தவிர்க்க --load-mode none தேவைப்படலாம். Qwen ROCm vs Vulkan பெஞ்ச்மார்க் நடைமுறையில் இது எப்படி வெளிப்படுகிறது என்பதைக் காட்டுகிறது.

உங்கள் சொந்த வன்பொருளை பெஞ்ச்மார்க் செய்வது

llama.cpp-வின் உள்ளமைந்த நேர வெளியீடே உங்களுக்கு தேவையானது. அறியப்பட்ட முடிவுகளுடன் ஒப்பிட, அதே அளவுருக்களை (மாடல், குவாண்டைஸேஷன், கான்டெக்ஸ்ட், பேக்எண்ட்) பயன்படுத்தி டிகோட் tok/s-ஐ குறித்துக்கொள்ளுங்கள். பிறகு VelsTech பெஞ்ச்மார்க் தரவுத்தளத்தை பார்த்து உங்கள் வன்பொருள் எப்படி இருக்கிறது என்பதைப் பார்க்கவும்.

முக்கிய கொடிகள் குயிக் ரெஃபரன்ஸ்

கொடிஅது என்ன செய்கிறது
-mGGUF மாடல் கோப்புக்கான பாதை
-pப்ராம்ப்ட் உரை
-nஉருவாக்க வேண்டிய டோக்கன்களின் எண்ணிக்கை
-cகான்டெக்ஸ்ட் அளவு (எ.கா. 16Kக்கு -c 16384)
-nglGPU-வுக்கு மாற்ற வேண்டிய லேயர்கள் (999 = அனைத்தும்)
-tத்ரெட் எண்ணிக்கை (இயல்புநிலை: அனைத்து கோர்கள்)
--repeat-penaltyமறுபடியை தண்டி (இயல்புநிலை 1.1)
--tempமாதிரி வெப்பநிலை (0.0 = உறுதியான, 1.0 = ஆக்கப்பூர்வமான)

அடுத்த படிகள்

llama.cpp அடித்தளம். பெரும்பாலான மக்கள் அதை நேரடியாக பயன்படுத்துவதில்லை – அவர்கள் பயனர் நட்பு CLI மற்றும் API-வில் அதை மூடும் Ollama-வை பயன்படுத்துகிறார்கள். ஆனால் llama.cpp எப்படி வேலை செய்கிறது என்பதை அறிவது Ollama என்ன செய்கிறது என்பதைப் புரிந்துகொள்ள உதவுகிறது, மேலும் பெஞ்ச்மார்க்கிங்கிற்கும் மற்றும் ஃபைன்-ட்யூனிங்கிற்கும் அவசியம். உள்ளூர் AI-க்கு புதியவராக இருந்தால், தொடங்குதல் வழிகாட்டியில் தொடங்குங்கள் – இது llama.cpp-ல் கட்டப்பட்ட Ollama-வை பயன்படுத்துகிறது.