llama.cpp என்பது Ollama, LM Studio, மற்றும் பெரும்பாலான பிற உள்ளூர் AI கருவிகள் திரையின் பின்னால் இயங்கும் இயந்திரம். இது GGUF மாடல்களை ஏற்றி உங்கள் CPU, GPU, அல்லது இரண்டிலும் இயக்கும் ஒரு C++ நூலகம், NVIDIA CUDA, AMD ROCm, மற்றும் Vulkan ஆதரவுடன்.
இந்த வழிகாட்டி அடிப்படைகளை உள்ளடக்குகிறது: அதை எப்படி நிறுவுவது, ஒரு மாடலை
எப்படி இயக்குவது, உங்கள் GPU-வை எப்படி இயக்குவது, மற்றும் பெஞ்ச்மார்க் வெளியீட்டை
எப்படி படிப்பது. முடிவில்
1713 ms / 373 tok = 4.60 ms/tok = 217.6 tok/s என்றால் என்ன
(மற்றும் அது போதுமான வேகமானதா என்பது) உங்களுக்கு சரியாகத் தெரியும்.
நிறுவல்
llama.cpp-ஐ பெறுவதற்கான எளிதான வழி அதை மூலத்திலிருந்து உருவாக்குவது. உங்களுக்கு
ஒரு C++ கம்பைலர் மற்றும் cmake தேவை:
git clone https://github.com/ggerganov/llama.cpp cd llama.cpp mkdir build && cd build cmake .. -DLLAMA_METAL=OFF make -j$(nproc)
GPU முடுக்கத்திற்கு, சரியான கொடியைச் சேர்க்கவும்:
- NVIDIA CUDA:
cmake .. -DLLAMA_CUDA=ON - AMD ROCm:
cmake .. -DLLAMA_HIPBLAS=ON - Vulkan:
cmake .. -DLLAMA_VULKAN=ON - Apple Metal:
cmake .. -DLLAMA_METAL=ON
நீங்கள் AMD கார்டுடன் Ubuntu-வில் இருந்தால், ROCm நிறுவல் வழிகாட்டி முன்நிபந்தனைகளை உள்ளடக்குகிறது.
ஒரு மாடலை இயக்குவது
ஒரு GGUF கோப்பை பதிவிறக்கவும் (எதை தேர்ந்தெடுக்க வேண்டும் என்பதற்கு GGUF விளக்கம் பார்க்கவும்), பிறகு இயக்கவும்:
./build/bin/llama-cli -m path/to/model.q4_k_m.gguf -p "Hello, who are you?" -n 256
இது மாடலை ஏற்றி, ப்ராம்ப்டை இயக்கி, 256 டோக்கன்களை உருவாக்குகிறது. வெளியீட்டில் அது எவ்வளவு வேகமாக இயங்கியது என்பதை சொல்லும் நேரத் தகவல் அடங்கும்:
1713 ms / 373 tok = 4.60 ms/tok = 217.6 tok/s eval time = 1713 ms / 373 tok (4.60 ms/tok, 217.6 tok/s)
முதல் எண் ப்ராம்ப்ட் மதிப்பீடு (மாடல் உங்கள் கேள்வியை எவ்வளவு வேகமாக படிக்கிறது). இரண்டாவது டிகோட் (அது பதிலை எவ்வளவு வேகமாக உருவாக்குகிறது). அரட்டைக்கு, டிகோட் வேகம் தான் முக்கியம் – அது நீங்கள் பார்க்கும் உரை ஸ்ட்ரீம். நீண்ட ஆவணங்களுக்கு, ப்ராம்ப்ட் மதிப்பீடு அதிகம் முக்கியம்.
GPU முடுக்கம்
இயல்புநிலையாக llama.cpp CPU-வில் இயங்குகிறது. லேயர்களை உங்கள் GPU-வுக்கு மாற்ற,
-ngl கொடியைப் பயன்படுத்தவும் (GPU லேயர்களின் எண்ணிக்கை):
./build/bin/llama-cli -m model.gguf -p "Hello" -n 256 -ngl 999
-ngl 999 அனைத்து லேயர்களையும் GPU-வுக்கு மாற்றுகிறது. வரையறுக்கப்பட்ட
VRAM இருந்தால், N என்பது பொருந்தக்கூடிய லேயர்களின் எண்ணிக்கையாக இருக்கும்
-ngl N ஐ பயன்படுத்தவும். LLM VRAM
கால்குலேட்டர் மதிப்பிட உதவும்.
ROCm உடன் AMD GPUகளுக்கு, GPU மற்றும் CPU முழுவதும் எடைகளை பிரிப்பதைத் தவிர்க்க
--load-mode none தேவைப்படலாம். Qwen ROCm vs Vulkan பெஞ்ச்மார்க்
நடைமுறையில் இது எப்படி வெளிப்படுகிறது என்பதைக் காட்டுகிறது.
உங்கள் சொந்த வன்பொருளை பெஞ்ச்மார்க் செய்வது
llama.cpp-வின் உள்ளமைந்த நேர வெளியீடே உங்களுக்கு தேவையானது. அறியப்பட்ட முடிவுகளுடன் ஒப்பிட, அதே அளவுருக்களை (மாடல், குவாண்டைஸேஷன், கான்டெக்ஸ்ட், பேக்எண்ட்) பயன்படுத்தி டிகோட் tok/s-ஐ குறித்துக்கொள்ளுங்கள். பிறகு VelsTech பெஞ்ச்மார்க் தரவுத்தளத்தை பார்த்து உங்கள் வன்பொருள் எப்படி இருக்கிறது என்பதைப் பார்க்கவும்.
முக்கிய கொடிகள் குயிக் ரெஃபரன்ஸ்
| கொடி | அது என்ன செய்கிறது |
|---|---|
-m | GGUF மாடல் கோப்புக்கான பாதை |
-p | ப்ராம்ப்ட் உரை |
-n | உருவாக்க வேண்டிய டோக்கன்களின் எண்ணிக்கை |
-c | கான்டெக்ஸ்ட் அளவு (எ.கா. 16Kக்கு -c 16384) |
-ngl | GPU-வுக்கு மாற்ற வேண்டிய லேயர்கள் (999 = அனைத்தும்) |
-t | த்ரெட் எண்ணிக்கை (இயல்புநிலை: அனைத்து கோர்கள்) |
--repeat-penalty | மறுபடியை தண்டி (இயல்புநிலை 1.1) |
--temp | மாதிரி வெப்பநிலை (0.0 = உறுதியான, 1.0 = ஆக்கப்பூர்வமான) |
அடுத்த படிகள்
llama.cpp அடித்தளம். பெரும்பாலான மக்கள் அதை நேரடியாக பயன்படுத்துவதில்லை – அவர்கள் பயனர் நட்பு CLI மற்றும் API-வில் அதை மூடும் Ollama-வை பயன்படுத்துகிறார்கள். ஆனால் llama.cpp எப்படி வேலை செய்கிறது என்பதை அறிவது Ollama என்ன செய்கிறது என்பதைப் புரிந்துகொள்ள உதவுகிறது, மேலும் பெஞ்ச்மார்க்கிங்கிற்கும் மற்றும் ஃபைன்-ட்யூனிங்கிற்கும் அவசியம். உள்ளூர் AI-க்கு புதியவராக இருந்தால், தொடங்குதல் வழிகாட்டியில் தொடங்குங்கள் – இது llama.cpp-ல் கட்டப்பட்ட Ollama-வை பயன்படுத்துகிறது.