ஒரு மாடல் மற்றும் குவாண்டைஸேஷனைத் தேர்ந்தெடுத்து, உங்கள் கான்டெக்ஸ்ட் நீளத்தை அமைத்தால், இது உங்களுக்கு தேவையான மொத்த GPU நினைவகத்தை மதிப்பிடுகிறது – மாடல் எடைகள் + KV கேச் + சிறிய ஓவர்ஹெட். உங்கள் GPU-வின் VRAM-ஐ உள்ளிட்டு நேரடியான இயங்கும் / பகுதி ஆஃப்லோட் / பொருந்தாது முடிவைப் பெறுங்கள். முழுவதுமாக உங்கள் பிரவுசரில் இயங்குகிறது.

எப்படி கணக்கிடுகிறோம் – அனுமானங்கள் & சூத்திரங்கள்

இது ஒரு மதிப்பீடு, ஆய்வக அளவீடு அல்ல. உண்மையான பயன்பாடு டோக்கனைசர், மாடல் உருவாக்கம், CUDA கிராஃப், மற்றும் உங்கள் இன்ஃபரன்ஸ் இயந்திரம் (llama.cpp, vLLM, முதலியன) பொறுத்து மாறுபடும். கீழே உள்ள எண்கள் நேரடி கால்குலேட்டர் லாஜிக்குடன் பொருந்துகின்றன.

1. மாடல் எடைகள்

weights = parameters × bytes_per_weight / GiB

ஒரு எடைக்கு பைட்டுகள் குவாண்டைஸேஷனில் இருந்து வருகிறது: FP32 4.0, FP16/BF16 2.0, Q8_0 1.0625, Q6_K 0.8125, Q5_K_M 0.66, Q4_K_M 0.61, Q4_0 0.56, INT4 0.5, INT8 1.0. எடுத்துக்காட்டு: Q4_K_M-ல் 8B அளவுருக்கள் ≈ 8e9 × 0.61 / 1.07e9 ≈ 4.5 GB.

2. KV கேச்

kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes
kv_cache = kv_per_token × context × batch / GiB

×2 K மற்றும் V-ஐ உள்ளடக்குகிறது; பின்வரும் ×2 bytes FP16 KV (பெரும்பாலான இயந்திரங்களின் இயல்புநிலை) என கருதுகிறது. 8192 கான்டெக்ஸ்ட் மற்றும் பேட்ச் 1-ல் 32-லேயர், 8-KV-ஹெட், 128-டிம் மாடலுக்கு, அது 1K டோக்கன்களுக்கு ~134 MB. நீண்ட கான்டெக்ஸ்ட் நினைவகத்தை ஆதிக்கம் செலுத்துகிறது – 32K-க்கு 8K-வின் ~4× KV தேவை.

3. ஓவர்ஹெட்

overhead = (weights + kv_cache) × 0.06 + 0.25 GB

6% CUDA கான்டெக்ஸ்ட் / இயந்திர பஃபர்களை உள்ளடக்குகிறது, மேலும் நிலையான 0.25 GB தளம். 8 GB கார்டுகளில் சிறியது ஆனால் கவனிக்கத்தக்கது.

4. முடிவு

total = weights + kv_cache + overhead. total ≤ vram × 0.95 என்றால் பொருந்தும். சிந்தப்பட்டது ram × 0.9-ல் பொருந்தினால் பகுதி ஆஃப்லோட்; இல்லையெனில் பொருந்தாது. முழு விவரங்கள்: உங்களுக்கு எவ்வளவு VRAM தேவை?

தொடர்புடைய வழிகாட்டிகள்