ஒரு GPU, மாதிரி மற்றும் குவாண்டைசேஷனைத் தேர்ந்தெடுத்து, சூழல் ஸ்லைடரை இழுக்கவும். பார் விளக்கப்படம் உங்கள் VRAM பட்ஜெட் எவ்வாறு பிரிகிறது என்பதைக் காட்டுகிறது: மாதிரி எடைகள், KV கேச், மற்றும் ஓவர்ஹெட். பச்சை முடிவு அனைத்தும் GPU இல் பொருந்துகிறது என்று அர்த்தம்; மஞ்சள் என்றால் பகுதி CPU ஆஃப்லோட்; சிவப்பு என்றால் அது இயங்காது.
டிகோட் வேகம் ~80% நினைவக பேண்ட்வித் பயன்பாட்டைக் கருதுகிறது மற்றும் முழு மாதிரியும் VRAM இல் பொருந்துகிறது. KV கேச் FP16 ஒரு மதிப்புக்கு 2 பைட்டுகள் எனக் கருதுகிறது. ஓவர்ஹெட் எடைகள் + KV கேச்சில் ~6% ஆகும். உண்மையான மதிப்புகள் இயந்திரம், இயக்கி மற்றும் கட்டமைப்பின் படி மாறுபடும்.
இதை எவ்வாறு கணக்கிடுகிறோம் – அனுமானங்கள் மற்றும் சூத்திரங்கள்
இது ஒரு காட்சி பட்ஜெட் திட்டமிடல், ஆய்வக அளவீடு அல்ல. உண்மையான பயன்பாடு டோக்கனைசர், மாடல் பில்ட், CUDA கிராஃப் மற்றும் இன்ஃபரன்ஸ் இயந்திரத்தின் படி மாறுபடும்.
1. மாதிரி எடைகள்
weights (GB) = parameters × bytes_per_weight / GiB
ஒரு எடைக்கு பைட்டுகள்: Q4 ≈ 0.56, Q8 ≈ 1.0625, 3.7 bpw ≈ 0.4625, போன்றவை.
2. KV கேச்
kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes kv_cache (GB) = kv_per_token × context / GiB
FP16 KV கேச் (ஒரு மதிப்புக்கு 2 பைட்டுகள்) எனக் கருதுகிறது. கட்டமைப்பு மதிப்பீடுகள் மாதிரி அளவின் படி மாறுபடும்.
3. ஓவர்ஹெட்
overhead = (weights + kv_cache) × 0.06
6% CUDA சூழல், இயந்திர பஃபர்கள் மற்றும் சிறிய ரன்டைம் ஒதுக்கீடுகளை உள்ளடக்குகிறது.
4. முடிவு
மொத்தம் ≤ VRAM × 0.95 ஆக இருந்தால் பொருந்தும். ஸ்பில் ≤ 16 GB RAM ஆக இருந்தால் பகுதி ஆஃப்லோட். இல்லையெனில் பொருந்தாது.
5. வேக மதிப்பீடு
decode (tok/s) = (bandwidth × 0.8) / (weights + kv_per_token / GiB) prefill (tok/s) = (TFLOPS × 0.55) / (2 × params)
டிகோட் நினைவக-பேண்ட்வித் சார்ந்தது; ப்ரீஃபில் கணக்கீடு சார்ந்தது.