ஒரு GPU, மாதிரி மற்றும் குவாண்டைசேஷனைத் தேர்ந்தெடுத்து, சூழல் ஸ்லைடரை இழுக்கவும். பார் விளக்கப்படம் உங்கள் VRAM பட்ஜெட் எவ்வாறு பிரிகிறது என்பதைக் காட்டுகிறது: மாதிரி எடைகள், KV கேச், மற்றும் ஓவர்ஹெட். பச்சை முடிவு அனைத்தும் GPU இல் பொருந்துகிறது என்று அர்த்தம்; மஞ்சள் என்றால் பகுதி CPU ஆஃப்லோட்; சிவப்பு என்றால் அது இயங்காது.

இதை எவ்வாறு கணக்கிடுகிறோம் – அனுமானங்கள் மற்றும் சூத்திரங்கள்

இது ஒரு காட்சி பட்ஜெட் திட்டமிடல், ஆய்வக அளவீடு அல்ல. உண்மையான பயன்பாடு டோக்கனைசர், மாடல் பில்ட், CUDA கிராஃப் மற்றும் இன்ஃபரன்ஸ் இயந்திரத்தின் படி மாறுபடும்.

1. மாதிரி எடைகள்

weights (GB) = parameters × bytes_per_weight / GiB

ஒரு எடைக்கு பைட்டுகள்: Q4 ≈ 0.56, Q8 ≈ 1.0625, 3.7 bpw ≈ 0.4625, போன்றவை.

2. KV கேச்

kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes
kv_cache (GB) = kv_per_token × context / GiB

FP16 KV கேச் (ஒரு மதிப்புக்கு 2 பைட்டுகள்) எனக் கருதுகிறது. கட்டமைப்பு மதிப்பீடுகள் மாதிரி அளவின் படி மாறுபடும்.

3. ஓவர்ஹெட்

overhead = (weights + kv_cache) × 0.06

6% CUDA சூழல், இயந்திர பஃபர்கள் மற்றும் சிறிய ரன்டைம் ஒதுக்கீடுகளை உள்ளடக்குகிறது.

4. முடிவு

மொத்தம் ≤ VRAM × 0.95 ஆக இருந்தால் பொருந்தும். ஸ்பில் ≤ 16 GB RAM ஆக இருந்தால் பகுதி ஆஃப்லோட். இல்லையெனில் பொருந்தாது.

5. வேக மதிப்பீடு

decode (tok/s) = (bandwidth × 0.8) / (weights + kv_per_token / GiB)
prefill (tok/s) = (TFLOPS × 0.55) / (2 × params)

டிகோட் நினைவக-பேண்ட்வித் சார்ந்தது; ப்ரீஃபில் கணக்கீடு சார்ந்தது.

தொடர்புடைய வழிகாட்டிகள்