कोई GPU, मॉडल और क्वांटाइज़ेशन चुनें, फिर कॉन्टेक्स्ट स्लाइडर को खींचें। बार चार्ट दिखाता है कि आपका VRAM बजट कैसे विभाजित होता है: मॉडल वेट्स, KV कैश, और ओवरहेड। हरा परिणाम मतलब सब कुछ GPU पर फिट बैठता है; पीला मतलब आंशिक CPU ऑफलोड; लाल मतलब यह बिल्कुल नहीं चलेगा।

हम यह कैसे गणना करते हैं – मान्यताएँ और सूत्र

यह एक विज़ुअल बजट प्लानर है, प्रयोगशाला माप नहीं। वास्तविक उपयोग टोकनाइज़र, मॉडल बिल्ड, CUDA ग्राफ और इन्फ़रेंस इंजन के अनुसार भिन्न होता है।

1. मॉडल वेट्स

weights (GB) = parameters × bytes_per_weight / GiB

बाइट प्रति वेट: Q4 ≈ 0.56, Q8 ≈ 1.0625, 3.7 bpw ≈ 0.4625, आदि।

2. KV कैश

kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes
kv_cache (GB) = kv_per_token × context / GiB

FP16 KV कैश मानता है (2 बाइट प्रति वैल्यू)। आर्किटेक्चर अनुमान मॉडल आकार के अनुसार भिन्न होते हैं।

3. ओवरहेड

overhead = (weights + kv_cache) × 0.06

6% CUDA कॉन्टेक्स्ट, इंजन बफ़र और छोटे रनटाइम आवंटन को कवर करता है।

4. परिणाम

फिट बैठता है यदि कुल ≤ VRAM × 0.95। आंशिक ऑफलोड यदि स्पिल ≤ 16 GB RAM। अन्यथा नहीं फिट होगा।

5. स्पीड अनुमान

decode (tok/s) = (bandwidth × 0.8) / (weights + kv_per_token / GiB)
prefill (tok/s) = (TFLOPS × 0.55) / (2 × params)

डिकोड मेमोरी-बैंडविड्थ बाउंड है; प्रीफिल कंप्यूट बाउंड है।

संबंधित गाइड