कोई GPU, मॉडल और क्वांटाइज़ेशन चुनें, फिर कॉन्टेक्स्ट स्लाइडर को खींचें। बार चार्ट दिखाता है कि आपका VRAM बजट कैसे विभाजित होता है: मॉडल वेट्स, KV कैश, और ओवरहेड। हरा परिणाम मतलब सब कुछ GPU पर फिट बैठता है; पीला मतलब आंशिक CPU ऑफलोड; लाल मतलब यह बिल्कुल नहीं चलेगा।
डिकोड स्पीड ~80% मेमोरी बैंडविड्थ उपयोग मानती है और कि पूरा मॉडल VRAM में फिट बैठता है। KV कैश FP16 मानता है जिसमें 2 बाइट प्रति वैल्यू होते हैं। ओवरहेड वेट्स + KV कैश का ~6% है। वास्तविक मान इंजन, ड्राइवर और आर्किटेक्चर के अनुसार भिन्न होते हैं।
हम यह कैसे गणना करते हैं – मान्यताएँ और सूत्र
यह एक विज़ुअल बजट प्लानर है, प्रयोगशाला माप नहीं। वास्तविक उपयोग टोकनाइज़र, मॉडल बिल्ड, CUDA ग्राफ और इन्फ़रेंस इंजन के अनुसार भिन्न होता है।
1. मॉडल वेट्स
weights (GB) = parameters × bytes_per_weight / GiB
बाइट प्रति वेट: Q4 ≈ 0.56, Q8 ≈ 1.0625, 3.7 bpw ≈ 0.4625, आदि।
2. KV कैश
kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes kv_cache (GB) = kv_per_token × context / GiB
FP16 KV कैश मानता है (2 बाइट प्रति वैल्यू)। आर्किटेक्चर अनुमान मॉडल आकार के अनुसार भिन्न होते हैं।
3. ओवरहेड
overhead = (weights + kv_cache) × 0.06
6% CUDA कॉन्टेक्स्ट, इंजन बफ़र और छोटे रनटाइम आवंटन को कवर करता है।
4. परिणाम
फिट बैठता है यदि कुल ≤ VRAM × 0.95। आंशिक ऑफलोड यदि स्पिल ≤ 16 GB RAM। अन्यथा नहीं फिट होगा।
5. स्पीड अनुमान
decode (tok/s) = (bandwidth × 0.8) / (weights + kv_per_token / GiB) prefill (tok/s) = (TFLOPS × 0.55) / (2 × params)
डिकोड मेमोरी-बैंडविड्थ बाउंड है; प्रीफिल कंप्यूट बाउंड है।