एक मॉडल और क्वांटाइज़ेशन चुनें, अपनी कॉन्टेक्स्ट लंबाई सेट करें, और यह आपको चाहिए कुल GPU मेमोरी का अनुमान लगाता है – मॉडल वज़न प्लस KV कैश प्लस थोड़ा सा ओवरहेड। सीधा चलता है / आंशिक ऑफलोड / फिट नहीं बैठेगा फैसला पाने के लिए अपने GPU की VRAM दर्ज करें। पूरी तरह आपके ब्राउज़र में चलता है।
मोटा अनुमान। असली उपयोग मॉडल के सटीक बिल्ड, टोकनाइज़र, CUDA/ compute ग्राफ़ ओवरहेड और आपके inference इंजन पर निर्भर करता है। KV कैश FP16 मानता है।
हम इसकी गणना कैसे करते हैं – मान्यताएँ और सूत्र
यह एक अनुमान है, प्रयोगशाला माप नहीं। असली उपयोग टोकनाइज़र, मॉडल बिल्ड, CUDA ग्राफ़ और आपके inference इंजन (llama.cpp, vLLM, आदि) पर निर्भर करता है। नीचे दिए गए आँकड़े लाइव कैलकुलेटर लॉजिक से मेल खाते हैं।
1. मॉडल वज़न
weights = parameters × bytes_per_weight / GiB
प्रति वज़न बाइट क्वांटाइज़ेशन से आता है: FP32 4.0, FP16/BF16 2.0, Q8_0 1.0625, Q6_K 0.8125, Q5_K_M 0.66, Q4_K_M 0.61, Q4_0 0.56, INT4 0.5, INT8 1.0। उदाहरण: Q4_K_M पर 8B पैरामीटर ≈ 8e9 × 0.61 / 1.07e9 ≈ 4.5 GB।
2. KV कैश
kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes kv_cache = kv_per_token × context × batch / GiB
×2 K और V को कवर करता है; अंतिम ×2 bytes FP16 KV मानता है (अधिकांश इंजनों के लिए डिफ़ॉल्ट)। 32-लेयर, 8-KV-हेड, 128-डिम मॉडल के लिए 8192 कॉन्टेक्स्ट और बैच 1 पर, यह ~134 MB प्रति 1K टोकन है। लंबा कॉन्टेक्स्ट मेमोरी पर हावी होता है – 32K को 8K की तुलना में लगभग 4× KV चाहिए।
3. ओवरहेड
overhead = (weights + kv_cache) × 0.06 + 0.25 GB
6% CUDA कॉन्टेक्स्ट / इंजन बफ़र को कवर करता है, साथ ही 0.25 GB का निश्चित फ़्लोर। छोटा लेकिन 8 GB कार्ड पर ध्यान देने योग्य।
4. फैसला
total = weights + kv_cache + overhead। फिट बैठता है यदि total ≤ vram × 0.95। यदि स्पिल ram × 0.9 में फिट हो जाए तो आंशिक ऑफलोड; अन्यथा फिट नहीं बैठेगा। पूरा विवरण: आपको कितनी VRAM चाहिए?