एक मॉडल और क्वांटाइज़ेशन चुनें, अपनी कॉन्टेक्स्ट लंबाई सेट करें, और यह आपको चाहिए कुल GPU मेमोरी का अनुमान लगाता है – मॉडल वज़न प्लस KV कैश प्लस थोड़ा सा ओवरहेड। सीधा चलता है / आंशिक ऑफलोड / फिट नहीं बैठेगा फैसला पाने के लिए अपने GPU की VRAM दर्ज करें। पूरी तरह आपके ब्राउज़र में चलता है।

हम इसकी गणना कैसे करते हैं – मान्यताएँ और सूत्र

यह एक अनुमान है, प्रयोगशाला माप नहीं। असली उपयोग टोकनाइज़र, मॉडल बिल्ड, CUDA ग्राफ़ और आपके inference इंजन (llama.cpp, vLLM, आदि) पर निर्भर करता है। नीचे दिए गए आँकड़े लाइव कैलकुलेटर लॉजिक से मेल खाते हैं।

1. मॉडल वज़न

weights = parameters × bytes_per_weight / GiB

प्रति वज़न बाइट क्वांटाइज़ेशन से आता है: FP32 4.0, FP16/BF16 2.0, Q8_0 1.0625, Q6_K 0.8125, Q5_K_M 0.66, Q4_K_M 0.61, Q4_0 0.56, INT4 0.5, INT8 1.0। उदाहरण: Q4_K_M पर 8B पैरामीटर ≈ 8e9 × 0.61 / 1.07e9 ≈ 4.5 GB।

2. KV कैश

kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes
kv_cache = kv_per_token × context × batch / GiB

×2 K और V को कवर करता है; अंतिम ×2 bytes FP16 KV मानता है (अधिकांश इंजनों के लिए डिफ़ॉल्ट)। 32-लेयर, 8-KV-हेड, 128-डिम मॉडल के लिए 8192 कॉन्टेक्स्ट और बैच 1 पर, यह ~134 MB प्रति 1K टोकन है। लंबा कॉन्टेक्स्ट मेमोरी पर हावी होता है – 32K को 8K की तुलना में लगभग 4× KV चाहिए।

3. ओवरहेड

overhead = (weights + kv_cache) × 0.06 + 0.25 GB

6% CUDA कॉन्टेक्स्ट / इंजन बफ़र को कवर करता है, साथ ही 0.25 GB का निश्चित फ़्लोर। छोटा लेकिन 8 GB कार्ड पर ध्यान देने योग्य।

4. फैसला

total = weights + kv_cache + overhead। फिट बैठता है यदि total ≤ vram × 0.95। यदि स्पिल ram × 0.9 में फिट हो जाए तो आंशिक ऑफलोड; अन्यथा फिट नहीं बैठेगा। पूरा विवरण: आपको कितनी VRAM चाहिए?

संबंधित गाइड