मॉडल और क्वांटाइज़ेशन का कोई भी संयोजन चुनें, एक GPU चुनें, और यह विज़ार्ड एक साइड-बाय-साइड तुलना तैयार करता है: वेट साइज़, विभिन्न कॉन्टेक्स्ट लंबाईयों पर KV कैश, आवश्यक कुल VRAM, अपेक्षित डिकोड स्पीड, और एक सीधा फिट / टाइट / फिट नहीं फैसला। पूरी तरह से आपके ब्राउज़र में चलता है – कुछ भी अपलोड नहीं होता।

यह कैसे काम करता है – मान्यताएं और सूत्र

यह एक अनुमान है, प्रयोगशाला माप नहीं। नीचे दिए गए नंबर लाइव कैलकुलेटर लॉजिक से मेल खाते हैं।

1. मॉडल वेट साइज़

weights = parameters × bytes_per_weight / GiB

प्रति वेट बाइट्स प्रति क्वांटाइज़ेशन: Q2_K 0.35, Q3_K_M 0.45, Q4_K_M 0.61, Q5_K_M 0.66, Q6_K 0.8125, Q8_0 1.0625, FP16 2.0. उदाहरण: Q4_K_M पर 8B पैराम्स ≈ 8e9 × 0.61 / 1.07e9 ≈ 4.5 GB.

2. KV कैश

kv_per_token = 2 × layers × kv_heads × head_dim × 2 bytes
kv_cache = kv_per_token × context / GiB

×2 K और V को कवर करता है; अंतिम ×2 bytes FP16 KV मानता है (अधिकांश इंजनों के लिए डिफ़ॉल्ट)। तालिका 8K, 16K, 32K, 64K, 128K और 262K कॉन्टेक्स्ट पर KV दिखाती है ताकि आप देख सकें कि लंबा कॉन्टेक्स्ट मेमोरी पर कैसे हावी होता है।

3. कुल VRAM

total = weights + kv_cache + (weights + kv_cache) × 0.06 + 0.25 GB

6% CUDA कॉन्टेक्स्ट / इंजन बफ़र्स को कवर करता है, साथ ही एक निश्चित 0.25 GB फ़्लोर।

4. क्या यह फिट बैठता है?

total ≤ vram × 0.95फिट; vram × 1.05 तक → टाइट (कम KV के साथ चलाएं, या OOM देखें); अन्यथा फिट नहीं

5. डिकोड tok/s

tok/s ≈ memory_bandwidth × 0.85 / (active_params × bytes_per_weight)

डिकोडिंग मेमोरी-बाउंड है: प्रत्येक टोकन एक्टिव वेट को एक बार पढ़ता है। MoE मॉडल एक्टिव पैराम्स का उपयोग करते हैं (केवल रूटेड एक्सपर्ट्स), यही कारण है कि 30B-टोटल / 3B-एक्टिव MoE एक बहुत छोटे मॉडल की तरह डिकोड होता है। डेंस मॉडल पूरे पैराम्स का उपयोग करते हैं। ~85% उपयोग ओवरहेड के लिए जिम्मेदार है।

संबंधित गाइड