KV कैश कॉन्टेक्स्ट के प्रत्येक टोकन के साथ बढ़ता है। यह कैलकुलेटर दिखाता है कि विभिन्न कॉन्टेक्स्ट लंबाई और क्वांटाइज़ेशन पर कैश कितनी मेमोरी उपयोग करेगा, ताकि आप मॉडल चलाने से पहले जान सकें कि आपके GPU में क्या फिट बैठता है।

मोटा अनुमान: layers × kv_heads × head_dim × 2 × bytes_per_value × context. सटीक संख्याओं के लिए मॉडल वज़न सहित, LLM VRAM कैलकुलेटर का उपयोग करें। इसे कम करने के तरीके के लिए KV कैश गाइड देखें।

संबंधित