इस पेज का हर आँकड़ा इस साइट के हार्डवेयर (RX 6800M, ROCm बनाम Vulkan) पर किए गए वास्तविक परीक्षण से आता है, साथ ही बड़े डेस्कटॉप कार्डों के लिए GPU AI Performance Calculator के अनुमान भी शामिल हैं। GPU, मॉडल, बैकएंड या tested/estimated स्थिति के अनुसार फ़िल्टर करें, फिर सॉर्ट करने के लिए किसी भी कॉलम हेडर पर क्लिक करें। मौजूदा व्यू में सबसे तेज़ decode और prompt गति को नीले रंग में हाइलाइट किया जाता है।

लोड हो रहा है…

GPU मॉडल बैकएंड स्थिति Decode tok/s Prompt tok/s कॉन्टेक्स्ट Quant VRAM ऑफ़लोड
नोट्स और पद्धति

Tested पंक्तियों को सीधे इस साइट के हार्डवेयर पर मापा गया था और उनके स्रोत लेखों (नीचे लिंक किए गए) में विस्तार से वर्णित हैं। Estimated पंक्तियाँ GPU AI Performance Calculator से आती हैं, जो पूरी तरह से रेसिडेंट मॉडल मानकर अनुमान लगाती हैं – ये अनुमान हैं, प्रयोगशाला माप नहीं।

Decode (जनरेशन) गति इंटरैक्टिव चैट के लिए सबसे महत्वपूर्ण संख्या है – यह bandwidth-बद्ध होती है, इसलिए RTX 4060 Ti जैसे कम bandwidth वाले कार्डों की गति तेज़ी से गिरती है। Prompt (prefill) गति compute-बद्ध होती है। जहाँ कई बैकएंड का परीक्षण किया गया था, वहाँ हर बैकएंड को अलग पंक्ति के रूप में सूचीबद्ध किया गया है ताकि आप ROCm बनाम Vulkan की सीधे तुलना कर सकें।

संबंधित गाइड