🧪 VelsTech Lab

बेंचमार्क • प्रयोग • टूल्स

वास्तविक हार्डवेयर पर व्यावहारिक टेस्ट – प्रेस रिलीज़ नहीं। हर Lab पोस्ट पूर्वापेक्षाएँ, हार्डवेयर/सॉफ़्टवेयर स्पेक्स, विधि, कच्चे परिणाम और क्या टूटा सूचीबद्ध करता है – असफलताओं सहित।

सभी प्रयोग · VRAM कैलकुलेटर · GPU प्रदर्शन · Lab अवलोकन

🧪 Lab ✓ पूर्ण 1 सितंबर 2026

RX 6800M पर Tiel-Coder 35B-A3B: 262K पर MTP बनाम non-MTP

एक ही 12GB RX 6800M + R9 5900HX – Tiel-Coder 35B-A3B Q4_K_XL MTP ड्राफ्ट हेड के साथ और बिना, 262K q8 KV, 28-32 CPU एक्सपर्ट, ROCm 10.0 पर। क्या speculative decoding MoE पर काम करता है?

MoEMTPRX 6800MSpeculative
MTP 29.09 vs 25.39 tok/s (+14.6%) · स्वीकृति 54.7% · औसत लंबाई 2.64
🧪 Lab ✓ पूर्ण 27 अगस्त 2026

RX 6800M पर MoE बनाम Dense: 3B Active बनाम 27B at 16K/262K

एक ही 12GB RX 6800M – Ornith MoE (3B active, 262K) बनाम Qwen dense (27B, 16K) at q8 KV, ROCm बनाम Vulkan आमने-सामने। MoE कब जीतता है और कब नहीं।

MoE vs DenseRX 6800MBenchmark
ROCm 25.6 vs 19.6 tok/s (Ornith) · Vulkan 21.8 vs 18.1 (Qwen)
🧪 Lab ✓ पूर्ण 27 अगस्त 2026

RX 6800M पर 262K पर Ornith 35B MoE: ROCm बनाम Vulkan

35B-A3B (3B active) Q5/Q4 mix at 262K q8 KV, 28 CPU experts – ROCm 25.6 tok/s बनाम Vulkan 19.6, 83 tok/s prompt। विशाल कॉन्टेक्स्ट, विरल decode।

MoEOrnith 35BRX 6800M
12GB · q8 KV · --n-cpu-moe 28 · kv_unified=false
🧪 Lab ✓ पूर्ण 27 अगस्त 2026

RX 6800M पर Qwen 27B Ridge 3.7bpw: 16K पर ROCm बनाम Vulkan

27B at 3.7bpw (~12.5GB) at 16K q8 KV – ROCm 18.12 tok/s बनाम Vulkan 21.84, 217 vs 149 tok/s prompt। कच्चे लॉग्स वाला पहला Lab।

QwenRX 6800M3.7bpw
12GB · q8 KV · -ngl 999 (fit abort) · blk.64 nextn
🧪 Lab ✓ पूर्ण 27 अगस्त 2026

7B, 14B और 32B मॉडल के लिए आपको कितनी VRAM चाहिए?

7B, 14B और 32B LLMs के लिए आवश्यक VRAM – वेट्स, क्वांटाइज़ेशन, KV कैश और कॉन्टेक्स्ट लंबाई, एक त्वरित-संदर्भ तालिका के साथ जिसे आप बुकमार्क कर सकते हैं।

VRAMLLMGPU
गाइड · VRAM कैलकुलेटर के साथ जोड़ी गई
🧪 Lab – अगला ◷ नियोजित

Qwen 27B बिना -ngl 999: MoE के लिए --fit चुनें + --load-mode none

दोनों मॉडलों को बिना बाध्य -ngl 999 (log fitted layers) और 28 CPU experts के लिए --load-mode none के साथ दोबारा चलाएँ – क्या 262K पर +30% ROCm टिकेगा?

अगलाROCmVulkan
स्थिति: नियोजित – वही RX 6800M, वही प्रॉम्प्ट

खरीद गाइड

ऊपर दिए गए बेंचमार्क के आधार पर लोकल AI चलाने के लिए व्यावहारिक चयन:

Lab पोस्ट कैसे संरचित होते हैं

हर Lab एक ही फ़ॉर्मेट का पालन करता है ताकि आप रनों की तुलना कर सकें:

  1. पूर्वापेक्षाएँ: मॉडल फ़ाइल, quant, GPU, ड्राइवर (ROCm/Vulkan), llama.cpp commit
  2. हार्डवेयर/सॉफ़्टवेयर स्पेक्स: सटीक कार्ड, VRAM, CPU, RAM, OS, ROCm/Vulkan, कैश प्रकार, कॉन्टेक्स्ट, थ्रेड्स
  3. विधि: पूरा llama-server कमांड, prompt tokens, slots, KV सेटिंग्स
  4. परिणाम: कच्ची print_timing तालिका – prompt eval ms/tok और tok/s, decode tg, graphs reused, कुल समय (कोई स्मूथिंग नहीं)
  5. क्या टूटा: चेतावनियाँ जैसे failed to fit params / tensor overrides to CPU with mmap / blk.64 unused nextn और समाधान
  6. कैलकुलेटर मैपिंग: VRAM + GPU प्रदर्शन की सीमाएँ अंतर कैसे समझाती हैं

असफलताएँ मूल्यवान सामग्री हैं – हम उन्हें लॉग करते हैं। यदि कोई रन OOM करता है या ऑफलोड होता है, तो वही परिणाम है।