VelsTech AI
LLMs कैसे काम करते हैं इसे समझने से लेकर अपने हार्डवेयर पर मॉडल चलाने तक – एक प्राकृतिक सीखने की यात्रा, सरल भाषा में, बिना हाइप के।
बेसिक्स समझें
इसमें नए हैं? गाइडेड पाथ का पालन करें →
मशीन लर्निंग वास्तव में क्या है?
डेटा से सीखने का वास्तव में क्या मतलब है – ट्रेनिंग, मॉडल और भविष्यवाणी – LLMs से पहले।
लार्ज लैंग्वेज मॉडल वास्तव में क्या है?
LLMs हुड के नीचे कैसे काम करते हैं – tokens, कॉन्टेक्स्ट और probabilities पर एक सरल-भाषा नज़र।
बेहतर प्रॉम्प्ट कैसे लिखें
व्यावहारिक पैटर्न जो ChatGPT, Claude और इसी तरह के टूल्स से बेहतर उत्तर पाने में मदद करते हैं।
लोकल AI
लोकल AI से कैसे शुरुआत करें (2026)
हार्डवेयर चुनें, Ollama इंस्टॉल करें, मॉडल डाउनलोड करें और अपनी मशीन पर चलाएँ।
GGUF समझाया गया
फ़ाइल फ़ॉर्मेट क्या है, Q4_K_M का क्या मतलब है, और सही क्वांटाइज़ेशन कैसे चुनें।
llama.cpp गाइड
Ollama के पीछे के इंजन के साथ GGUF मॉडल इंस्टॉल करें, चलाएँ और बेंचमार्क करें।
लोकल बनाम क्लाउड AI
गोपनीयता, लागत और क्षमता – अपने हार्डवेयर पर मॉडल चलाना बनाम क्लाउड APIs।
आपको कितनी VRAM चाहिए?
7B, 14B और 32B मॉडल के लिए VRAM – वेट्स, क्वांटाइज़ेशन, KV कैश और कॉन्टेक्स्ट।
LLMs को लोकली चलाने के लिए सबसे अच्छा GPU
RTX बनाम Radeon, आपको वास्तव में कितनी VRAM चाहिए, और llama.cpp के लिए क्या मायने रखता है।
वास्तविक हार्डवेयर पर टेस्ट किया गया
बेंचमार्क डेटाबेस
वास्तविक GPUs पर LLMs के लिए tokens/sec खोजें, फ़िल्टर करें और तुलना करें – टेस्टेड और अनुमानित।
Qwen 27B: RX 6800M पर ROCm बनाम Vulkan
12 GB कार्ड पर 16K पर 18 vs 22 tok/s decode – Lab में टेस्ट किया गया।
Ornith 35B MoE at 262K: ROCm बनाम Vulkan
28 CPU experts के साथ 12 GB कार्ड पर 26 vs 20 tok/s decode।
RX 6800M पर MoE बनाम Dense
3B active बनाम 27B at 16K/262K – कौन सा आर्किटेक्चर कहाँ जीतता है।
अपने नंबर खुद जोड़ें
मॉडल समाचार और अपडेट
हुड के नीचे जाएँ
क्वांटाइज़ेशन डीप डाइव
Q4, Q5 और Q8 गुणवत्ता, आकार और गति को कैसे बदलते हैं – वास्तविक संख्याओं के साथ।
KV कैश समझाया गया
कॉन्टेक्स्ट विंडो मेमोरी क्यों खाती हैं, और अपने GPU के लिए इसकी गणना कैसे करें।
Flash Attention और speculative decoding
दो तकनीकें जो LLMs को तेज़ और कम मेमोरी वाली बनाती हैं – वे कैसे काम करती हैं।
अपने हार्डवेयर पर चलाएँ
AMD पर ROCm और Vulkan
कौन सा बैकएंड चुनें, कैसे इंस्टॉल करें, और RX 6800M पर बेंचमार्क परिणाम।
Apple Silicon पर LLMs चलाना
Mac लोकल AI कैसे संभालते हैं, कौन से मॉडल आपकी RAM में फिट होते हैं, और Metal से शुरुआत करना।
RAG शुरू से
अपने दस्तावेज़ों के बारे में प्रश्न पूछें – load, embed, retrieve, generate, सब लोकल।