अपने computer पर AI चलाना – cloud API के ज़रिए नहीं – पहले Python environments setup करने, CUDA versions से जूझने और दोपहर भर error logs पढ़ने जैसा था। 2026 में, यह नाटकीय रूप से सरल है। आप एक tool install कर सकते हैं, एक command चला सकते हैं और पाँच मिनट से भी कम में local model के साथ chat कर सकते हैं।
यह guide पूरी प्रक्रिया बताती है: आपको असल में कौन सा hardware चाहिए, कौन सा software install करना है, कौन सा model चुनना है, और चल जाने के बाद क्या करना है। अगर आप local AI में नए हैं, तो यह एकमात्र guide है जिसकी आपको ज़रूरत है।
आपको क्या चाहिए: hardware
local AI के लिए सबसे ज़रूरी चीज़ memory है – ख़ासकर, model का कितना हिस्सा एक साथ RAM या VRAM में fit होता है। model के weights को चलने से पहले load होना होता है, और model की quality लगभग उसके size के proportional है।
यहाँ quick rule of thumb है:
- 8 GB RAM – 1–3B parameter models को 4-bit पर चलाता है। बुनियादी chat, सीमित reasoning के लिए useful। ज़्यादातर laptops और phones पर चलता है।
- 16 GB RAM – 7B models को 4-bit पर चलाता है। यह laptop के लिए sweet spot है। अच्छी quality, llama.cpp के ज़रिए CPU पर अच्छी speed।
- 32 GB RAM – 13B models को 4-bit पर, या 7B को 8-bit पर चलाता है। यहीं model सच में smart लगने लगता है।
- 64 GB+ RAM – 32B या 70B models को 4-bit पर चलाता है। यह workstation territory या unified-memory AI desktop है।
GPU बहुत मदद करता है, पर ज़रूरी नहीं है। अगर आपके पास GPU है, तो आपको model को hold करने के लिए पर्याप्त VRAM चाहिए। अपने numbers को LLM VRAM Calculator में डालकर देखें कि आपके card पर क्या fit होता है। अगर आप GPU खरीद रहे हैं, तो best GPU for local LLMs guide में पूरी breakdown है।
शुरू करने वाले ज़्यादातर लोगों के लिए सबसे सरल रास्ता है: जो आपके पास पहले से है उसी का इस्तेमाल करें। 16 GB RAM वाला आपका मौजूदा laptop 7B model को conversational speed पर चला सकता है। अगर ज़्यादा चाहिए, तो बाद में upgrade कर सकते हैं।
Step 1: Ollama install करें
Ollama शुरू करने के लिए सबसे अच्छा tool है। यह model downloading, quantization और inference engine को एक command-line tool में लपेट देता है, और यह Linux, macOS और Windows पर काम करता है। यह NVIDIA GPU, AMD GPU या Apple Silicon detect होने पर GPU acceleration अपने आप संभाल लेता है।
Linux/macOS पर:
curl -fsSL https://ollama.com/install.sh | sh
Windows पर: ollama.com/download से installer डाउनलोड करें और चलाएँ।
बस इतना ही। installation के बाद, Ollama background service के रूप में चलता है और आप models pull करना शुरू कर सकते हैं।
Step 2: model चुनें और डाउनलोड करें
Ollama के पास नाम से pull करने लायक models की बड़ी library है। पहली बार setup के लिए, आपके hardware के हिसाब से सबसे अच्छे options:
- 8–16 GB RAM:
ollama pull llama3.2:3bयाollama pull qwen2.5:7b - 16–32 GB RAM:
ollama pull llama3.1:8bयाollama pull mistral:7b - 32–64 GB RAM:
ollama pull qwen2.5:14bयाollama pull llama3.3:70b
अगर sure नहीं हैं, तो ollama pull llama3.2:3b से शुरू करें – यह छोटा है, तेज़ है और लगभग किसी भी चीज़ पर चलेगा। बड़े models बाद में pull कर सकते हैं।
Step 3: इससे chat करें
model डाउनलोड होने के बाद, बस चलाएँ:
ollama run llama3.2:3b
आपको एक terminal prompt मिलेगा जहाँ आप messages टाइप कर सकते हैं। बस इतना ही सरल है। बाहर निकलने के लिए /bye टाइप करें।
बेहतर experience के लिए, web UI install करें। Ollama built-in API के साथ आता है, और कई community UIs इसे auto-detect कर लेंगे:
- Open WebUI – सबसे polished। Docker में या सीधे चलता है। openwebui.com पर जाएँ।
- Ollama Web UI – हल्का, Docker की ज़रूरत नहीं:
ollama run llama3.2:3bफिर अपने browser मेंhttp://localhost:11434खोलें।
बेहतर जवाब पाने के tips के लिए, how to write better prompts guide देखें।
Step 4: आगे क्या करें
एक बार local model चल जाने पर, असली मज़ा शुरू होता है। आप इसके साथ क्या कर सकते हैं:
- Local chat assistant – इसे ChatGPT के private alternative के रूप में चलाते रहें। कोई data आपके computer से बाहर नहीं जाता, कोई subscription नहीं।
- Articles और documents को summarize करें – text paste करें और concise summary पाएँ। offline काम करता है, कोई copy-paste limits नहीं।
- Code लिखें और edit करें – Ollama VS Code extensions, terminal tools और custom automation के लिए built-in API के साथ काम करता है।
- Local RAG system बनाएँ – अपनी files (notes, PDFs, emails) को index करें और उन पर सवाल पूछें। llama.cpp और LlamaIndex जैसे tools इसे approachable बनाते हैं।
- AI agent चलाएँ – नए unified-memory machines के साथ, आप ऐसे agents चला सकते हैं जो web browse करें, tools इस्तेमाल करें और आपकी ओर से काम करें, सब locally।
अगर कोई problem आए
ज़्यादातर issues memory की वजह से होते हैं। अगर model start नहीं होता या बहुत धीमा चलता है:
- छोटा model आज़माएँ – 3B model अपने size के हिसाब से आश्चर्यजनक रूप से capable है और 2019 के laptop पर भी चलेगा।
- अपना RAM usage check करें – अगर आपके system में कुल 16 GB है, तो 4-bit पर 7B model को लगभग 4 GB चाहिए, OS और दूसरे apps के लिए 12 GB बच जाता है। यह ठीक है, पर अगर आपके पास 8 GB है तो दूसरे apps बंद करने होंगे।
- GPU इस्तेमाल करें – अगर आपके पास NVIDIA या AMD GPU है, तो Ollama इसे अपने आप इस्तेमाल करेगा। verify करने के लिए
ollama psचलाएँ। - CPU-only भी ठीक है – आधुनिक CPU पर 7B model लगभग 5–10 tokens प्रति सेकंड चलता है। यह readable है, instant नहीं, पर chat और summarization के लिए पूरी तरह usable है।
ज़्यादा detailed मदद के लिए, Ollama GitHub repo पर बेहतरीन documentation है।
Bottom line
2026 में local AI सरल है: Ollama install करें, model pull करें और chatting शुरू करें। आपको $3,000 का GPU या machine learning में degree की ज़रूरत नहीं है। 16 GB वाला laptop 7B model के साथ local AI की असली power महसूस करने के लिए काफी है – privacy, कोई subscription नहीं, कोई limits नहीं।
जब comfortable हो जाएँ, तो बड़े models explore करें, GPU आज़माएँ, या DGX Spark, RTX Spark या Ryzen AI Max mini PC इस्तेमाल करके dedicated local AI machine बनाएँ। दरवाज़ा खुला है, और इसमें कदम रखने का लगभग कोई खर्च नहीं है।