Apple Silicon Mac – M1, M2, M3 और M4 – चुपचाप सबसे बेहतरीन local-AI मशीनों में से हैं जिन्हें आप खरीद सकते हैं। इसलिए नहीं कि GPU सबसे तेज़ है, बल्कि unified memory के कारण – वही RAM, CPU और GPU दोनों साझा करते हैं, जो LLM चलाने के लिए बिल्कुल चाहिए। पर्याप्त RAM वाला Mac ऐसे model भी होल्ड कर सकता है जिनके लिए PC पर महँगा discrete GPU चाहिए।
Mac पर LLM चलाने के बारे में आपको क्या जानना चाहिए, आपकी मशीन में क्या फिट होगा, और शुरुआत कैसे करें – यहाँ सब कुछ है।
स्थानीय AI के लिए Mac क्यों अच्छे हैं
LLM की गति मुख्य रूप से इस बात से सीमित होती है कि आप उसके weights को compute units तक कितनी तेज़ी से पहुँचा सकते हैं – इसे memory bandwidth कहते हैं। Apple Silicon की unified memory का अर्थ है:
- VRAM की सीमा नहीं। PC पर आप GPU VRAM (आमतौर पर 12–24 GB) तक सीमित हैं। Mac पर, पूरा system RAM model के लिए उपलब्ध है। 64 GB वाला M-सीरीज़ Mac ऐसे model चला सकता है जो 24 GB वाले PC GPU पर नहीं चल सकते।
- Metal backend कुशल है। llama.cpp और Ollama में बेहतरीन Metal support है, इसलिए model स्वतः GPU का उपयोग करते हैं।
- कम बिजली खपत। M-सीरीज़ लैपटॉप भी inference के दौरान बहुत कम बिजली लेता है, इसलिए यह वास्तव में व्यावहारिक, हमेशा-चालू AI मशीन है।
लेकिन एक बात ध्यान रखें – RAM ही सब कुछ है, और यह soldered है। वही RAM खरीदें जो आपको तीन साल बाद चाहिए होगी, क्योंकि बाद में आप इसे अपग्रेड नहीं कर सकते।
आपके Mac में क्या फिट होगा
4-bit (Q4_K_M) पर model का आकार लगभग आवश्यक RAM के बराबर होता है, साथ ही system को भी कुछ GB चाहिए:
| Mac RAM | आरामदायक model (Q4) | उपयोग |
|---|---|---|
| 8 GB | 3B–4B | बुनियादी चैट, हल्के कार्य |
| 16 GB | 7B–9B | रोज़मर्रा के लिए भरोसेमंद |
| 24 GB | 13B–14B | गंभीर local AI |
| 32 GB | 27B–30B | बड़े model, लंबा context |
| 64 GB+ | 70B | फ्रंटियर के करीब |
गति के लिए memory bandwidth भी मायने रखती है – M-सीरीज़ Pro/Max चिप्स में base M-सीरीज़ से अधिक bandwidth है, इसलिए “समान RAM, बड़ा चिप” वाला Mac तेज़ चलता है।
शुरुआत कैसे करें
सबसे आसान तरीका Ollama है, जो Metal को स्वतः पहचान लेता है। इसे इंस्टॉल करें, फिर:
brew install ollama ollama pull llama3.2:3b ollama run llama3.2:3b
Ollama आपके Mac के GPU का आउट-ऑफ-द-बॉक्स उपयोग करता है। अधिक नियंत्रण के लिए, llama.cpp को Metal के साथ build करें और सीधे उपयोग करें – वही अवधारणा जो llama.cpp गाइड में है, बस Metal backend के साथ।
local AI में बिल्कुल नए हैं? शुरुआती गाइड पूरी प्रक्रिया step-by-step समझाता है।
प्रदर्शन से क्या उम्मीद करें
आराम से फिट होने वाले model के साथ M-सीरीज़ Mac पर 5–20 tok/s decode की उम्मीद करें – चैट के लिए उपयोगी, लेकिन तुरंत नहीं। सटीक संख्या आपके chip, RAM, model आकार और quantization पर निर्भर करती है। वास्तविक परिणामों से तुलना benchmark डेटाबेस में करें (हम Radeon टेस्ट करते हैं, लेकिन decode फॉर्मूला – bandwidth ÷ bytes per token – वैसे ही लागू होता है)।
क्या कोई model आपके चुने हुए context और quantization पर आपके Mac की RAM में फिट होगा, इसका अनुमान लगाने के लिए LLM VRAM Calculator का उपयोग करें।
व्यावहारिक सुझाव
- storage के बजाय RAM खरीदें। Storage बाहर से सस्ते में जोड़ा जा सकता है; soldered RAM हमेशा के लिए है।
- बड़े model चलाते समय अन्य apps बंद करें – model उन्हीं के साथ उसी unified memory के लिए प्रतिस्पर्धा करता है।
- बड़े model फिट करने के लिए Q4_K_M को प्राथमिकता दें – quality trade-off के लिए quantization डीप डाइव देखें।
- समान RAM पर Pro/Max चिप्स तेज़ चलते हैं क्योंकि उनमें अधिक memory bandwidth है।
निष्कर्ष
Apple Silicon सबसे व्यावहारिक local-AI प्लेटफ़ॉर्म में से एक है। यह शांत और कम बिजली वाला है। unified memory की बदौलत, यह ऐसे model चला सकता है जो आधे RAM वाले PC GPU पर अटक जाएँ। 16 GB वाला Mac वास्तव में रोज़मर्रा की local-AI मशीन है। 32 GB+ वाला एक गंभीर workstation है। मुख्य निर्णय यह है कि शुरू में ही पर्याप्त RAM खरीदें।