Apple Silicon Mac – M1, M2, M3 और M4 – चुपचाप सबसे बेहतरीन local-AI मशीनों में से हैं जिन्हें आप खरीद सकते हैं। इसलिए नहीं कि GPU सबसे तेज़ है, बल्कि unified memory के कारण – वही RAM, CPU और GPU दोनों साझा करते हैं, जो LLM चलाने के लिए बिल्कुल चाहिए। पर्याप्त RAM वाला Mac ऐसे model भी होल्ड कर सकता है जिनके लिए PC पर महँगा discrete GPU चाहिए।

Mac पर LLM चलाने के बारे में आपको क्या जानना चाहिए, आपकी मशीन में क्या फिट होगा, और शुरुआत कैसे करें – यहाँ सब कुछ है।

स्थानीय AI के लिए Mac क्यों अच्छे हैं

LLM की गति मुख्य रूप से इस बात से सीमित होती है कि आप उसके weights को compute units तक कितनी तेज़ी से पहुँचा सकते हैं – इसे memory bandwidth कहते हैं। Apple Silicon की unified memory का अर्थ है:

लेकिन एक बात ध्यान रखें – RAM ही सब कुछ है, और यह soldered है। वही RAM खरीदें जो आपको तीन साल बाद चाहिए होगी, क्योंकि बाद में आप इसे अपग्रेड नहीं कर सकते।

आपके Mac में क्या फिट होगा

4-bit (Q4_K_M) पर model का आकार लगभग आवश्यक RAM के बराबर होता है, साथ ही system को भी कुछ GB चाहिए:

Mac RAMआरामदायक model (Q4)उपयोग
8 GB3B–4Bबुनियादी चैट, हल्के कार्य
16 GB7B–9Bरोज़मर्रा के लिए भरोसेमंद
24 GB13B–14Bगंभीर local AI
32 GB27B–30Bबड़े model, लंबा context
64 GB+70Bफ्रंटियर के करीब

गति के लिए memory bandwidth भी मायने रखती है – M-सीरीज़ Pro/Max चिप्स में base M-सीरीज़ से अधिक bandwidth है, इसलिए “समान RAM, बड़ा चिप” वाला Mac तेज़ चलता है।

शुरुआत कैसे करें

सबसे आसान तरीका Ollama है, जो Metal को स्वतः पहचान लेता है। इसे इंस्टॉल करें, फिर:

brew install ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b

Ollama आपके Mac के GPU का आउट-ऑफ-द-बॉक्स उपयोग करता है। अधिक नियंत्रण के लिए, llama.cpp को Metal के साथ build करें और सीधे उपयोग करें – वही अवधारणा जो llama.cpp गाइड में है, बस Metal backend के साथ।

local AI में बिल्कुल नए हैं? शुरुआती गाइड पूरी प्रक्रिया step-by-step समझाता है।

प्रदर्शन से क्या उम्मीद करें

आराम से फिट होने वाले model के साथ M-सीरीज़ Mac पर 5–20 tok/s decode की उम्मीद करें – चैट के लिए उपयोगी, लेकिन तुरंत नहीं। सटीक संख्या आपके chip, RAM, model आकार और quantization पर निर्भर करती है। वास्तविक परिणामों से तुलना benchmark डेटाबेस में करें (हम Radeon टेस्ट करते हैं, लेकिन decode फॉर्मूला – bandwidth ÷ bytes per token – वैसे ही लागू होता है)।

क्या कोई model आपके चुने हुए context और quantization पर आपके Mac की RAM में फिट होगा, इसका अनुमान लगाने के लिए LLM VRAM Calculator का उपयोग करें।

व्यावहारिक सुझाव

निष्कर्ष

Apple Silicon सबसे व्यावहारिक local-AI प्लेटफ़ॉर्म में से एक है। यह शांत और कम बिजली वाला है। unified memory की बदौलत, यह ऐसे model चला सकता है जो आधे RAM वाले PC GPU पर अटक जाएँ। 16 GB वाला Mac वास्तव में रोज़मर्रा की local-AI मशीन है। 32 GB+ वाला एक गंभीर workstation है। मुख्य निर्णय यह है कि शुरू में ही पर्याप्त RAM खरीदें।