# Running LLMs on Apple Silicon: a practical guide

> How M1/M2/M3/M4 Macs run local AI, what unified memory means, which models fit your Mac, and how to get started with Metal.

*Source: https://velstech.net/apple-silicon-llm-guide.ta (Tamil translation of https://velstech.net/apple-silicon-llm-guide) · Updated: 2026-08-30*

*Markdown version. [Read the interactive guide](https://velstech.net/apple-silicon-llm-guide.ta). English Markdown: https://velstech.net/apple-silicon-llm-guide.md.*

---

Apple Silicon Macகள் – M1, M2, M3, மற்றும் M4 – நீங்கள் வாங்கக்கூடிய மிகச் சிறந்த உள்ளூர்-AI
இயந்திரங்களில் சில. GPU மிக வேகமானது என்பதால் அல்ல, மாறாக
**unified memory** காரணமாக: அதே RAM CPU மற்றும் GPU இரண்டாலும் பகிரப்படுகிறது, இது
ஒரு LLM-ஐ இயக்க விரும்புவது துல்லியமாக இதுதான். போதுமான RAM உள்ள ஒரு Mac, PC-இல்
விலை உயர்ந்த தனி GPU தேவைப்படும் மாதிரிகளை வைத்திருக்க முடியும்.

Mac-இல் LLMகளை இயக்குவது பற்றி நீங்கள் தெரிந்து கொள்ள வேண்டியது, உங்கள் இயந்திரத்திற்கு எது பொருந்தும்,
மற்றும் எவ்வாறு தொடங்குவது என்பதை இங்கே காணலாம்.

## Macகள் உள்ளூர் AI-இல் ஏன் சிறந்தவை

ஒரு LLM-இன் வேகம் பெரும்பாலும் அதன் எடைகளை (weights) கணக்கீட்டு அலகுகளுக்கு எவ்வளவு வேகமாக
அளிக்கிறீர்கள் என்பதைப் பொறுத்தது – அதுவே மெமரி பேண்ட்விட்த். Apple Silicon-இன் unified memory என்பது:

- VRAM சுவர் இல்லை. PC-இல் நீங்கள் GPU VRAM-ஆல் வரம்பிடப்படுகிறீர்கள் (பொதுவாக 12–24 GB). Mac-இல், முழு சிஸ்டம் RAM-ஐயும் மாடலுக்கு பயன்படுத்தலாம். 64 GB M-சீரிஸ் Mac, 24 GB PC GPU-ஆல் இயக்க முடியாத மாதிரிகளை இயக்குகிறது.

- திறமையான Metal பேக்எண்ட். llama.cpp மற்றும் Ollama-க்கு சிறந்த Metal ஆதரவு உள்ளது, எனவே மாதிரிகள் GPU-ஐ தானாகவே பயன்படுத்துகின்றன.

- குறைந்த மின்சாரம். M-சீரிஸ் லேப்டாப் கூட inference இயக்கும்போது மிகக் குறைந்த மின்சாரத்தை எடுக்கிறது, எனவே இது உண்மையிலேயே நடைமுறையான எப்போதும்-இயங்கும் AI இயந்திரம்.

பிடிப்பு (catch): **RAM தான் எல்லாம்,** மற்றும் அது சாலிடர் செய்யப்பட்டது. மூன்று ஆண்டுகளுக்குப்
பிறகு உங்களுக்கு வேண்டிய RAM-ஐ இப்போதே வாங்குங்கள், ஏனென்றால் அதை பிறகு மேம்படுத்த முடியாது.

## உங்கள் Mac-க்கு எது பொருந்தும்

4-bit (Q4_K_M) இல் மாடல் அளவு தோராயமாக தேவையான RAM-ஐ ஒத்திருக்கிறது, கூடுதலாக சிஸ்டத்திற்கு
சில GB தேவைப்படுகிறது:

| Mac RAM | வசதியான மாடல் (Q4) | பயன்பாட்டு நிலை |
| --- | --- | --- |
| 8 GB | 3B–4B | அடிப்படை அரட்டை, இலகுவான பணிகள் |
| 16 GB | 7B–9B | திடமான தினசரி டிரைவர் |
| 24 GB | 13B–14B | தீவிர உள்ளூர் AI |
| 32 GB | 27B–30B | பெரிய மாதிரிகள், நல்ல காண்டெக்ஸ்ட் |
| 64 GB+ | 70B | Frontier அளவில் |

வேகத்திற்கு மெமரி பேண்ட்விட்த் முக்கியம் – M-சீரிஸ் Pro/Max சில்லுகளுக்கு அடிப்படை M-சீரிஸை
விட அதிக பேண்ட்விட்த் உள்ளது, எனவே "அதே RAM, பெரிய சிப்" கொண்ட Mac வேகமாக இயங்கும்.

## தொடங்குதல்

எளிதான வழி Ollama, இது Metal-ஐ தானாகவே கண்டறியும். அதை நிறுவிய பிறகு:

```
brew install ollama
ollama pull llama3.2:3b
ollama run llama3.2:3b
```

Ollama உங்கள் Mac-இன் GPU-ஐ முன்னிருப்பாகவே பயன்படுத்துகிறது. மேலும் கட்டுப்பாட்டிற்கு, llama.cpp-ஐ
Metal உடன் கட்டமைத்து நேரடியாக பயன்படுத்துங்கள் – [llama.cpp வழிகாட்டியில்](https://velstech.net/llama-cpp-guide)
இருப்பது போலவே, வெறுமனே Metal பேக்எண்டுடன்.

உள்ளூர் AI-க்கு முற்றிலும் புதியவரா? [தொடங்குதல்
வழிகாட்டி](https://velstech.net/how-to-get-started-local-ai) முழு செயல்முறையையும் விளக்குகிறது.

## செயல்திறன் எதிர்பார்ப்புகள்

வசதியாக பொருந்தக்கூடிய ஒரு மாதிரியுடன் M-சீரிஸ் Mac-இல் **5–20 tok/s** decode-ஐ
எதிர்பார்க்கலாம் – அரட்டைக்கு பயன்படக்கூடியது, உடனடியானது அல்ல. சரியான எண் உங்கள் சிப்,
RAM, மாடல் அளவு, மற்றும் குவாண்டிசேஷனைப் பொறுத்தது. [பெஞ்ச்மார்க்
தரவுத்தளத்தில்](https://velstech.net/benchmarks/index) உண்மையான முடிவுகளுடன் ஒப்பிடுங்கள் (நாங்கள் Radeon-ஐ சோதிக்கிறோம், ஆனால்
decode சூத்திரம் – பேண்ட்விட்த் ÷ ஒரு டோக்கனுக்கான பைட்டுகள் – அதே வழியில் பொருந்தும்).

உங்கள் தேர்ந்தெடுத்த காண்டெக்ஸ்ட் மற்றும் குவாண்டிசேஷனில் ஒரு மாதிரி உங்கள் Mac-இன் RAM-க்கு
பொருந்துமா என்பதை மதிப்பிட [LLM VRAM கால்குலேட்டரை](https://velstech.net/llm-vram-calculator) பயன்படுத்துங்கள்.

## நடைமுறை உதவிக்குறிப்புகள்

- சேமிப்பகத்தை விட RAM வாங்குங்கள். சேமிப்பகத்தை வெளிப்புறமாக சேர்க்க மலிவு; சாலிடர் செய்யப்பட்ட RAM என்றென்றும் நிரந்தரம்.

- பெரிய மாதிரிகளை இயக்கும்போது மற்ற பயன்பாடுகளை மூடுங்கள் – மாதிரி அதே unified memory-க்காக அவற்றுடன் போட்டியிடுகிறது.

- Q4_K_M ஐ விரும்புங்கள் பெரிய மாதிரிகளை பொருத்துவதற்கு; தர வர்த்தக-முடிவை குவாண்டிசேஷன் ஆழமான ஆய்வில் பார்க்கவும்.

- Pro/Max சில்லுகள் வேகமாக இயங்குகின்றன அதே RAM-இல், அதிக மெமரி பேண்ட்விட்த் காரணமாக.

## இறுதி முடிவு

Apple Silicon மிகவும் நடைமுறையான உள்ளூர்-AI தளங்களில் ஒன்று. இது அமைதியானது மற்றும்
குறைந்த மின்சாரம். Unified memory காரணமாக, பாதி RAM கொண்ட PC GPU-ஐ திணறடிக்கும் மாதிரிகளை இது இயக்க முடியும். 16 GB Mac
ஒரு உண்மையான தினசரி-டிரைவர் உள்ளூர்-AI இயந்திரம். 32 GB+ உள்ளது ஒரு தீவிர பணிநிலையம். முக்கிய
முடிவு போதுமான RAM-ஐ முன்கூட்டியே வாங்குவதே.

---

*VelsTech – https://velstech.net/apple-silicon-llm-guide.ta.md*
