# Flash Attention & speculative decoding: making LLMs faster

> How Flash Attention and speculative decoding make LLMs faster and use less memory – and why they matter for running models locally.

*Source: https://velstech.net/flash-attention-guide.ta (Tamil translation of https://velstech.net/flash-attention-guide) · Updated: 2026-08-30*

*Markdown version. [Read the interactive guide](https://velstech.net/flash-attention-guide.ta). English Markdown: https://velstech.net/flash-attention-guide.md.*

---

இரண்டு நுட்பங்கள் இன்று பெரும்பாலான வேகமான LLM இன்ஃபரன்ஸை அமைதியாக இயக்குகின்றன: **ஃபிளாஷ்
அட்டென்ஷன்** மற்றும் **ஸ்பெகுலேட்டிவ் டிகோடிங்**. ஒரு நவீன எஞ்சின் சில ஆண்டுகளுக்கு முன்பு சாத்தியமற்றதாகத் தோன்றிய வேகத்தை அடைய இதுவே காரணம்.
இவை எதுவும் புதிய மாடல் அல்ல – அவை ஏற்கனவே உள்ள மாடல்களை *இயக்க* சிறந்த வழிகள்.

அவை என்ன செய்கின்றன, எவ்வாறு செயல்படுகின்றன, மற்றும் உங்கள் சொந்த வன்பொருளில் இயங்கும் உள்ளூர் AI-க்கு அவை முக்கியமா என்பதை இங்கே பார்க்கலாம்.

## ஃபிளாஷ் அட்டென்ஷன்: குறைந்த நினைவகம், வேகமான அட்டென்ஷன்

அட்டென்ஷன் ஒவ்வொரு டிரான்ஸ்ஃபார்மரின் இதயமாகும், ஆனால் அதற்கு ஒரு சிக்கல் உள்ளது: அதைக் கணக்கிடுவதற்கான நிலையான வழி ஒரு பெரிய இடைநிலை அணியை – `seq_len × seq_len` –
வேகமான நினைவகத்தில் (SRAM) உருவாக்கி, மெதுவான நினைவகத்திற்கு (GPU VRAM) கொட்டி, பின்னர் மீண்டும் படிக்கிறது. அந்த சுற்றுப்பயணம் முற்றிலும் வீண்.

**ஃபிளாஷ் அட்டென்ஷன்** கணிதத்தை மறுகட்டமைக்கிறது, இதனால் அட்டென்ஷன் ஸ்கோர்கள் *ஓடுகளாக* கணக்கிடப்பட்டு நுகரப்படுகின்றன, வேலை செய்யும் தொகுப்பை வேகமான SRAM-இல் வைத்து
பெரிய இடைநிலை அணியை VRAM-க்கு எழுதாமல் தவிர்க்கிறது. இதன் விளைவு:

- மிகக் குறைந்த நினைவகத்தைப் பயன்படுத்துகிறது – இனி இருபடி இடைநிலை அணி இல்லை, எனவே நீண்ட சூழல்கள் முன்பு பொருந்தாத இடத்தில் பொருந்துகின்றன.

- வேகமானது – இது நினைவக-அலைவரிசை-கட்டுண்டது, மேலும் குறைந்த மெதுவான நினைவக சுற்றுப்பயணங்கள் செய்வது பெரிய வெற்றியைத் தருகிறது.

- அதே பதிலைத் தருகிறது – இது கணித ரீதியாக சமமானது, திறமையாக கணக்கிடப்படுகிறது.

நவீன மாடல்கள் 128K–1M சூழல் சாளரங்களைக் கோர முடிவதற்கு இதுவே காரணம். ஃபிளாஷ்
அட்டென்ஷன் இல்லாமல், அவ்வளவு சூழல் வினாடிகளில் GPU நினைவகத்தை மீறிவிடும். நீங்கள் அதை "பயன்படுத்த" தேர்வு செய்யவில்லை – உங்கள் GPU ஆதரிக்கும்போது எஞ்சின்கள் அதை தானாகவே இயக்குகின்றன, மேலும் நீங்கள் அமைதியாக பயனடைகிறீர்கள்.

## ஸ்பெகுலேட்டிவ் டிகோடிங்: கணிக்கவும், சரிபார்க்கவும், தவிர்க்கவும்

LLM-கள் ஒரு நேரத்தில் ஒரு டோக்கனை உருவாக்குகின்றன, மேலும் ஒவ்வொரு படியும் ஒரு முழு மாடல் பாஸ் ஆகும் – தொடர் மற்றும் மெதுவானது. **ஸ்பெகுலேட்டிவ் டிகோடிங்** அந்த தொடர் தடையை ஒரு புத்திசாலித்தனமான தந்திரத்துடன் தாக்குகிறது:

- ஒரு சிறிய, வேகமான "டிராஃப்ட்" மாடல் அடுத்த சில டோக்கன்களை (சுமார் 4–8) ஒரே நேரத்தில் யூகிக்கிறது.

- பெரிய மாடல் யூகங்களை இணையாக சரிபார்க்கிறது, ஒரு பாஸில்.

- பெரிய மாடல் ஒப்புக்கொள்ளும் டோக்கன்கள் வைக்கப்படுகின்றன – பெரும்பாலும் 2–4 – ஒரு சரிபார்ப்பு பாஸின் விலைக்கு.

வெற்றி: ஒன்றின் விலைக்கு பல டோக்கன்களைப் பெறுகிறீர்கள், எனவே பயனுள்ள உருவாக்கம்
வேகம் அதிகரிக்கிறது – பெரும்பாலும் 1.5–3× – **வெளியீட்டு பரவலை மாற்றாமல்**.
பெரிய மாடல் உண்மையின் மூலமாகும்; டிராஃப்ட் வெறும் வேகமூட்டி மட்டுமே.

டிராஃப்ட் மாடல் பெரிய மாடலைக் கணிப்பதில் சிறப்பாக இருக்கும்போது (எ.கா. அதே குடும்பத்தின் சிறிய உடன்பிறப்பு) இது சிறப்பாக செயல்படுகிறது. நுகர்வோர் வன்பொருளில், llama.cpp மற்றும் Ollama டிராஃப்ட் மாடல்களை ஆதரிக்கின்றன, மேலும் நீண்ட பதில்களை உருவாக்கும் அரட்டைகளில் இந்த வேகமூட்டம் மிகவும் கவனிக்கத்தக்கது.

## உள்ளூர் AI-க்கு இதன் அர்த்தம் என்ன

இரண்டு நுட்பங்களுமே நவீன உள்ளூர் AI ஏன் இவ்வளவு வேகமாக உணர்கிறது என்பதற்கான காரணம்:

- ஃபிளாஷ் அட்டென்ஷன் ஆதரிக்கப்படும் GPU-களில் (NVIDIA, AMD ROCm/Vulkan மூலம், Apple) llama.cpp / Ollama மூலம் தானாகவே இயக்கப்படுகிறது. இது அதே வன்பொருளில் பெரிய சூழல் சாளரங்களை இயக்க உதவுகிறது.

- ஸ்பெகுலேட்டிவ் டிகோடிங் நீங்கள் ஒரு டிராஃப்ட் மாடலை வழங்கும்போது இலவச வேக ஊக்கத்தை அளிக்கிறது – பெரிய மாடலின் தரத்தை வைத்துக்கொண்டு வேகமாக உருவாக்க முடியும்.

- குவாண்டைசேஷன் மற்றும் நிர்வகிக்கப்பட்ட KV கேச் உடன் சேர்ந்து, இவை நடைமுறை உள்ளூர் இன்ஃபரன்ஸின் நான்கு தூண்களாகும்.

நடைமுறையில், நீங்கள் இவற்றை கையால் சரிசெய்வதில்லை – எஞ்சின் செய்கிறது. ஆனால் இவை இருப்பதை அறிந்திருப்பது, அதே மாடல் ஏன் உங்கள் பேக்கெண்ட் மற்றும் கொடிகளைப் பொறுத்து மிகவும் வித்தியாசமான வேகத்தில் இயங்க முடியும் என்பதை விளக்குகிறது, இதைத்தான் நாங்கள்
[பெஞ்ச்மார்க் தரவுத்தளத்தில்](https://velstech.net/benchmarks/index) அளவிடுகிறோம்.

## பலனை எவ்வாறு பெறுவது

- உங்கள் எஞ்சினை புதுப்பித்த நிலையில் வைத்திருங்கள் – llama.cpp, Ollama மற்றும் LM Studio ஆகியவை தற்போதைய பில்ட்களில் ஃபிளாஷ் அட்டென்ஷன் மற்றும் ஸ்பெகுலேட்டிவ் டிகோடிங் ஆதரவை வழங்குகின்றன. பழைய பதிப்புகள் செயல்திறனை இழக்கின்றன.

- நவீன GPU ஐப் பயன்படுத்துங்கள் – ஃபிளாஷ் அட்டென்ஷனுக்கு போதுமான SRAM உள்ள GPU தேவை; கடந்த ~5 ஆண்டுகளில் உள்ள எந்த GPUயும் போதுமானது.

- ஸ்பெகுலேட்டிவ் டிகோடிங்கிற்கு ஒரு டிராஃப்ட் மாடலைச் சேர்க்கவும் – எ.கா. உங்கள் முக்கிய மாடலின் அதே குடும்பத்தின் சிறிய GGUF, மேலும் அதை உங்கள் எஞ்சின் உள்ளமைவில் டிராஃப்ட்டாக அனுப்பவும்.

நீங்கள் உள்ளூர் AI-க்கு புதியவர் மற்றும் ஒரு மாடலை இயக்க விரும்பினால்,
[தொடக்க வழிகாட்டி](https://velstech.net/how-to-get-started-local-ai) முழு செயல்முறையையும் உள்ளடக்குகிறது; இந்த உகப்பாக்கங்கள் பின்னணியில் நடைபெறுகின்றன.

## இறுதி வரி

ஃபிளாஷ் அட்டென்ஷன் மற்றும் ஸ்பெகுலேட்டிவ் டிகோடிங் மாயாஜாலம் அல்ல – அவை உங்களிடம் உள்ள வன்பொருளைப் பயன்படுத்துவதற்கான புத்திசாலித்தனமான வழிகள். ஒன்று நினைவகத்தை மிச்சப்படுத்தி அட்டென்ஷனை வேகப்படுத்துகிறது; மற்றொன்று உருவாக்கத்தை மலிவான சரிபார்ப்புடன் ஒன்றிணைக்கிறது. இரண்டும் நவீன எஞ்சின்களில் இலவச செயல்திறன், மற்றும்
2026-இல் தீவிர மாடல்களை உள்நாட்டில் இயக்குவது நடைமுறைக்குரியதாக இருப்பதற்கு இரண்டும் ஒரு பகுதியாகும்.

---

*VelsTech – https://velstech.net/flash-attention-guide.ta.md*
