இரண்டு நுட்பங்கள் இன்று பெரும்பாலான வேகமான LLM இன்ஃபரன்ஸை அமைதியாக இயக்குகின்றன: ஃபிளாஷ் அட்டென்ஷன் மற்றும் ஸ்பெகுலேட்டிவ் டிகோடிங். ஒரு நவீன எஞ்சின் சில ஆண்டுகளுக்கு முன்பு சாத்தியமற்றதாகத் தோன்றிய வேகத்தை அடைய இதுவே காரணம். இவை எதுவும் புதிய மாடல் அல்ல – அவை ஏற்கனவே உள்ள மாடல்களை இயக்க சிறந்த வழிகள்.
அவை என்ன செய்கின்றன, எவ்வாறு செயல்படுகின்றன, மற்றும் உங்கள் சொந்த வன்பொருளில் இயங்கும் உள்ளூர் AI-க்கு அவை முக்கியமா என்பதை இங்கே பார்க்கலாம்.
ஃபிளாஷ் அட்டென்ஷன்: குறைந்த நினைவகம், வேகமான அட்டென்ஷன்
அட்டென்ஷன் ஒவ்வொரு டிரான்ஸ்ஃபார்மரின் இதயமாகும், ஆனால் அதற்கு ஒரு சிக்கல் உள்ளது: அதைக் கணக்கிடுவதற்கான நிலையான வழி ஒரு பெரிய இடைநிலை அணியை – seq_len × seq_len –
வேகமான நினைவகத்தில் (SRAM) உருவாக்கி, மெதுவான நினைவகத்திற்கு (GPU VRAM) கொட்டி, பின்னர் மீண்டும் படிக்கிறது. அந்த சுற்றுப்பயணம் முற்றிலும் வீண்.
ஃபிளாஷ் அட்டென்ஷன் கணிதத்தை மறுகட்டமைக்கிறது, இதனால் அட்டென்ஷன் ஸ்கோர்கள் ஓடுகளாக கணக்கிடப்பட்டு நுகரப்படுகின்றன, வேலை செய்யும் தொகுப்பை வேகமான SRAM-இல் வைத்து பெரிய இடைநிலை அணியை VRAM-க்கு எழுதாமல் தவிர்க்கிறது. இதன் விளைவு:
- மிகக் குறைந்த நினைவகத்தைப் பயன்படுத்துகிறது – இனி இருபடி இடைநிலை அணி இல்லை, எனவே நீண்ட சூழல்கள் முன்பு பொருந்தாத இடத்தில் பொருந்துகின்றன.
- வேகமானது – இது நினைவக-அலைவரிசை-கட்டுண்டது, மேலும் குறைந்த மெதுவான நினைவக சுற்றுப்பயணங்கள் செய்வது பெரிய வெற்றியைத் தருகிறது.
- அதே பதிலைத் தருகிறது – இது கணித ரீதியாக சமமானது, திறமையாக கணக்கிடப்படுகிறது.
நவீன மாடல்கள் 128K–1M சூழல் சாளரங்களைக் கோர முடிவதற்கு இதுவே காரணம். ஃபிளாஷ் அட்டென்ஷன் இல்லாமல், அவ்வளவு சூழல் வினாடிகளில் GPU நினைவகத்தை மீறிவிடும். நீங்கள் அதை "பயன்படுத்த" தேர்வு செய்யவில்லை – உங்கள் GPU ஆதரிக்கும்போது எஞ்சின்கள் அதை தானாகவே இயக்குகின்றன, மேலும் நீங்கள் அமைதியாக பயனடைகிறீர்கள்.
ஸ்பெகுலேட்டிவ் டிகோடிங்: கணிக்கவும், சரிபார்க்கவும், தவிர்க்கவும்
LLM-கள் ஒரு நேரத்தில் ஒரு டோக்கனை உருவாக்குகின்றன, மேலும் ஒவ்வொரு படியும் ஒரு முழு மாடல் பாஸ் ஆகும் – தொடர் மற்றும் மெதுவானது. ஸ்பெகுலேட்டிவ் டிகோடிங் அந்த தொடர் தடையை ஒரு புத்திசாலித்தனமான தந்திரத்துடன் தாக்குகிறது:
- ஒரு சிறிய, வேகமான "டிராஃப்ட்" மாடல் அடுத்த சில டோக்கன்களை (சுமார் 4–8) ஒரே நேரத்தில் யூகிக்கிறது.
- பெரிய மாடல் யூகங்களை இணையாக சரிபார்க்கிறது, ஒரு பாஸில்.
- பெரிய மாடல் ஒப்புக்கொள்ளும் டோக்கன்கள் வைக்கப்படுகின்றன – பெரும்பாலும் 2–4 – ஒரு சரிபார்ப்பு பாஸின் விலைக்கு.
வெற்றி: ஒன்றின் விலைக்கு பல டோக்கன்களைப் பெறுகிறீர்கள், எனவே பயனுள்ள உருவாக்கம் வேகம் அதிகரிக்கிறது – பெரும்பாலும் 1.5–3× – வெளியீட்டு பரவலை மாற்றாமல். பெரிய மாடல் உண்மையின் மூலமாகும்; டிராஃப்ட் வெறும் வேகமூட்டி மட்டுமே.
டிராஃப்ட் மாடல் பெரிய மாடலைக் கணிப்பதில் சிறப்பாக இருக்கும்போது (எ.கா. அதே குடும்பத்தின் சிறிய உடன்பிறப்பு) இது சிறப்பாக செயல்படுகிறது. நுகர்வோர் வன்பொருளில், llama.cpp மற்றும் Ollama டிராஃப்ட் மாடல்களை ஆதரிக்கின்றன, மேலும் நீண்ட பதில்களை உருவாக்கும் அரட்டைகளில் இந்த வேகமூட்டம் மிகவும் கவனிக்கத்தக்கது.
உள்ளூர் AI-க்கு இதன் அர்த்தம் என்ன
இரண்டு நுட்பங்களுமே நவீன உள்ளூர் AI ஏன் இவ்வளவு வேகமாக உணர்கிறது என்பதற்கான காரணம்:
- ஃபிளாஷ் அட்டென்ஷன் ஆதரிக்கப்படும் GPU-களில் (NVIDIA, AMD ROCm/Vulkan மூலம், Apple) llama.cpp / Ollama மூலம் தானாகவே இயக்கப்படுகிறது. இது அதே வன்பொருளில் பெரிய சூழல் சாளரங்களை இயக்க உதவுகிறது.
- ஸ்பெகுலேட்டிவ் டிகோடிங் நீங்கள் ஒரு டிராஃப்ட் மாடலை வழங்கும்போது இலவச வேக ஊக்கத்தை அளிக்கிறது – பெரிய மாடலின் தரத்தை வைத்துக்கொண்டு வேகமாக உருவாக்க முடியும்.
- குவாண்டைசேஷன் மற்றும் நிர்வகிக்கப்பட்ட KV கேச் உடன் சேர்ந்து, இவை நடைமுறை உள்ளூர் இன்ஃபரன்ஸின் நான்கு தூண்களாகும்.
நடைமுறையில், நீங்கள் இவற்றை கையால் சரிசெய்வதில்லை – எஞ்சின் செய்கிறது. ஆனால் இவை இருப்பதை அறிந்திருப்பது, அதே மாடல் ஏன் உங்கள் பேக்கெண்ட் மற்றும் கொடிகளைப் பொறுத்து மிகவும் வித்தியாசமான வேகத்தில் இயங்க முடியும் என்பதை விளக்குகிறது, இதைத்தான் நாங்கள் பெஞ்ச்மார்க் தரவுத்தளத்தில் அளவிடுகிறோம்.
பலனை எவ்வாறு பெறுவது
- உங்கள் எஞ்சினை புதுப்பித்த நிலையில் வைத்திருங்கள் – llama.cpp, Ollama மற்றும் LM Studio ஆகியவை தற்போதைய பில்ட்களில் ஃபிளாஷ் அட்டென்ஷன் மற்றும் ஸ்பெகுலேட்டிவ் டிகோடிங் ஆதரவை வழங்குகின்றன. பழைய பதிப்புகள் செயல்திறனை இழக்கின்றன.
- நவீன GPU ஐப் பயன்படுத்துங்கள் – ஃபிளாஷ் அட்டென்ஷனுக்கு போதுமான SRAM உள்ள GPU தேவை; கடந்த ~5 ஆண்டுகளில் உள்ள எந்த GPUயும் போதுமானது.
- ஸ்பெகுலேட்டிவ் டிகோடிங்கிற்கு ஒரு டிராஃப்ட் மாடலைச் சேர்க்கவும் – எ.கா. உங்கள் முக்கிய மாடலின் அதே குடும்பத்தின் சிறிய GGUF, மேலும் அதை உங்கள் எஞ்சின் உள்ளமைவில் டிராஃப்ட்டாக அனுப்பவும்.
நீங்கள் உள்ளூர் AI-க்கு புதியவர் மற்றும் ஒரு மாடலை இயக்க விரும்பினால், தொடக்க வழிகாட்டி முழு செயல்முறையையும் உள்ளடக்குகிறது; இந்த உகப்பாக்கங்கள் பின்னணியில் நடைபெறுகின்றன.
இறுதி வரி
ஃபிளாஷ் அட்டென்ஷன் மற்றும் ஸ்பெகுலேட்டிவ் டிகோடிங் மாயாஜாலம் அல்ல – அவை உங்களிடம் உள்ள வன்பொருளைப் பயன்படுத்துவதற்கான புத்திசாலித்தனமான வழிகள். ஒன்று நினைவகத்தை மிச்சப்படுத்தி அட்டென்ஷனை வேகப்படுத்துகிறது; மற்றொன்று உருவாக்கத்தை மலிவான சரிபார்ப்புடன் ஒன்றிணைக்கிறது. இரண்டும் நவீன எஞ்சின்களில் இலவச செயல்திறன், மற்றும் 2026-இல் தீவிர மாடல்களை உள்நாட்டில் இயக்குவது நடைமுறைக்குரியதாக இருப்பதற்கு இரண்டும் ஒரு பகுதியாகும்.