இரண்டு நுட்பங்கள் இன்று பெரும்பாலான வேகமான LLM இன்ஃபரன்ஸை அமைதியாக இயக்குகின்றன: ஃபிளாஷ் அட்டென்ஷன் மற்றும் ஸ்பெகுலேட்டிவ் டிகோடிங். ஒரு நவீன எஞ்சின் சில ஆண்டுகளுக்கு முன்பு சாத்தியமற்றதாகத் தோன்றிய வேகத்தை அடைய இதுவே காரணம். இவை எதுவும் புதிய மாடல் அல்ல – அவை ஏற்கனவே உள்ள மாடல்களை இயக்க சிறந்த வழிகள்.

அவை என்ன செய்கின்றன, எவ்வாறு செயல்படுகின்றன, மற்றும் உங்கள் சொந்த வன்பொருளில் இயங்கும் உள்ளூர் AI-க்கு அவை முக்கியமா என்பதை இங்கே பார்க்கலாம்.

ஃபிளாஷ் அட்டென்ஷன்: குறைந்த நினைவகம், வேகமான அட்டென்ஷன்

அட்டென்ஷன் ஒவ்வொரு டிரான்ஸ்ஃபார்மரின் இதயமாகும், ஆனால் அதற்கு ஒரு சிக்கல் உள்ளது: அதைக் கணக்கிடுவதற்கான நிலையான வழி ஒரு பெரிய இடைநிலை அணியை – seq_len × seq_len – வேகமான நினைவகத்தில் (SRAM) உருவாக்கி, மெதுவான நினைவகத்திற்கு (GPU VRAM) கொட்டி, பின்னர் மீண்டும் படிக்கிறது. அந்த சுற்றுப்பயணம் முற்றிலும் வீண்.

ஃபிளாஷ் அட்டென்ஷன் கணிதத்தை மறுகட்டமைக்கிறது, இதனால் அட்டென்ஷன் ஸ்கோர்கள் ஓடுகளாக கணக்கிடப்பட்டு நுகரப்படுகின்றன, வேலை செய்யும் தொகுப்பை வேகமான SRAM-இல் வைத்து பெரிய இடைநிலை அணியை VRAM-க்கு எழுதாமல் தவிர்க்கிறது. இதன் விளைவு:

நவீன மாடல்கள் 128K–1M சூழல் சாளரங்களைக் கோர முடிவதற்கு இதுவே காரணம். ஃபிளாஷ் அட்டென்ஷன் இல்லாமல், அவ்வளவு சூழல் வினாடிகளில் GPU நினைவகத்தை மீறிவிடும். நீங்கள் அதை "பயன்படுத்த" தேர்வு செய்யவில்லை – உங்கள் GPU ஆதரிக்கும்போது எஞ்சின்கள் அதை தானாகவே இயக்குகின்றன, மேலும் நீங்கள் அமைதியாக பயனடைகிறீர்கள்.

ஸ்பெகுலேட்டிவ் டிகோடிங்: கணிக்கவும், சரிபார்க்கவும், தவிர்க்கவும்

LLM-கள் ஒரு நேரத்தில் ஒரு டோக்கனை உருவாக்குகின்றன, மேலும் ஒவ்வொரு படியும் ஒரு முழு மாடல் பாஸ் ஆகும் – தொடர் மற்றும் மெதுவானது. ஸ்பெகுலேட்டிவ் டிகோடிங் அந்த தொடர் தடையை ஒரு புத்திசாலித்தனமான தந்திரத்துடன் தாக்குகிறது:

  1. ஒரு சிறிய, வேகமான "டிராஃப்ட்" மாடல் அடுத்த சில டோக்கன்களை (சுமார் 4–8) ஒரே நேரத்தில் யூகிக்கிறது.
  2. பெரிய மாடல் யூகங்களை இணையாக சரிபார்க்கிறது, ஒரு பாஸில்.
  3. பெரிய மாடல் ஒப்புக்கொள்ளும் டோக்கன்கள் வைக்கப்படுகின்றன – பெரும்பாலும் 2–4 – ஒரு சரிபார்ப்பு பாஸின் விலைக்கு.

வெற்றி: ஒன்றின் விலைக்கு பல டோக்கன்களைப் பெறுகிறீர்கள், எனவே பயனுள்ள உருவாக்கம் வேகம் அதிகரிக்கிறது – பெரும்பாலும் 1.5–3× – வெளியீட்டு பரவலை மாற்றாமல். பெரிய மாடல் உண்மையின் மூலமாகும்; டிராஃப்ட் வெறும் வேகமூட்டி மட்டுமே.

டிராஃப்ட் மாடல் பெரிய மாடலைக் கணிப்பதில் சிறப்பாக இருக்கும்போது (எ.கா. அதே குடும்பத்தின் சிறிய உடன்பிறப்பு) இது சிறப்பாக செயல்படுகிறது. நுகர்வோர் வன்பொருளில், llama.cpp மற்றும் Ollama டிராஃப்ட் மாடல்களை ஆதரிக்கின்றன, மேலும் நீண்ட பதில்களை உருவாக்கும் அரட்டைகளில் இந்த வேகமூட்டம் மிகவும் கவனிக்கத்தக்கது.

உள்ளூர் AI-க்கு இதன் அர்த்தம் என்ன

இரண்டு நுட்பங்களுமே நவீன உள்ளூர் AI ஏன் இவ்வளவு வேகமாக உணர்கிறது என்பதற்கான காரணம்:

நடைமுறையில், நீங்கள் இவற்றை கையால் சரிசெய்வதில்லை – எஞ்சின் செய்கிறது. ஆனால் இவை இருப்பதை அறிந்திருப்பது, அதே மாடல் ஏன் உங்கள் பேக்கெண்ட் மற்றும் கொடிகளைப் பொறுத்து மிகவும் வித்தியாசமான வேகத்தில் இயங்க முடியும் என்பதை விளக்குகிறது, இதைத்தான் நாங்கள் பெஞ்ச்மார்க் தரவுத்தளத்தில் அளவிடுகிறோம்.

பலனை எவ்வாறு பெறுவது

நீங்கள் உள்ளூர் AI-க்கு புதியவர் மற்றும் ஒரு மாடலை இயக்க விரும்பினால், தொடக்க வழிகாட்டி முழு செயல்முறையையும் உள்ளடக்குகிறது; இந்த உகப்பாக்கங்கள் பின்னணியில் நடைபெறுகின்றன.

இறுதி வரி

ஃபிளாஷ் அட்டென்ஷன் மற்றும் ஸ்பெகுலேட்டிவ் டிகோடிங் மாயாஜாலம் அல்ல – அவை உங்களிடம் உள்ள வன்பொருளைப் பயன்படுத்துவதற்கான புத்திசாலித்தனமான வழிகள். ஒன்று நினைவகத்தை மிச்சப்படுத்தி அட்டென்ஷனை வேகப்படுத்துகிறது; மற்றொன்று உருவாக்கத்தை மலிவான சரிபார்ப்புடன் ஒன்றிணைக்கிறது. இரண்டும் நவீன எஞ்சின்களில் இலவச செயல்திறன், மற்றும் 2026-இல் தீவிர மாடல்களை உள்நாட்டில் இயக்குவது நடைமுறைக்குரியதாக இருப்பதற்கு இரண்டும் ஒரு பகுதியாகும்.