ஒரு GPU மற்றும் ஒரு மாடலைத் தேர்வு செய்யுங்கள், இது உள்ளூர் இன்ஃபரன்ஸ் எவ்வளவு வேகமாக இருக்கும் என்பதை மதிப்பிடுகிறது: டிகோட் வேகம் (மாடல் பதிலளிக்கும்போது வினாடிக்கு டோக்கன்கள் – இது நினைவக-அலைவரிசை-கட்டுண்டது) மற்றும் ப்ராம்ப்ட் செயலாக்க வேகம் (கணக்கீடு-கட்டுண்டது). மதிப்பீடுகள் மட்டுமே – உண்மையான எண்கள் உங்கள் எஞ்சின், டிரைவர்கள் மற்றும் அமைப்புகளைப் பொறுத்தது.

நாங்கள் எவ்வாறு கணக்கிடுகிறோம் – அனுமானங்கள் & சூத்திரங்கள்

உண்மையான செயல்திறன் எஞ்சின், கெர்னல்கள், டிரைவர் மற்றும் குளிரூட்டலைப் பொறுத்தது. இவை நினைவக- மற்றும் கணக்கீடு-கட்டுண்ட மேல் எல்லைகள் ஆகும், அவை உணரப்பட்ட திறனால் அளவிடப்படுகின்றன, பெஞ்ச்மார்க்குகள் அல்ல.

1. இது பொருந்துமா?

weights = params × bytes_per_quant / GiB
kv_cache ≈ params × 16384 × context / GiB
total = weights + kv_cache

KV இங்கு தோராயமான 8B-கட்டமைப்பு தோராயத்தைப் பயன்படுத்துகிறது (8B-க்கு ~128 KB ஒரு டோக்கனுக்கு). total > vram என்றால் பொருந்தாது என குறிக்கிறோம்; லேயர்கள்/ஹெட்கள்/டைமில் இருந்து உண்மையான KV மிகவும் துல்லியமானது – அதற்கு VRAM கால்குலேட்டரை பயன்படுத்தவும்.

2. டிகோட் வேகம் (நினைவக கட்டுண்டது)

bytes_per_token = weights × GiB + kv_per_token
decode_tok/s = (memory_BW × 0.8) / bytes_per_token

ஒவ்வொரு உருவாக்கப்பட்ட டோக்கனும் முழு மாடல் + KV ஐ படிக்கிறது. 0.8 என்பது ~80% அடையக்கூடிய அலைவரிசையை மாதிரியாக்குகிறது; குவாண்டைசேஷன் உதவுகிறது ஏனெனில் ஒரு டோக்கனுக்கு குறைந்த பைட்டுகள்.

3. ப்ரீஃபில் / ப்ராம்ப்ட் செயலாக்கம் (கணக்கீடு கட்டுண்டது)

prefill_tok/s = (TFLOPS × 0.55) / (2 × params)

ப்ராம்ப்ட் செயலாக்கம் ஒரு பெரிய matmul: ஒரு அளவுருவுக்கு ஒரு டோக்கனுக்கு ~2 FLOPs. 0.55 55% கணக்கீட்டு பயன்பாட்டை மாதிரியாக்குகிறது. MoE மாடல்கள் செயலில் உள்ள அளவுருக்களைப் பயன்படுத்துகின்றன, எனவே உண்மையான ப்ரீஃபில் அதிகமாக இருக்கலாம்.

4. நேரங்கள்

TTFT = prompt_tokens / prefill_tok/s
gen_time = answer_tokens / decode_tok/s

மேலும் காண்க: உங்களுக்கு எவ்வளவு VRAM தேவை? மற்றும் உள்ளூர் LLM-களுக்கான சிறந்த GPU.

தொடர்புடைய வழிகாட்டிகள்