یہ مضمون بیان کرتا ہے کہ کس طرح مکسچر آف ایکسپرٹس ماڈل چند ماہرین سے بڑھ کر تقریباً 900 فی پرت تک پہنچ گیا، اور کمپریشن اور استحکام کے میکانزم جو ان ویران ڈیزائنوں کو قابل تربیت اور سستے رکھتے ہیں۔
کھلے ماہر مکس ماڈل نے ناقابل یقین شرح پر توسیع کی ہے۔ Mixtral تقریباً 47 بلین کل پیرامیٹرز تک پہنچ گیا، DeepSeek-V3 671 بلین تک پہنچ گیا، اور Kimi K3 کھربوں ڈالر تک پہنچ گیا۔ حیران کن بات صرف یہ نہیں ہے کہ یہ ماڈل کتنے بڑے ہو گئے ہیں، بلکہ ہر ایک ایک ٹوکن پر کتنا کم عمل کرتا ہے۔
Kimi K3 کے پاس 2.8 ٹریلین پیرامیٹرز ہیں، لیکن ان میں سے صرف ایک ٹوکن کے لیے تقریباً 104 بلین استعمال کرتے ہیں۔ تقریباً ہر پرت پر، چھوٹے راؤٹرز 896 میں سے 16 خصوصی فیڈ فارورڈ نیٹ ورکس کو منتخب کرتے ہیں۔ ماہردو شیئرنگ ماہرین تمام ٹوکنز کو ہینڈل کرتے ہیں۔
یہ مضمون چوڑائی والے ڈیزائن پر توجہ مرکوز کرتا ہے، یعنی کس طرح ایک ماڈل ہر ٹوکن کے لیے پروسیسنگ کی تمام صلاحیتوں کو ختم کیے بغیر پروسیسنگ کی صلاحیت کا ایک بڑا پول فراہم کر سکتا ہے۔ یہ اس سے مختلف ہے: ترتیب میمورییہ اس بارے میں ہے کہ ماڈل کس طرح پچھلے ٹوکنز سے معلومات کو اسٹور اور بازیافت کرتا ہے۔
آئیے چار فن تعمیرات کے ذریعے مکسچر آف ایکسپرٹس (MoE) کے ارتقاء کی پیروی کرتے ہیں تاکہ دیکھیں کہ K3 اس ڈیزائن تک کیسے پہنچا۔
Mixtral ایک بنیادی پیٹرن کی واضح عوامی وزن کی مثال ہے۔ اس کا مطلب ہے کہ ہم ہر ایک ٹوکن مکمل سائز کے ماہرین کی ایک چھوٹی تعداد کے حوالے کرتے ہیں۔ DeepSeekMoE کام کو مزید دانے دار اور مشترکہ ماہرین میں تقسیم کرتا ہے۔ LatentMoE نے پھر روٹ شدہ راستوں کو کمپریس کیا، جس سے ماہرین کو ایک چھوٹی جگہ میں کام کرنے کی اجازت ملی۔ آخر میں، K3 نے اسے Stable LatentMoE کے طور پر اپنایا، جس میں فی پرت 896 ماہرین کے لیے عددی استحکام اور متوازن روٹنگ کا طریقہ کار شامل کیا گیا۔
راستے میں، آپ سیکھیں گے کہ ایم او ای ماڈل میں ماہر شمار اور فعال پیرامیٹر نمبروں کی تشریح کیسے کی جائے اور حساب اور ڈیٹا کی نقل و حرکت کے لیے اس کا کیا مطلب ہے۔
ماہرین کی صرف ایک چھوٹی سی تعداد کو فعال کرنا ہی MoE کو پرکشش بناتا ہے، لیکن یہ نئی رکاوٹیں بھی متعارف کراتا ہے۔ مثال کے طور پر، منتخب ماہر کے وزن کو ابھی بھی GPU میموری سے پڑھنے کی ضرورت ہے، اور ٹوکن کی نمائندگی کو GPUs کے درمیان منتقل کرنے کی ضرورت ہو سکتی ہے۔ نیچے دیے گئے فن تعمیر کو ان اخراجات کو منظم کرنے کی مسلسل کوشش کے طور پر سمجھا جاتا ہے۔
شرطیں
یہ ایک تصوراتی مضمون ہے، اس لیے انسٹال کرنے یا چلانے کے لیے کچھ نہیں ہے۔
-
مددگار: عصبی نیٹ ورکس اور ٹرانسفارمر پرتوں کی عمومی ظاہری شکل سے واقفیت: ایک فیڈ فارورڈ نیٹ ورک جس کے بعد توجہ دی جاتی ہے۔
-
ضرورت نہیں: Kimi K3، مخلوط روٹنگ یا تقسیم شدہ تربیت کا ماہر پیشگی علم۔ ہر ایک کا تعارف کرایا جاتا ہے۔
-
کوڈ یا ٹولز کی ضرورت نہیں ہے۔
انڈیکس
1. ایک گھنے پرت سے ماہر مرکب تک
ٹرانسفارمر پرتیں دو طرح کی چیزیں کرتی ہیں:
توجہ ٹوکن معلومات کا تبادلہ کر سکتے ہیں۔ ایک ٹوکن کی نمائندگی (تقریبا ایک لفظ یا ٹوکن کا حصہ) ترتیب میں دوسری جگہوں سے معلومات کو ضم کر سکتی ہے۔
کہ فیڈ فارورڈ نیٹ ورکیا FFN کو منتخب کریں اور پھر ہر ٹوکن کو آزادانہ طور پر تبدیل کریں۔ ٹوکن کے FFN تک پہنچنے تک، متعلقہ سیاق و سباق پہلے ہی موجودہ عددی نمائندگی میں سمٹ چکا ہے۔
ایک گھنے ٹرانسفارمر میں، تمام ٹوکن ایک ہی FFN سے گزرتے ہیں۔ FFNs میں عام طور پر کئی بڑے میٹرکس شامل ہوتے ہیں اور ماڈل پیرامیٹرز اور حسابات کا ایک اہم حصہ ہوتا ہے۔ اسے وسیع کرنے سے ماڈل کو مزید صلاحیت ملے گی، لیکن چونکہ ہر ٹوکن پورے FFN کو عبور کرتا ہے، اس لیے اضافی کام تمام ٹوکنز پر لاگو کیا جائے گا۔
ماہرین کا مرکب (MoE) اس ترتیب کو تبدیل کرتا ہے۔ ایک FFN کے بجائے، پرت میں مختلف سیکھے ہوئے وزن کے ساتھ متعدد FFNs شامل ہیں۔ چھوٹا راؤٹر یہ ٹوکن کی موجودہ نمائندگی کا جائزہ لیتا ہے، دستیاب ماہرین کو اسکور کرتا ہے اور سرفہرست چند کو منتخب کرتا ہے۔ صرف منتخب ماہرین ہی ٹوکنز پر کارروائی کرتے ہیں، اور ان کے نتائج کو تہہ کے نتائج میں ملایا جاتا ہے۔
حتمی آؤٹ پٹ صرف منتخب ماہرین کے نتائج کا وزنی مجموعہ ہے، اور ہر منتخب ماہر راؤٹر کے وزن میں متناسب حصہ ڈالتا ہے۔ غیر منتخب ماہرین ان ٹوکنز کے لیے FFN کیلکولیشن نہیں کریں گے۔
یہ روٹنگ تمام MoE تہوں پر آزادانہ طور پر ہوتی ہے۔ ماہرین اور اکثر مہارت حاصل کر سکتے ہیں، اور روٹرز سیکھتے ہیں کہ موجودہ صورتحال میں ٹوکن کے لیے کون سے امتزاج بہترین ہیں۔ تاہم، یہ کردار تربیت کے دوران ابھرتے ہیں۔ وہ بے کار ہو سکتے ہیں اور "Python” یا "History” جیسے واضح لیبلز سے ملنے کی ضمانت نہیں دی جاتی ہے۔ لہذا ایک ہی لفظ مختلف سیاق و سباق میں مختلف راستے لے سکتا ہے، اور ایک ہی ٹوکن مختلف گہرائیوں میں مختلف ماہرین کو اٹھا سکتا ہے۔ ہر درجے کا اپنا ماہر پول بھی ہوتا ہے، اس لیے ایک درجے کا ماہر 7 دوسرے درجے کے ماہر 7 سے متعلق نہیں ہوتا۔
ایک مقبول کھلے وزن کی مثال Mixtral 8x7B ہے۔ ہر Mixtral پرت میں 8 FFN ماہرین ہوتے ہیں، اور روٹر ہر ٹوکن کے لیے 2 کا انتخاب کرتا ہے۔ منتخب جوڑے ٹوکن سے ٹوکن اور پرت سے پرت میں تبدیل ہو سکتے ہیں۔
نام 8x7B غلط سمجھنا آسان ہے۔ Mixtral آٹھ مکمل 7 بلین پیرامیٹر ماڈل کے بجائے ایک ٹرانسفارمر ہے۔ توجہ، ایمبیڈنگ، نارملائزیشن لیئرز، اور دیگر مشترکہ اجزاء صرف ایک بار موجود ہیں۔
ہر پرت کے اندر 8 بار دہرانا FFN ہے۔ ہر ماہر کا ایک منفرد وزن ہوتا ہے اور وہ یکساں وزنی ہوتا ہے۔ 4,096 -> 14,336 -> 4,096 یہ Mistral 7B کے باقاعدہ FFN کے سائز کے برابر ہے۔ روٹر ہر ٹوکن کے لیے 8 FFN میں سے صرف 2 چلاتا ہے۔ لہذا Mixtral میں 56 بلین کے بجائے کل تقریباً 47 بلین پیرامیٹرز ہیں، ایک ٹوکن کے لیے تقریباً 13 بلین پیرامیٹرز فعال ہیں۔ اس فعال شمار میں فی پرت کے دو منتخب ماہرین اور ماڈل کے مشترکہ پیرامیٹرز دونوں شامل ہیں۔
یہ جاننے کے قابل ہے کہ یہ آپ کو کیا بچاتا ہے۔ ٹوکنز اب بھی ہر پرت پر دو فل سائز FFNs سے گزرتے ہیں، لہذا Mixtral Mistral 7B کے سنگل FFN کے مقابلے میں تقریباً دو گنا زیادہ FFN حسابات انجام دیتا ہے، لیکن تمام آٹھ ماہرین کو چلانے کے لیے جو درکار ہے اس کا صرف ایک چوتھائی حصہ ہے۔ فائدہ یہ ہے کہ اس کے لیے کم ماہرین کی ضرورت ہوتی ہے اور ضروری نہیں کہ اصل گھنے ماڈل سے کم کمپیوٹیشن ہوں۔ آپ ہر ٹوکن کے لیے پورے پول کو چلانے کے بغیر پیرامیٹرز کے بہت بڑے پول تک رسائی حاصل کر سکتے ہیں۔
شکل 1 (اوپر): گھنی تہہ تمام ٹوکنز کو ایک FFN (بائیں) کے ذریعے بھیجتی ہے۔ ماہر مخلوط پرت بہت سے ماہر FFNs کو برقرار رکھتی ہے لیکن صرف چند فی ٹوکن (دائیں) کو چالو کرتی ہے۔ Mixtral 8 میں سے 2 استعمال کرتا ہے۔ کل پیرامیٹرز بڑھ جاتے ہیں، لیکن فی ٹوکن آپریشنز بہت چھوٹے ہو جاتے ہیں۔
2. MoE Mixtral سے آگے کیسے تیار ہوا ہے؟
تو Mixtral میں 8 ماہرین 8 لوگ ہیں۔ معیاری چوڑائی FFNایک FFN کے 8 چھوٹے ٹکڑے نہیں۔ مزید کا انتخاب ٹوکنز کو مزید سیکھی ہوئی تبدیلیوں کو یکجا کرنے کی اجازت دیتا ہے، لیکن Mixtral سائز کا ہر اضافی ماہر اہم حساب کا اضافہ کرتا ہے۔ DeepSeekMoE نے پوچھا کہ کیا ایک ہی کمپیوٹنگ بجٹ بہت سے چھوٹے ماہرین میں تقسیم کیا جا سکتا ہے۔
FFN عام طور پر ٹوکن ویکٹر کو ایک وسیع اندرونی تہہ میں پھیلاتا ہے، اسے وہاں تبدیل کرتا ہے، اور پھر اسے ٹوکن ویکٹر کے اصل سائز میں کم کر دیتا ہے۔
مثال کے طور پر، ایک 2,000 جہتی ٹوکن ویکٹر کو 8,000 جہتی داخلی نمائندگی تک بڑھایا جا سکتا ہے اور پھر اسے 2,000 جہتوں میں پیش کیا جا سکتا ہے۔ ہمیں 2,000 پر واپس جانے کی ضرورت ہے تاکہ نتائج باقی ماڈل کے لیے جاری رہ سکیں۔
ڈیپ سیک ماہرین کی رینج کو کم کرتا ہے، انہیں چھوٹا بناتا ہے۔ اندرونی فرش اگر ایک بڑے ماہر کی صلاحیت کو چار تنگ ماہرین سے تبدیل کر دیا جائے تو، راؤٹر ماہرین کی گنتی کے حجم کو یکساں رکھتے ہوئے تقریباً چار گنا زیادہ ماہرین کا انتخاب کر سکتا ہے۔ لہذا، ٹوکن ایک یا دو بڑے FFNs کے بجائے متعدد چھوٹے FFNs سے تعاون وصول کرتا ہے۔ یہ اس بات کی ضمانت نہیں دیتا ہے کہ ہر ماہر اپنی خاصیت سیکھ لے گا، لیکن یہ انہیں کام کرنے کے لیے اجزاء کے مزید تفصیلی سیٹ کو تربیت دینے کی اجازت دیتا ہے۔
DeepSeekMoE نے دوسرا خیال شامل کیا۔ ماہرین کا اشتراک کریں. روٹڈ ماہرین صرف ان ٹوکنز پر کارروائی کرتے ہیں جو انہیں منتخب کرتے ہیں، جبکہ مشترکہ ماہرین تمام ٹوکنز پر کارروائی کرتے ہیں۔
مشترکہ ماہرین کو مشترکہ لائبریری کوڈ سمجھیں۔ اگر متعدد تعینات ماہرین کو ایک ہی عام تبدیلی کی ضرورت ہے، تو ان میں سے ہر ایک اپنی کاپی سیکھنے سے پیرامیٹرز ضائع ہو جائیں گے۔ مشترکہ ماہرین ایک بار دوبارہ قابل استعمال آپریشنز سیکھ سکتے ہیں اور ہر ٹوکن میں ان کا حصہ ڈال سکتے ہیں، جس سے روٹ کیے گئے ماہرین کو صورتحال کے لحاظ سے دیگر تبدیلیوں کے لیے مزید گنجائش مل جاتی ہے۔
ڈیپ سیک اس کیپچر کو کہتے ہیں۔ عقل. ڈیزائنرز گرائمر یا پروگرامنگ جیسی مہارتیں تفویض نہیں کرتے ہیں۔ تربیت اس بات کا تعین کرتی ہے کہ کون سے دوبارہ قابل استعمال کاموں کو سیکھنا ہے۔

شکل 2 (اوپر): DeepSeekMoE میں دو تبدیلیوں کی تصوراتی مثال۔ کئی بڑے روٹنگ FFNs کو چھوٹے روٹنگ FFNs سے بدلیں اور ہمیشہ مشترکہ FFNs شامل کریں۔ ڈبّے DeepSeek-V3 میں ماہرین کی لفظی تعداد کے بجائے مثالی مقاصد کے لیے ہیں۔ DeepSeek-V3 ہر ایم او ای پرت میں 1 مشترکہ ماہر اور 256 روٹ شدہ ماہرین کا استعمال کرتے ہوئے، فی ٹوکن 8 روٹڈ ماہرین کا انتخاب کرتا ہے۔
DeepSeek-V3 اس پیٹرن کو بڑھاتا ہے۔ زیادہ تر پرتیں ایک مشترکہ ماہر اور 256 روٹڈ ماہرین کا استعمال کرتی ہیں، ہر ٹوکن کے لیے 8 روٹڈ ماہرین کا انتخاب کیا جاتا ہے۔ زیادہ ماہرین زیادہ قابل استعمال صلاحیت پیدا کرتے ہیں، لیکن ماڈل کا جسمانی نفاذ بھی زیادہ مشکل ہو جاتا ہے۔
ہماری کہانی کے اگلے مرحلے کے لیے دو قیمتیں اہم ہیں۔
پہلی لاگت ظاہر ہوتی ہے۔ GPU کے اندر. ماہر کے ذریعہ سیکھے گئے وزن GPU کی ہائی بینڈوڈتھ میموری (HBM) میں ذخیرہ شدہ میٹرس ہیں۔ GPU کے لیے ماہر کو لاگو کرنے کے لیے، اسے پہلے ہارڈ ویئر سے اس میٹرکس کو پڑھنا چاہیے، جو ضرب کو انجام دیتا ہے۔
اگر بہت سے ٹوکن ایک ہی ماہر کا اشتراک کرتے ہیں، تو GPU ماہرین کے وزن کے ٹکڑوں کو ٹوکن کے بہت سے حسابات میں دوبارہ استعمال کر سکتا ہے۔ اگر ماہر تک صرف چند ٹوکن پہنچ جاتے ہیں، تو نسبتاً کم آپریشنز کے لیے وزنی ڈیٹا کی ایک بڑی مقدار کو منتقل کرنا ضروری ہے، اس لیے کمپیوٹ یونٹ ان بائٹس کے انتظار میں کافی وقت گزار سکتا ہے۔
رکاوٹ یہ نہیں ہے کہ GPU نمبروں کو کتنی تیزی سے ضرب دے سکتا ہے، بلکہ یہ ہے کہ کمپیوٹنگ ڈیوائس پر وزن کتنی تیزی سے پہنچایا جا سکتا ہے۔ وہ ترسیل کی شرح میموری بینڈوڈتھکم تاخیر والی MoE سروس ڈیلیوری کی رفتار کا تعین کریں۔
دوسری لاگت ظاہر ہوتی ہے۔ GPUs کے درمیان. سیکڑوں ماہرین والے ماڈلز میں عام طور پر تمام GPUs کے تمام ماہرین نہیں ہو سکتے، اس لیے ماہر پول کو ماہر پولز میں تقسیم کیا جاتا ہے۔
آئیے فرض کریں کہ ٹوکنز کو 7,168 نمبروں کے ویکٹر کے طور پر دکھایا گیا ہے، جیسا کہ DeepSeek-V3 میں ہے۔ جب راؤٹر مختلف GPUs پر محفوظ ماہرین کو منتخب کرتا ہے، تو سسٹم 7,168 نمبروں کا پورا ویکٹر ہر منتخب ماہر کے GPU کو بھیجتا ہے۔ ہر ماہر ایک ہی لمبائی کا ایک مختلف ویکٹر لوٹاتا ہے، اور ان کے نتائج کو یکجا کیا جاتا ہے۔ ہم ان ٹوکن ویکٹر ایکسچینج کو بہت سے GPUs کے درمیان کہتے ہیں۔ جامع مواصلات.
اس سے پتہ چلتا ہے کہ سیگمنٹیشن کیا حل کرتی ہے اور کیا نہیں۔ اندرونی تہوں کو تنگ کرنا ہر فرد کے ماہر کو چھوٹا بناتا ہے، لیکن ڈیپ سیک متناسب طور پر زیادہ ماہرین کو متحرک کرتا ہے، جس سے ماہرین کی مجموعی گنتی کو عملی طور پر کوئی تبدیلی نہیں ہوتی۔
ہر منتخب ماہر کو بھیجا گیا ٹوکن ویکٹر بھی اسی لمبائی کو برقرار رکھتا ہے۔ لہذا، زیادہ ماہرین کو منتخب کرنے کا مطلب یہ ہو سکتا ہے کہ GPUs کے درمیان مزید مکمل کاپیاں بھیجیں، حالانکہ ہر ماہر کا اندرونی سائز چھوٹا ہوتا ہے۔ اسے توڑنا بلڈنگ بلاکس کا زیادہ لچکدار سیٹ بناتا ہے۔ آنے والے اور جانے والے راستوں کو کمپریس نہیں کرتا ہے۔
یہ امتیاز LatentMoE کو متحرک کرتا ہے۔ جب ماڈل ٹوکن ویکٹر کو کمپریس کرتا ہے تو کیا ہوتا ہے؟ پہلے اسے بھیجے گئے ماہر کے پاس بھیجیں، اس چھوٹی جگہ پر خصوصی کام کریں، اور نتائج آنے کے بعد ہی دوبارہ پیمانے کریں؟
3. LatentMoE: ماہر راستہ کمپریشن
LatentMoE کو NVIDIA ریسرچ ٹیم نے متعارف کرایا اور Nemotron 3 ماڈل فیملی میں اپنایا۔ Kimi K3 نے بنیادی فن تعمیر کی ایجاد نہیں کی۔ بلکہ، ہم LatentMoE کو اپناتے ہیں اور اگلے حصے میں بیان کردہ استحکام کی تبدیلیاں شامل کرتے ہیں۔
مرکز کو منتقل کرنا آسان ہے۔ روٹ شدہ ماہر کو ٹوکن بھیجے جانے سے پہلے، LatentMoE پوری نمائندگی کو چھوٹے سائز میں پیش کرتا ہے۔ اویکت جگہ. بھیجے گئے ماہرین مکمل طور پر اس چھوٹی سی جگہ میں کام کرتے ہیں۔ وہ آؤٹ پٹ وہاں سے اکٹھے کیے جاتے ہیں اور بعد میں ماڈل کی پوری چوڑائی پر دوبارہ پیش کیے جاتے ہیں۔ یہاں، اویکت اس سے مراد بھیجے گئے ماہرین کی کمپریسڈ ورک اسپیس ہے۔
روٹر اب بھی اصل مکمل چوڑائی والے ٹوکن کی نمائندگی کی جانچ کرتا ہے۔ مشترکہ ماہرین کو بھی پوری طاقت سے رکھا جاتا ہے۔ روٹڈ ماہرین کے ذریعے صرف راستے ہی کمپریسڈ ہیں۔

شکل 3 (اوپر): LatentMoE صرف روٹ شدہ راستوں کو کمپریس کرتا ہے۔ Kimi K3 میں، ایک مشترکہ نیچے کی طرف پروجیکشن منتخب ماہر تک پہنچنے سے پہلے روٹ شدہ نمائندگی کو 7,168 جہتوں سے 3,584 جہتوں میں تبدیل کر دیتا ہے۔ ایک بار وزنی آؤٹ پٹس کو جوڑ کر معمول پر لانے کے بعد، ایک مشترکہ اپ پروجیکشن 7,168 جہتوں کو بحال کرتا ہے۔ راؤٹر اور دو مشترکہ ماہرین اصل 7,168 جہتی نمائندگی کو استعمال کرتے رہتے ہیں۔
یہ چھوٹا روٹنگ انٹرفیس ایک ساتھ دو اخراجات بچاتا ہے۔ سب سے پہلے، ہر روٹ شدہ ماہر کے ان پٹ اور آؤٹ پٹ میٹرکس 7,168 کے بجائے 3,584 ڈائمینشنز سے منسلک ہوتے ہیں، اس لیے ان میں کم وزن ہوتا ہے اور اسے چلانے کے دوران ماہر کے ذریعہ کم وزن والے ڈیٹا کو پڑھنے کی ضرورت ہوتی ہے۔
دوسرا، جب ماہرین کو GPUs میں تقسیم کیا جاتا ہے، تو نظام اصل 7,168-جہتی ویکٹر کی بجائے ہر منتخب ماہر کو ایک 3,584 جہتی ویکٹر بھیجتا ہے۔ منتخب ماہرین اسی چھوٹی لمبائی کے ویکٹر واپس کرتے ہیں، اور نتائج کو یکجا کر کے 7,168 جہتوں میں پیش کیا جاتا ہے۔ لہذا، K3 کے نصف چوڑائی کے ڈیزائن میں، ہر روٹ شدہ پیغام کی قدر آدھی ہوتی ہے۔
LatentMoE ان بچتوں کو دو طریقوں سے استعمال کر سکتا ہے: یعنی، یا تو فعال ماہرین کی ایک ہی تعداد کو برقرار رکھیں اور تخمینہ لاگت کو کم کریں، یا اصل چوڑائی کی طرح وزن کی تبدیلی اور انٹر-GPU مواصلات میں اضافہ کیے بغیر دستیاب ماہرین اور فی ٹوکن منتخب کردہ نمبر دونوں میں اضافہ کریں۔
یہ ڈیپ سیک کی فائن ٹیوننگ سے مختلف ہے، جو ہر FFN کے درمیان کو تنگ کرتا ہے لیکن داخلی اور باہر نکلنے کو بغیر کسی تبدیلی کے چھوڑ دیتا ہے۔ دونوں خیالات مطابقت رکھتے ہیں کیونکہ ان کے سائز مختلف ہیں۔
کمپریشن کی اب بھی حدود ہیں۔ اگر اویکت نمائندگی بہت مختصر ہو جاتی ہے، تو نیچے کی طرف پروجیکشن ماہر کی طرف سے درکار معلومات کو چھوڑ سکتا ہے، اس کے اپنے حسابات کو مشترکہ نیچے اور اوپر کی طرف پیش گوئیوں میں شامل کرتا ہے۔
لہذا اویکت چوڑائی کو کم کرنے کے لئے نمبر نہیں ہے، لیکن توازن کے لئے کچھ ہے. Kimi K3 3,584 طول و عرض میں آباد ہے، جو کہ 7,168 جہتی ماڈل کی نصف چوڑائی ہے۔ یہ ماہر پول کو ڈرامائی طور پر وسعت دینے کے لیے روٹ شدہ راستے کافی سستا بناتا ہے، جو اگلی پریشانی کا باعث بنتا ہے۔ یہ تربیت کے دوران بہت سارے ماہرین کو مستحکم رکھنے کے بارے میں ہے۔
4. Kimi K3 کیسے LatentMoE کو مستحکم بناتا ہے۔
Kimi K3 میں ریڑھ کی ہڈی کی 93 تہیں ہیں۔ پہلے گھنے FFN کا استعمال کرتے ہیں اور باقی 92 FFN استعمال کرتے ہیں۔ مستحکم ممکنہ MoE. 92 پرتوں میں سے ہر ایک کا اپنا راؤٹر اور 896 روٹنگ ماہرین کا ایک پول ہے۔ لہذا، جملہ "896 میں سے 16” تمام MoE تہوں پر الگ الگ روٹنگ کے فیصلوں کو بیان کرتا ہے بجائے کہ پورے ماڈل میں مشترکہ عالمی پول۔
ان پرتوں میں سے ایک پر پہنچنے والے ٹوکنز کے لیے:
-
روٹر تمام 896 روٹڈ ماہرین کو اسکور کرتا ہے اور 16 کو منتخب کرتا ہے۔
-
دو مکمل حصہ دار ماہرین اس انتخاب سے قطع نظر ٹوکنز کو سنبھالیں گے۔
-
روٹڈ پاتھ ٹوکن کو ڈائمینشن 7,168 سے ڈائمینشن 3,584 تک پیش کرتا ہے۔
-
منتخب کردہ 16 ممکنہ ماہرین چھوٹی نمائندگیوں کو سنبھالتے ہیں۔
-
وزنی آؤٹ پٹس کو ملایا جاتا ہے، معمول بنایا جاتا ہے، اور پوری چوڑائی پر واپس پیش کیا جاتا ہے۔
-
روٹ شدہ اور مشترکہ نتائج ایک ساتھ شامل کیے جاتے ہیں۔
یہ انتظام K3 کو ماڈل میں 2.8 ٹریلین پیرامیٹرز رکھنے میں مدد کرتا ہے جبکہ ایک ٹوکن کے لیے تقریباً 104 بلین پیرامیٹرز کو چالو کرتا ہے۔
لیکن پیمانہ تین تربیتی مسائل کو بھی بڑھاتا ہے۔ مستحکم LatentMoE ہر ایک کے لیے ایک ہدف میکانزم کا اضافہ کرتا ہے۔

شکل 4 (اوپر): مستحکم LatentMoE تین الگ الگ مسائل کو حل کرتا ہے۔ RMSNorm روٹ شدہ شاخوں کے پیمانے کو مستحکم کرتا ہے، SiTU-GLU غیر معمولی طور پر بڑی سرگرمیاں محدود کرتا ہے، اور Quantile Balances منتخب ماہرین کے تعاون کے وزن کو تبدیل کیے بغیر یکساں عالمی بوجھ کی طرف انتخاب کا تعصب طے کرتا ہے۔
مسئلہ 1: ماہرین کے مشترکہ نتائج کا پیمانہ مختلف ہو سکتا ہے۔
مختلف ٹوکن مختلف روٹنگ وزن کے ساتھ ماہرین کے مختلف مجموعوں کا انتخاب کرتے ہیں، لہذا مشترکہ روٹنگ کی نمائندگی کا مجموعی سائز اوپر کی طرف پروجیکشن تک پہنچنے سے پہلے مختلف ہو سکتا ہے۔
K3 داخل کریں۔ RMS معیاری 3,584 ویں جہت سے 7,168 ویں جہت میں پیش کیے جانے سے پہلے منتخب ماہر نتائج کو یکجا کیا جاتا ہے۔ RMSNorm ماہرین کو ایک جیسا نہیں بناتا یا ان کے حسابات کو مٹاتا ہے۔ ہم مشترکہ نتائج کو دوبارہ اسکیل کرتے ہیں تاکہ اوپر کی طرف پروجیکشن کو زیادہ مستقل فل اسکیل ان پٹ ملے۔
مسئلہ 2: ایکٹیویشن اسپائکس کے ساتھ دو بڑی اندرونی قدریں بڑھ سکتی ہیں۔
LatentMoE پہلے 7,168 ڈائمینشنز سے 3,584 ڈائمینشنز تک ٹوکن کو کمپریس کرنے کے لیے مشترکہ پروجیکشن کا استعمال کرتا ہے۔ ہر منتخب ماہر کے اندر، دو غیرجانبدار سیکھے ہوئے لکیری تخمینے 3,072 جہتی پیشگی سرگرمیاں پیدا کرتے ہیں۔ g (گیٹ) اور v (قدر) SiTU-GLU گیٹ استعمال کرتا ہے۔ 4 tanh(g/4) sigmoid(g) اور قدر ہے۔ 25 tanh(v/25)پھر ہم اسے عنصر کے حساب سے ضرب دیتے ہیں۔ 3,072 جہتی پروڈکٹ کو تیسرے غیرجانبدار لکیری پروجیکشن سے گزارا جاتا ہے، جو جمع کرنے کے لیے 3,584 جہتی ماہر نتیجہ دیتا ہے۔
یہ تینوں تخمینے، غیر خطی تبدیلیاں، اور ضربیں مل کر ایک گیٹ ماہر FFN بنتی ہیں۔

شکل 5 (اوپر): نارنجی تخمینے مشترکہ LatentMoE ریپر سے تعلق رکھتے ہیں اور نیلے رنگ کے تخمینے ایک منتخب ماہر کے ہیں۔ ماہر ایک عارضی 3,072 جہتی ورک اسپیس میں گیٹ کیلکولیشن کرتا ہے اور 3,584 جہتی نتیجہ لوٹاتا ہے، جو کہ ماہر کی جمع کے لیے درکار عام شکل ہے۔
سگنل بالکل گیٹ برانچ یا ویلیو برانچ کے ساتھ ساتھ گزرتا ہے۔ چار سیکھے گئے میٹرکس ضرب: مشترکہ LatentMoE نیچے کی طرف پروجیکشن، اس پوائنٹ کے لیے ماہر ان پٹ پروجیکشن، ماہر آؤٹ پٹ پروجیکشن، اور مشترکہ LatentMoE اوپر کی طرف پروجیکشن۔
K3 پیپر اسے "تقریباً چار لگاتار میٹرکس ضرب” کہتا ہے کیونکہ کمپیوٹیشن ایک بلاتعطل لکیری سلسلہ نہیں ہے۔ گیٹ اور ویلیو کی پیشین گوئیاں متوازی طور پر چلائی جاتی ہیں اور SiTU اور عنصر کے حساب سے ضرب کے ذریعے پوری کی جاتی ہیں، پھر منتخب ماہر نتائج کو حتمی پیشین گوئی سے پہلے اکٹھا اور نارمل کیا جاتا ہے۔ لہذا، چار میٹرکس آپریشنز کو ایک میٹرکس ضرب تک کم نہیں کیا جا سکتا۔
K3 مصنفین نے جوڑے ہوئے ڈھانچے کو خراب حالت کے طور پر بیان کیا ہے اور ماڈل پیمانے پر دھماکہ خیز اندرونی ایکٹیویشن کی اطلاع دی ہے۔ کم درستگی پر، بڑے آؤٹ لیرز عام قدر کی درستگی کو قربان کرنے کے لیے مشترکہ کوانٹائزیشن کی پیمائش کو زیادہ بہاؤ یا مجبور کر سکتے ہیں۔
اندرونی ضرب سوئگ ایل یو یہ لامحدود ترقی کے ذرائع میں سے ایک ہے۔ ویلیو برانچنگ امیدوار کی قدریں پیدا کرتی ہے، جبکہ گیٹ برانچنگ اس شدت کو منظم کرنے کے لیے سوئش کا استعمال کرتی ہے جس کے ساتھ ہر قدر گزرتی ہے۔ سوئش گیٹ کے اندر لکیری عناصر اور قدر کی شاخیں دونوں بغیر کسی حد کے بڑھ سکتے ہیں، اس لیے دو بڑے عناصر ایک بہت بڑی پیداوار پیدا کر سکتے ہیں۔
لہذا، K3 SwiGLU کی جگہ لے لیتا ہے: SiTU-GLU (Sigmoid Tan Unit GLU)۔ SiTU آہستہ سے گیٹ کے لکیری عنصر کو سائز 4 پر محدود کرتا ہے اور سائز 25 پر قدر کے فرق کو محدود کرتا ہے، جبکہ ایک سگمائڈ گیٹ کو برقرار رکھتے ہوئے اور SwiGLU کو صفر سے قریب سے ملاتا ہے۔ ان کے عنصر کے مطابق پروڈکٹ اس کے نتیجے میں سائز میں محدود ہے۔ 4 x 25 = 100 ماہر پیداوار کی پیشن گوئی سے پہلے. اس کے بعد کی پیشین گوئیاں اب بھی پیمانے کو تبدیل کر سکتی ہیں، لیکن ماہر کے اندر ضرب اب لامحدود نہیں ہے۔

شکل 6 (اوپر): ایک مثال ایک جہتی ٹکڑا جہاں دونوں برانچ ان پٹ ایک ہی اسکیلر x کے برابر ہیں۔ SiTU-GLU ابتدا کے قریب SwiGLU کی پیروی کرتا ہے لیکن اپنی سائز کی حد 100 تک پہنچ جاتا ہے، جبکہ SwiGLU مسلسل بڑھتا جا رہا ہے۔ حقیقی ماہر میں، ہم الگ الگ سیکھے گئے تخمینوں کے ذریعے دو برانچ ویکٹر تیار کرتے ہیں اور انہیں عنصر کے لحاظ سے جوڑتے ہیں۔
مسئلہ 3: روٹنگ ناہموار ہو سکتی ہے۔
راؤٹر تمام ماہرین کو ہر ٹوکن کے لیے ایک تعلق اسکور تفویض کرتا ہے اور پھر سب سے زیادہ اسکور والے 16 ماہرین کا انتخاب کرتا ہے۔ چونکہ راؤٹرز تربیت یافتہ ہیں، کچھ ماہرین دوسروں کے مقابلے میں نمایاں طور پر زیادہ ٹوکن حاصل کر سکتے ہیں۔ یہ ماہرین ہارڈ ویئر کی رکاوٹ بن جاتے ہیں، جب کہ کبھی کبھار منتخب کیے گئے ماہرین کی تربیت اتنی کم ہوتی ہے کہ وہ بیکار ہو جاتے ہیں۔
ایک عام ردعمل ماڈل کے تربیتی مقصد میں توازن کے نقصان کو شامل کرنا ہے، لیکن یہ ماہر کے استعمال کے مقابلے میں اصلاح کار کی تجارتی پیشین گوئیوں کے معیار کو بہتر بناتا ہے۔
DeepSeek-V3 نے اس کے بجائے پہلے سے طے شدہ عالمی توازن کا طریقہ بنایا۔ ثانوی نقصان کے بغیر. یہ ہر ماہر کے لیے علیحدہ انتخاب کا تعصب برقرار رکھتا ہے۔ تربیت کے مرحلے کے بعد، زیر استعمال ماہرین کا تعصب ایک مقررہ مقدار سے بڑھ جاتا ہے، جب کہ زیادہ بوجھ والے ماہرین کا تعصب اس مقدار سے کم ہو جاتا ہے۔
یہ طریقہ کام کرتا ہے، لیکن آپ کو اپ ڈیٹ کا سائز احتیاط سے منتخب کرنا چاہیے۔ اگر یہ بہت چھوٹا ہے، تو یہ آہستہ سے رد عمل ظاہر کرے گا، اور اگر یہ بہت بڑا ہے، تو بوجھ دوہر سکتا ہے۔ (DeepSeek-V3 نے ترتیب کے اندر انتہائی عدم توازن کے خلاف حفاظت کے طور پر چھوٹے تسلسل کی سطح کے توازن کے نقصانات کو بھی برقرار رکھا۔)
K3 ماہر کے لیے مخصوص انتخاب کا تعصب برقرار رکھتا ہے لیکن طے شدہ ایڈجسٹمنٹ کو اس کے ساتھ بدل دیتا ہے: کوانٹائل بیلنسنگ. یہ جانچتا ہے کہ کس طرح ایک ماہر کے اسکور کو عالمی تربیتی مراحل میں تقسیم کیا جاتا ہے اور ہر ماہر کے لیے مختلف ایڈجسٹمنٹ کی گنتی کی جاتی ہے۔ یعنی، بڑی اصلاحات کا حساب لگائیں جب اسکور اس بات کی نشاندہی کرتا ہے کہ مزید چالوں کی ضرورت ہے، اور چھوٹی اصلاحات جب ماہر پہلے سے ہی ہدف کے بوجھ کے قریب ہو۔ کہتے ہیں مقدار اس سے توازن برقرار رہتا ہے کیونکہ تمام تعصبات کو ایک ہی پیش سیٹ رقم سے تبدیل کرنے کے بجائے، متعلقہ ماہر سکور مارجن کے ہدف پرسنٹائل پر اپ ڈیٹس کا انتخاب کیا جاتا ہے۔
تعصب بدل جاتا ہے۔ کون سے ماہرین کو منتخب کیا جاتا ہے؟یہ نہیں ہے کہ ان کی پیداوار کتنی مضبوطی سے تعاون کرتی ہے۔ K3 ماہرین کی درجہ بندی کرنے کے لیے متعصب اسکورز کا استعمال کرتا ہے، لیکن بغیر کسی تعصب کے منتخب ماہرین کے ان کے اصل اسکور سے شراکت کا وزن اخذ کرتا ہے۔ نئے حسابی تعصب کو اگلے تربیتی مرحلے میں لاگو کیا جاتا ہے، اور حتمی تعصب کو تخمینہ کے دوران طے کیا جاتا ہے۔
کوانٹائل بیلنسنگ کا مقصد ہر جملے یا ترتیب میں ماہرین کے یکساں استعمال کے بجائے عالمی تربیتی مراحل میں یکساں مجموعی بوجھ ہے۔ اس کا مقصد تنگ ہے۔ مقصد 896 ماہرین کے پول کے بہت چھوٹے حصے پر توجہ مرکوز کرنے سے بچنے کے لیے تربیت کے مواقع اور تقسیم شدہ حسابات کو برقرار رکھنا ہے۔
نیچے لائن: قلیل صلاحیت کو مفید بنانا
اعلی کثافت کنورٹرز ایک ہی FFN پر تمام ٹوکن بھیجتے ہیں۔ Mixtral نے ایک بنیادی MoE متبادل کا مظاہرہ کیا۔ اس کا مطلب ہے ایک سے زیادہ مکمل FFNs کو برقرار رکھنا اور ہر ٹوکن کو صرف چند پر روٹ کرنا۔ DeepSeekMoE نے پھر اس کام کو چھوٹے ماہرین میں تقسیم کیا اور مختلف حالات میں استعمال ہونے والی تبدیلیوں کے لیے مشترکہ ماہرین کو شامل کیا۔
LatentMoE ایک اور جہت کو تبدیل کرتا ہے۔ تمام منتخب ماہرین کو ماڈل کی مکمل ٹوکن نمائندگی بھیجنے کے بجائے، ہم روٹ شدہ انٹرفیس کو کمپریس کرتے ہیں، ایک چھوٹی جگہ میں ماہر کمپیوٹیشن کرتے ہیں، اور بعد میں اصل چوڑائی کو بحال کرتے ہیں۔ یہ ماہر کے وزنی ٹریفک روٹ اور GPUs کے درمیان ٹوکن ڈیٹا کی مقدار کو کم کرتا ہے۔
Kimi K3 اپنے ڈیزائن کو 896 روٹڈ ماہرین فی MoE ٹائر تک پہنچاتا ہے، ہر ٹوکن کے لیے 16 کا انتخاب کیا جاتا ہے۔ اس پیمانے پر، اکیلے کمپریشن کافی نہیں ہے. RMSNorm مشترکہ روٹنگ کے نتائج کے پیمانے کو کنٹرول کرتا ہے، SiTU-GLU ہر ماہر کے اندر ضرب کی سرگرمیوں کو محدود کرتا ہے، اور Quantile Balancing ماہر کے تعاون کے وزن میں توازن کا تعصب شامل کیے بغیر تربیتی اسائنمنٹس کو تقسیم کرتا ہے۔
اہم سبق صرف یہ نہیں ہے کہ MoE کم پیرامیٹرز کو قابل بناتا ہے۔ ویرل صلاحیت میں اضافہ نئی عددی، روٹنگ، اور کمیونیکیشن کی رکاوٹوں کو متعارف کراتا ہے جنہیں فن تعمیر کو مل کر حل کرنا چاہیے۔ مستحکم LatentMoE ماڈل کی سطح پر K3 کا جواب ہے۔
توسیعی پڑھنا: Kimi K3 کی ترتیب میموری کے پہلوؤں پر مزید تفصیلی نظر کے لیے، دیکھیں: GPT-2 سے Kimi K3 تک: زبان کے ماڈل میموری کا انتظام کیسے سیکھتے ہیں۔.
حوالہ جات
-
جیانگ وغیرہ۔ (2024)۔ ماہر مکسٹرل۔ arXiv:2401.04088
-
ڈائی وغیرہ۔ (2024)۔ DeepSeekMoE: ماہر مخلوط زبان کے ماڈلز کی حتمی ماہر تخصص کی طرف۔ arXiv:2401.06066
-
DeepSeek-AI et al. (2024)۔ DeepSeek-V3 تکنیکی رپورٹ۔ arXiv:2412.19437
-
Elango et al. (2026)۔ LatentMoE: ماہر مرکبات میں فی FLOP اور پیرامیٹرز کی زیادہ سے زیادہ درستگی کی طرف۔ arXiv:2601.18089
-
ٹیم کیمی (2026)۔ Kimi K3: اوپن فرنٹیئر انٹیلی جنس۔ arXiv:2607.24653
-
وانگ وغیرہ۔ (2024)۔ ماہر اختلاط کے لیے ایک معاون لازوال لوڈ بیلنسنگ حکمت عملی۔ arXiv:2408.15664