Meta مقامی AI ایجنٹس کے لیے Apache 2.0 لائسنس کے تحت Muse Glimmer جاری کرتا ہے جو صارف GPUs پر چل سکتا ہے۔
کمپنی کی سپر انٹیلی جنس لیبز نے ہیگنگ فیس میں اپنے 30 بلین پیرامیٹر ماڈل کے وزن کا انکشاف کیا ہے۔ میٹا کا کہنا ہے کہ ڈویلپرز اسے مقامی کوڈنگ، فنکشن کالز، مقامی ایجنٹوں، اور ایل ایل ایم جج کی تشخیص کے لیے استعمال کر سکتے ہیں۔
یہ ریلیز AI ٹیموں کو درپیش آپریشنل رکاوٹوں کو نشانہ بناتی ہے۔ اس کا مطلب ہے کہ کلاؤڈ ہوسٹنگ ماڈل کو نیٹ ورک تک رسائی اور مرکزی انفراسٹرکچر کی ضرورت ہوتی ہے۔ اس کے بجائے، Meta Muse Glimmer کو کام کے بوجھ کے لیے متعارف کراتا ہے جس کے لیے ایک آن ڈیوائس ماڈل کی ضرورت ہوتی ہے، بشمول کیلنڈرز، پیغامات، فائلوں اور دیگر ذاتی سیاق و سباق تک رسائی والا ذاتی ایجنٹ۔
Meta Muse Glimmer ایک سے زیادہ ایجنٹوں کے کام کے بوجھ کے بینچ مارکس کی قیادت کرتا ہے۔
میٹا کے بینچ مارک ٹیسٹوں میں، Muse Glimmer Gemma4-31B اور Qwen3.6-27B سے آٹھ میں سے پانچ عام ایجنٹ بینچ مارکس میں آگے تھا۔ اس ماڈل نے MCP Atlas پر 75.5 کا اسکور حاصل کیا۔ Gemma4-31B نے 54.2 ریکارڈ کیا، اور Qwen3.6-27B نے 62.5 ریکارڈ کیا۔
ڈیپ سرچ QA اسی طرح کے پیٹرن کی پیروی کرتا ہے۔ Meta Muse Glimmer کے لیے 74.6، Gemma4-31B کے لیے 61.7، اور Qwen3.6-27B کے لیے 71.1 کے اسکور کی اطلاع دیتا ہے۔ پیش کردہ پریزنٹیشن دونوں بینچ مارکس کی شناخت ایجنٹ کی سہاروں کے اندر کام کرنے کی صلاحیت کے ٹیسٹ کے طور پر کرتی ہے اور متعدد بار کی درخواستوں کو مکمل کرتی ہے۔
اس ماڈل نے τ²-بینکنگ میں 23.5 کا اسکور حاصل کیا۔ Gemma4-31B نے 15.1 اسکور کیا۔ Qwen3.6-27B 16.7 تک پہنچ گیا۔
Muse Glimmer نے WildClawBench پر بھی Gemma4-31B کے 37.6 اور Qwen3.6-27B کے 43.2 سے آگے 47.6 اسکور کیا۔ GAIA2 کے نتائج بالترتیب 36.4 اور 40.0 کے مقابلے 43.3 تک پہنچ گئے۔
دیگر ایجنٹ کے اسکور Qwen3.6-27B کے حق میں ہیں۔ میٹا کا ٹیبل GDPval-AA میں ماڈلز کو 1,141 دیتا ہے، جبکہ Muse Glimmer میں 953 اور Gemma4-31B میں 811 کے مقابلے۔ Qwen3.6-27B نے 46.6 پر سکلز کے ساتھ SkillsBench کی قیادت کی، جبکہ Muse Glimmer نے 44.3 اسکور کیا۔
OSWorld-Verified کے پاس اس گروپ میں سب سے بڑا خلا تھا۔ میٹا Qwen3.6-27B کے لیے 75.6 رپورٹ کرتا ہے۔ Muse Glimmer نے 65.9 پوائنٹس اور Gemma4-31B نے 58.5 پوائنٹس اسکور کئے۔
یہ ٹیسٹ محدود کاموں کی پیمائش کرتا ہے۔ یہ نہیں دکھاتا ہے کہ مقامی ایجنٹ کس طرح کام کرتا ہے جب کسی تنظیم نے اسے اپنی فائلوں، کیلنڈر، پیغام رسانی کے نظام، یا اندرونی ٹولز سے جوڑ دیا ہے۔
Muse Glimmer اور Qwen کے درمیان تقسیم کوڈنگ کے نتائج
Muse Glimmer کے کوڈنگ کے نتائج ایک تنگ موازنہ کو ظاہر کرتے ہیں۔ ماڈل SWE-Bench Pro میں 51.2 کے اسکور کے ساتھ پہلے نمبر پر ہے۔ میٹا Gemma4-31B کے لیے 36.9 اور Qwen3.6-27B کے لیے 50.2 رپورٹ کرتا ہے۔
SciCode کے قریبی نتائج ملے۔ Muse Glimmer نے 43.6 پوائنٹس اسکور کیے، جو Gemma4-31B (43.4 پوائنٹس) سے تھوڑا زیادہ ہے۔ Qwen3.6-27B نے 39.8 اسکور کیا۔
Qwen3.6-27B نے کوڈنگ کے دو مختلف جائزوں کی قیادت کی۔ اس نے Muse Glimmer کے 76.0 کے مقابلے SWE-Bench Verified پر 77.2 اسکور کیا۔ TerminalBench 2.1 نے Qwen3.6-27B کو 60.7 کا سکور دیا۔ Muse Glimmer نے 51.7 اور Gemma4-31B نے 43.4 سکور کیا۔
مقامی کوڈنگ ایجنٹ صرف کوڈ بنانے سے زیادہ کام کرتے ہیں۔ آپ کو ایک اسکافولڈ کی ضرورت ہے جو اس بات کا تعین کرے کہ کون سے ذخیرے، ٹرمینلز، ٹیسٹ کے ماحول، اور آپ کا ماڈل کس کمانڈ تک رسائی حاصل کر سکتا ہے۔ Meta کا کہنا ہے کہ Muse Glimmer OpenClaw اور دیگر ایجنٹ آرکیسٹریشن پیٹرن کی حمایت کرتا ہے اور ڈویلپر کی دستاویزات میں شامل اپنی مرضی کے مطابق اسکافولڈ کا استعمال کرتا ہے۔
سافٹ ویئر آپریشنل ماڈلز کا جائزہ لینے والی تنظیموں کو ان کمانڈز اور ریپوزٹریز کی وضاحت کرنی چاہیے جنہیں ایجنٹ آپریشنل کامیابی کی پیمائش کرنے سے پہلے استعمال کر سکتے ہیں۔ فراہم کردہ مواد ناکام ٹول کالز کے لیے دوبارہ کوشش کی تربیت کی وضاحت کرتا ہے۔ اس رویے کے لیے بار بار کوششوں پر کنٹرول کی ضرورت ہوتی ہے، خاص طور پر جب ٹول سورس کوڈ کو تبدیل کر سکتا ہے یا بیرونی سسٹمز کو کال کر سکتا ہے۔
ملٹی موڈل اسکور زیادہ تر ٹیسٹوں کے لیے کیوین کے حق میں ہیں۔
Muse Glimmer ایک وقف شدہ شناختی انکوڈر کے ذریعے انٹرلیوڈ ٹیکسٹ اور تصاویر کو قبول کرتا ہے۔ میٹا کا کہنا ہے کہ یہ ڈیزائن ایجنٹوں کو گفتگو کے حصے کے طور پر اسکرین شاٹس، چارٹس اور دستاویزات کی تشریح کرنے کی اجازت دیتا ہے۔
بینچ مارک چارٹس پر، Muse Glimmer Charxiv Reasoning سے آگے ہے۔ اسکور 78.8 پوائنٹس تھا، Gemma4-31B نے 77.7 پوائنٹس اور Qwen3.6-27B نے 78.4 پوائنٹس اسکور کیے۔
Qwen3.6-27B لیڈ ScreenSpot Pro 76.1 کے ساتھ۔ Muse Glimmer نے 75.4 پوائنٹس اور Gemma4-31B نے 75.9 پوائنٹس اسکور کیے۔ اسی ماڈل نے Muse Glimmer کے 75.8 اور Gemma4-31B کے 72.5 کے مقابلے میں 77.8 کے ساتھ OmniDocBench v1.5 کی قیادت کی۔
MMMU پرو میں فرق کم تھا۔ Meta Muse Glimmer کو 74 کے طور پر درج کرتا ہے۔ Qwen3.6-27B 75 تک پہنچ گیا اور Gemma4-31B 73 تک پہنچ گیا۔
یہ نتائج بصری انٹرفیس میں کام کرنے والے ایجنٹوں پر غور کرنے والی ٹیموں کے لیے اہم ہیں۔ اسکرین شاٹ ریڈنگ ماڈل اس کی تشریح کر سکتا ہے جو وہ دیکھتا ہے، لیکن مقامی ٹیسٹنگ کو ابھی بھی اجازت، ڈسپلے لے آؤٹ، دستاویز کی شکل، اور متعلقہ ٹولز کے ذریعے واپس آنے والی غلطیوں کو دور کرنے کی ضرورت ہے۔
حفاظتی اعداد و شمار Qwen کے مقابلے میں کم حملے کی کامیابی کی شرح کو ظاہر کرتے ہیں۔
میٹا حفاظت سے متعلق دو جائزوں کی بھی اطلاع دیتا ہے: CI Memories اور Siren AgentDojo۔ چارٹس ہر ٹیسٹ کے لیے مختلف پیمائشیں استعمال کرتے ہیں۔
CI میموریز میں، Meta نے Muse Glimmer کی خلاف ورزی کی شرح 26.4 اور کوریج سکور 64.8 درج کی ہے۔ Gemma4-31B کی خلاف ورزی کی شرح 12.1 تھی جس کی کوریج 53.0 تھی۔ Qwen3.6-27B نے 53.4 کی خلاف ورزی کی شرح اور 66.9 کی کوریج ریکارڈ کی۔
سائرن ایجنٹ ڈوجو کے نتائج حملے کی کامیابی کی شرح اور افادیت کا استعمال کرتے ہیں۔ Meta Muse Glimmer کو حملے کی کامیابی کی شرح 28.4 اور یوٹیلیٹی سکور 94.2 دیتا ہے۔ Gemma4-31B نے حملے کی کامیابی کی شرح 25.6 پوائنٹس اور 90.8 پوائنٹس کی قابل استعمال درجہ بندی ریکارڈ کی۔ Qwen3.6-27B نے 40.3 اور 92.7 اسکور کیا۔
عمومی تخمینہ کے نتائج مشیر کے دعووں میں سیاق و سباق کو شامل کرتے ہیں۔
Muse Glimmer نے Meta موازنہ میں چھ میں سے چار عمومی قابلیت اور استدلال کے ٹیسٹ کی قیادت کی۔ اس نے IFBench پر 77.0 اسکور کیا۔ Gemma4-31B نے 76.0 ریکارڈ کیا، اور Qwen3.6-27B نے 70.8 ریکارڈ کیا۔
Muse Glimmer کا AIME 2026 کا سکور 94.7 تھا۔ میٹا Gemma4-31B کے لیے 89.2 اور Qwen3.6-27B کے لیے 94.1 رپورٹ کرتا ہے۔ AA-LCR پر، Muse Glimmer 68.3 اور 73.3 سے آگے 80.0 تک پہنچ گیا۔
اس ماڈل نے 65.1 کے ساتھ بیم 128K کو بھی پیچھے چھوڑ دیا۔ Qwen3.6-27B نے 63.0 پوائنٹس حاصل کیے۔ Gemma4-31B نے 58.2 اسکور کیا۔
Gemma4-31B لیڈ GPQA ڈائمنڈ 85.7 کے ساتھ۔ Muse Glimmer نے 83.5 پوائنٹس اسکور کیے، اس کے بعد Qwen3.6-27B نے 84.2 پوائنٹس کے ساتھ۔ Gemma4-31B نے 23.6 پوائنٹس کے ساتھ ہیومینٹی کے فائنل ٹیسٹ، ٹیکسٹ نمبر ٹولز میں سب سے زیادہ اسکور بھی حاصل کیا۔ Muse Glimmer 22.0 تک پہنچ گیا ہے۔
کوئی بھی ماڈل تمام ٹیسٹ نہیں کرے گا۔ اس کے بجائے، میٹا کے نتائج سے پتہ چلتا ہے کہ Muse Glimmer ایجنٹ، کوڈنگ، بصری، حفاظت، اور تخمینہ جات کے مخلوط سیٹ پر ایک جیسے سائز کے دو ماڈلز کے ساتھ قریبی مقابلہ کرتا ہے۔
میموری کی حدود آپ کے مقامی تعیناتی ڈیزائن کا تعین کرتی ہیں۔
میٹا کا کہنا ہے کہ مکمل صحت سے متعلق 30 بلین پیرامیٹر ماڈل کو 55 جی بی سے زیادہ میموری کی ضرورت ہوگی۔ اس کے بجائے، Muse Glimmer زبان کے ماڈل کو 20GB سے کم کرنے کے لیے تقریباً 4 بٹ وزن کی مقدار کا استعمال کرتا ہے۔
یہ مختص KV کیشے کے لیے میموری کو چھوڑ دیتا ہے۔ ماڈل کو ایک ادراک انکوڈر اور قیاس آرائی پر مبنی ضابطہ کشائی کے مسودے کے لیے بھی جگہ درکار ہے۔ میٹا ان اجزاء کے لیے 24GB یا 32GB میموری لفافے کو نشانہ بناتا ہے۔
کمپنی نے کہا کہ DFlash پر مبنی ڈرافٹرز ٹوکن کے بلاکس تجویز کرتے ہیں جن کی مرکزی ماڈل متوازی طور پر تصدیق کر سکتا ہے۔ میٹا کا کہنا ہے کہ اس سے جنریشن کی رفتار میں اضافہ ہوتا ہے اور معیاری ٹوکن مخصوص آؤٹ پٹ کے مقابلے میں اسی آؤٹ پٹ کوالٹی کو برقرار رکھا جاتا ہے۔ فراہم کردہ پوسٹ میں ٹوکن فی سیکنڈ فیگرز، پرامپٹ سائز، پاور ڈیٹا، یا کنکرنسی کے نتائج شامل نہیں ہیں۔
Meta نے MacBook M4-Max ہارڈ ویئر، MacBook M5-Max ہارڈویئر، اور RTX-5090 پر کوانٹائزڈ DFlash ڈرافٹ کا استعمال کرتے ہوئے K-Quant-17GB ورژن کا تجربہ کیا۔ یہ ایک نتیجہ خیز تجربہ کی وضاحت کرتا ہے جو سیال گفتگو اور ریئل ٹائم ایجنٹ کی بات چیت کے لیے موزوں ہے۔
عوامی وزن Hugging Face کے ذریعے فراہم کیا جاتا ہے۔ میٹا نے کہا کہ llama.cpp، MLX، اور ExecuTorch کے ساتھ انضمام جلد ہی جاری کیا جائے گا۔
حوالہ: علی بابا نے Qwen اوپن سورس AI کے لیے نئے کاروباری ماڈل کی جانچ کی۔
صنعت کے رہنماؤں سے AI اور بڑے ڈیٹا کے بارے میں مزید جاننا چاہتے ہیں؟ ایمسٹرڈیم، کیلیفورنیا اور لندن میں ہونے والے AI اور بگ ڈیٹا ایکسپو کو دیکھیں۔ یہ جامع ایونٹ TechEx کا حصہ ہے اور اس کا انعقاد سائبرسیکیوریٹی اور کلاؤڈ ایکسپو سمیت دیگر اہم ٹیکنالوجی ایونٹس کے ساتھ کیا جاتا ہے۔ مزید معلومات کے لیے یہاں کلک کریں۔
AI News آپ کے لیے TechForge Media لایا ہے۔ دیگر آنے والے انٹرپرائز ٹیکنالوجی ایونٹس اور ویبینرز کو یہاں دریافت کریں۔