ai-ml

مقاييس أداء Muse Code لعام 2026: أدوات الاختبار تغيرت أيضاً

٧ أغسطس ٢٠٢٦

Muse Code Benchmarks 2026: The Harness Changed Too

أطلقت Meta أداة Muse Code، وهي وكيل برمجة يعمل عبر الطرفية (terminal)، في 5 أغسطس 2026، واستقرت التغطيات الإعلامية على نتيجة واحدة من Terminal-Bench 2.1. لكن وثيقة المنهجية الخاصة بـ Meta تشير إلى أن جيلَي النماذج اللذين تمت مقارنتهما قد عَملا في بيئات تشغيل (harnesses) مختلفة — وأن النموذج الأحدث قد تم تدريبه على بيئة التشغيل التي تم قياسه فيها.

ملخص

أطلقت Meta Superintelligence Labs نسخة بيتا من Muse Code لأنظمة macOS وLinux في 5 أغسطس 2026، مدعومة بنموذج جديد هو Muse Spark 1.2.1 وتركزت اختبارات Muse Code التي تداولتها التغطيات الإعلامية على نتيجة واحدة في Terminal-Bench 2.1 بلغت 82.9%، والتي وُصفت بأنها تقع خلف Claude Opus 5 بفارق ضئيل وأمام الجيل السابق من Muse Spark.2

تحافظ منهجية التقييم الخاصة بـ Meta على ثبات متغير واحد وتسمح لآخر بالتغير. جهد الاستنتاج (Reasoning effort) ثابت عند xhigh لكلا الجيلين. أما بيئة التشغيل (harness) فليست كذلك: حيث تم قياس Muse Spark 1.2 داخل Muse Code، بينما تم قياس Muse Spark 1.1 داخل mini-swe-agent.3 وتذكر Meta أنها قامت بتدريب Muse Spark 1.2 بالتزامن مع Muse Code.1 وبالتالي، فإن الفارق المُبلغ عنه هو فارق في النظام، وليس فارقاً في النموذج.

ما هي قيمة بيئة التشغيل؟ في لوحة المتصدرين الرسمية والموثقة لـ Terminal-Bench، هناك أربعة أزواج تحافظ على ثبات النموذج، والجهد، والاختبار، والمُقيّم، وتغير فقط بيئة التشغيل. تتراوح الفوارق من -8.1 إلى +5.1 نقطة، بمتوسط قيمة مطلقة قدره 4.05.4 وهذا أكبر من المكسب الجيلي البالغ 2.9 نقطة الذي تشير إليه أرقام Meta المُبلغ عنها.25 لكن مجموع الفوارق الأربعة يساوي صفراً تماماً، وهو ما يتعارض بشدة مع الاستنتاج البديهي.

ما ستتعلمه

  • ما الذي قدمته Meta فعلياً في Muse Code، بكلمات Meta نفسها
  • من أين جاء رقم 82.9%، ولماذا لا يمكنك العثور عليه في صفحة Meta
  • أي متغير تحكمت فيه Meta بين الأجيال وأيها لم تتحكم فيه
  • قيمة تغيير بيئة التشغيل بالنقاط، مقاسة بناءً على صفوف لوحة المتصدرين الموثقة
  • لماذا تقوض هذه البيانات نفسها الاتهام الذي قد تتوقع أن يوجهه هذا المقال
  • الفجوة بين أرقام المورد والأرقام الموثقة لنموذج من Meta موثق بالفعل
  • ما الذي تحتويه حالياً لوحة Terminal-Bench 2.1 الرسمية وما الذي لا تحتويه
  • لماذا يتفق مُقيّمان اثنين بشكل أوثق بكثير مما تتفق بيئتا تشغيل
  • كيف تحول أسلوب ترويج Meta لنسخة 1.2 عن أسلوب ترويجها لنسخة 1.1
  • تكلفة Muse Code، وما الذي توفره الفئة الرخيصة فعلياً

ما الذي قدمته Meta

Muse Code هو وكيل برمجة للطرفية يتم تثبيته بأمر واحد على macOS أو Linux.1 هناك ثلاثة قرارات تصميمية تستحق التحديد بدقة، لأنها الأجزاء الجديدة حقاً وليست الأجزاء محل الخلاف.

وكلاء خلفية غير متزامنين ومستمرين. تكتب Meta أن وكلاء الخلفية المتخصصين لديها "يظلون نشطين طوال كل جلسة، بدلاً من أن يتم إنشاؤهم لمهام فردية"، وهو ما تقول إنه يتجنب جمع المعلومات المتكرر. وهم "ينفذون الخطوات التالية ويختارون متى يتواصلون مجدداً مع الوكيل الرئيسي".1 هذا يمثل تحولاً معمارياً حقيقياً عن نمط الوكيل الفرعي (إنشاء-استخدام-تخلص)، وقد جعلت Meta هذا التباين صريحاً بنفسها.

سجل أحداث محلي للإضافة فقط (append-only). يتم إلحاق كل استدعاء للنموذج، وتشغيل للأدوات، وموافقة، وتعديل بسجل واحد، وهو ما تقول Meta إنه يجعل وقت التشغيل "دقيقاً في إعادة التشغيل وآمناً عند البدء من جديد" — فبعد حدوث عطل، يستأنف العميل (agent) العمل بالضبط من حيث توقف.1 بالنسبة للأعمال التي تستغرق وقتاً طويلاً، تعد هذه ميزة تشغيلية هامة، كما أنها تنتج مسار تدقيق (audit trail) كأثر جانبي.

ثلاث مهارات مدمجة. تحول /plan المهمة إلى خطة تخضع للموافقة، وتقوم /grill باختبار هذه الخطة تحت الضغط حتى تصبح متماسكة، وتعمل /goal نحو تحقيق هدف محدد.1

نشرت Meta أيضاً دراسة حالة حول تشغيل تحسين متكرر لنواة GPU عبر أكثر من 1,000 استدعاء للأدوات ولمدة تصل إلى 24 ساعة، مقابل نويات KDA و MLA على وحدات GPU NVIDIA Hopper.1 لا يوجد خلاف على أي من ذلك هنا، بل الخلاف على صياغة المعيار المرجعي (benchmark).

من أين جاءت نسبة 82.9%

ليس من أي شيء قابل للقراءة آلياً. فمخططات التقييم في منشور الإطلاق الخاص بـ Meta هي صور، والنصوص البديلة (alt text) الخاصة بها تصف المخطط بدلاً من سرد القيم — "مخطط شريطي يقارن درجات Terminal-Bench 2.1 لنماذج Muse Spark 1.2 ونماذج البرمجة الأخرى."1 تتداول تغطيات الإطلاق رقم 82.9%؛ والمقال الذي تستشهد به هذه القطعة يذكر الرقم مع التصريح بوضوح بأنه لم يتمكن من قراءة مخططات Meta أيضاً.2 تعامل مع هذا الرقم على أنه "مُبلغ عنه" وليس "مؤكداً".

ما نشرته Meta نصياً هو وثيقة منهجية التقييم، وهي أكثر تفصيلاً بكثير من معظم مواد الإطلاق.3 تغطي عمليات تشغيل Terminal-Bench 2.1 الإصدار 2.1 الكامل المكون من 89 مهمة، وتم تقييمها بنظام pass@1 وبمتوسط خمس محاولات في بيئات معزولة (sandboxes) سحابية من Daytona؛ بينما يشمل DeepSWE v1.1 نحو 113 مهمة مستمدة من 91 مستودعاً بخمس لغات؛ وتم بناء Meta Internal Coding Bench من 440 مهمة مشتقة من طلبات سحب (pull requests) داخلية حقيقية.35 أما التقييمان الإضافيان، GDPVal-AA v2 و MCP Atlas، فقد تم تشغيلهما في بيئات الاختبار الخاصة بمزودي المعايير المرجعية، وهما، بكلمات Meta، "ليسا مقارنات لعملاء CLI".3

العامل المربك الذي لم تتحكم فيه Meta

تستحق وثيقة المنهجية القراءة الكاملة، لأنها تفعل شيئين متناقضين في جملتين متتاليتين (تم إضافة التأكيد):

بالنسبة لـ Terminal-Bench 2.1 و DeepSWE 1.1، يتم تقييم كل نموذج باستخدام منتج العميل (agent product) المختار له: Muse Code لـ Muse Spark 1.2، و mini-swe-agent لـ Muse Spark 1.1، و Grok Build لـ Grok، و Claude Code لـ Opus، و Codex لـ GPT، و Antigravity لـ Gemini، و Kimi Code لـ Kimi. نحن نستخدم أقصى قوة استدلال متاحة لكل نموذج: جهد استدلال xhigh لـ Muse Spark 1.2 و Muse Spark 1.1، و high لـ Grok و Gemini، و max لـ Opus و GPT و Kimi.3

يتم تثبيت جهد الاستدلال عبر الجيلين، لكن بيئة الاختبار (harness) ليست كذلك. هذا عامل مربك أقل حدة مما كان يمكن أن يكون، وتستحق Meta التقدير على النصف الذي تحكمت فيه — ولكن النصف الذي لم تتحكم فيه هو النصف المهم هنا، بسبب حقيقة ثالثة من منشور الإطلاق:

لقد قمنا بتدريب Muse Spark 1.2 بشكل مشترك مع Muse Code لضمان إظهار النموذج لأفضل أداء وقابلية استخدام في البرمجة عند اقترانهما معاً. شمل التدريب مسارات harness تم اختيارها عبر عينات الرفض وتحسينات الوصفات (recipe optimizations) للأهداف، والضغط (compaction)، والوكلاء الفرعيين (subagents)، إلى جانب دمج مجموعة أدوات Muse Code لزيادة توافق الـ harness إلى أقصى حد.1

اقرأ الجملة الأولى بعناية. هدف التصميم المعلن لشركة Meta هو تحقيق أفضل أداء عند اقترانهما معاً — لذا تم قياس الجيل الأحدث داخل harness تم تدريبه عليه، مقابل جيل أقدم تم قياسه داخل harness عام لم يتم التدريب عليه. هذه فرضية منتج منطقية، وMeta لا تخفي ذلك. لكن هذا يعني أن فارق الأجيال (generation delta) لا يمكن تفكيكه. لا يوجد شيء منشور يخبرك كم من هذا يعود لكون النموذج أفضل، وكم يعود لكون الـ harness أفضل، وكم يعود للتفاعل الذي دربت Meta النموذج عليه عمداً.

تطبق Meta نفس الحذر في مكان آخر، حيث تشير إلى أن تشغيلات DeepSWE الخاصة بها "ليست متطابقة في الـ harness مع لوحة المتصدرين (leaderboard)" لأن لوحة المتصدرين الرسمية تستخدم mini-swe-agent لكل نموذج، وأن إعداداتها "قد لا تكون مضبوطة خصيصاً لنماذج الطرف الثالث المملوكة لشركات أخرى".3 وقد صاغ Kingy AI عدم التماثل الناتج بشكل جيد في يوم الإطلاق: هذا إفصاح صادق، ولكنه إفصاح موجود في ملف PDF مرتبط بينما الرقم موجود على الرسم البياني.2

قيمة الـ harness من حيث النقاط

تأثيرات الـ harness على اختبارات الوكلاء (agent benchmarks) هي مجال دراسة قائم بالفعل — حيث يوجد اختبار مخصص لقياس مدى تأثير حزمة التنفيذ (execution stack) المحيطة بالنموذج على نتائجه.6 وما يستحق القيام به لهذا الإطلاق تحديداً هو وضع رقم على ذلك باستخدام صفوف لوحة المتصدرين الموثقة نفسها، والتي يمكن للقارئ مراجعتها سطراً بسطر.

لوحة Terminal-Bench الرسمية مفيدة هنا تحديداً لأنها تحتوي على نماذج مكررة. قم بتصفيتها للبحث عن الصفوف التي يكون فيها النموذج، وجهد الاستنتاج (reasoning effort)، وإصدار الاختبار، والمقيّم متطابقين تماماً ويختلف الـ harness فقط، وسيبقى لدينا أربعة أزواج بالضبط:4

النموذجالجهدالـ harness الخاص بمطور النموذجTerminus 2الفارق (Delta)
GPT-5.5xhighCodex — 83.1%78.0%+5.1
Gemini 3 ProhighGemini CLI — 65.8%73.9%−8.1
Opus 4.7maxClaude Code — 68.9%66.1%+2.8
Gemini 3.1 ProhighGemini CLI — 65.8%65.6%+0.2

تم استبعاد زوج خامس ظاهر، وهو Claude Fable 5 في Claude Code مقابل Terminus 2، لأن الجهود تختلف (xhigh مقابل high)، مما يجعلها مقارنة بمتغيرين.

أربعة أزواج لا تشكل حجم تأثير إحصائي، ولا ينبغي قراءة هذا الجدول على هذا الأساس — اثنان من الأربعة من نفس المطور، وفارق 0.2 لنموذج Gemini 3.1 Pro لا يمكن تمييزه عن الضوضاء نظراً لأن كلا الصفين يحملان فاصل ±1.7. ما يثبته هذا الجدول هو الحد الأدنى لمدى تأثير الـ harness على الدرجة في هذه اللوحة تحديداً: تتراوح الفوارق الموقعة بين 13.2 نقطة، من −8.1 إلى +5.1، ومتوسط الفارق المطلق هو 4.05 نقطة.

الآن قارن ذلك بالمكسب الجيلي الوحيد الذي يمكن حسابه من الأرقام التي أعلنت عنها Meta. تم تسجيل Muse Spark 1.2 بنسبة 82.9%؛ بينما تم تسجيل Muse Spark 1.1 بنسبة 80.0% عند إطلاقه.25 هذا تحسن بمقدار 2.9 نقطة — وهو أصغر من متوسط الفارق المطلق لبيئة الاختبار (harness delta) البالغ 4.05 على اللوحة الموثقة، وأصغر من ثلاثة من أصل أربعة أزواج فردية.

هذه هي النتيجة: ليست أن رقم Meta خاطئ، ولكن يتم قراءة قياس النظام على أنه قياس للنموذج، ومكون النظام أكبر من التحسن الذي يتم الادعاء به.

الإحصائية التي تسير في الاتجاه المعاكس

هنا تنهار النسخة الواضحة من هذه الحجة، ومن الجدير بذكر ذلك بوضوح بدلاً من إخفائه.

إذا كان تبديل بيئة الاختبار قد ضخم مقارنة Meta بشكل منهجي، فمن المتوقع أن يؤدي تشغيل النموذج في بيئة الاختبار الخاصة بالمورد إلى نقاط إيجابية في المتوسط. ولكن بناءً على هذه البيانات، فإن قيمتها لا شيء. الفوارق الأربعة الموقعة — +5.1، -8.1، +2.8، +0.2 — مجموعها 0.0 بالضبط، مما يجعل متوسط التأثير الموقّع صفراً.

انظر إلى اتجاه صفوف Gemini على وجه الخصوص. في أحد الأزواج، سجلت واجهة CLI الخاصة بـ Google نقاطاً أقل بـ 8.1 نقطة من بيئة Terminus 2 المحايدة؛ وفي الزوج الآخر كانت أعلى بـ 0.2، وهو ما يقع ضمن نطاق الضوضاء الإحصائية. بيئة اختبار المورد ليست ميزة تلقائية. إن عبارة "قمنا بتشغيل كل نموذج في منتج الوكيل الخاص به" هي خيار منهجي يمكن الدفاع عنه، وليست عملية تلاعب.

لكن كن حذراً مع هذا الصفر. ثلاثة من الأزواج الأربعة تميل لصالح بيئة اختبار المورد؛ وقد سُحب المتوسط إلى الصفر بسبب قيمة سلبية واحدة كبيرة. أربع ملاحظات لا يمكنها حسم ما إذا كانت بيئات اختبار الموردين تساعد في المتوسط — بل يمكنها فقط إظهار أن الإجابة ليست "نعم" بشكل بديهي.

لذا فإن الادعاء الصحيح أضيق من قولنا "مكسب Meta مضخم". بل هو أن تبديل بيئة الاختبار يضيف تباينًا (variance)، وليس انحيازًا مُثبتًا — مما يجعل الفارق المُبلغ عنه غير قابل للتفسير بدلاً من كونه غير صادق. لا يمكنك تصحيحه لأنك لا تعرف إشارته. تشغيل Muse Spark 1.1 داخل Muse Code ربما كان سيرفع درجته ويقلص رقم Meta الرئيسي؛ وربما كان سيخفضها بنفس القدر. لم تنشر Meta مثل هذا التشغيل، ولا يمكن لأي شخص خارج Meta حسم الأمر.

هذا اتهام أقل حدة من ذلك الذي توحي به مقدمة هذا المنشور. وهو أيضاً الاتهام الذي تدعمه البيانات.

الفجوة الموثقة بين المورد والتحقق

هناك تضارب واحد موثق بين المورد والتحقق في نموذج Meta، وهو يعود للجيل السابق وليس الحالي.

نشرت Meta درجة Terminal-Bench 2.1 بلغت 80.0 لنموذج Muse Spark 1.1. وتنسب MarkTechPost هذا الرقم إلى صفحة نموذج Meta؛ بينما يذكر Kingy AI أنه نُشر عند إطلاق إصدار 1.1 في يوليو.25 صفحة نموذج Meta يتم رندرتها من جهة العميل (client-rendered) ولم ترسل نص الجسم إلى أداة جلب البيانات الخاصة بهذا المقال، ومنشور إطلاق 1.1 ينشر جدول التقييم كصورة، وتقرير تقييم Meta لـ 1.1 يذكر Terminal-Bench 2.1 مرتين في النص دون إعطاء درجة له.78 لذا فإن رقم 80.0 يستند إلى هذين التقريرين الثانويين بدلاً من صفحة Meta يمكن لهذا المقال قراءتها مباشرة.

إن الإدخال الموثق الخاص بفريق Terminal-Bench لنموذج Muse Spark 1.1، والذي تم تشغيله باستخدام mini-swe-agent بمستوى جهد xhigh وتم التحقق منه في 9 يوليو 2026، هو 76.2% ± 1.2%.4 وهذا أقل بـ 3.8 نقطة من الرقم الذي قدمه المورد، كما أن الحد الأعلى الموثق البالغ 77.4% لا يصل إليه.2

لاحظ حدود هذه المقارنة. لا يوجد مصدر يحدد أي أداة اختبار (harness) أو مستوى جهد في التفكير أنتج نتيجة Meta البالغة 80.0 في يوليو، لذا فإن الفجوة ليست بالضرورة مقارنة متكافئة. ما تم توثيقه هو أنه عندما قامت Meta بتشغيل 1.1 كخط أساس في مقارنتها لشهر أغسطس، استخدمت mini-swe-agent بمستوى xhigh — وهو نفس التكوين الذي كان طرف ثالث قد تحققه بالفعل.34 فالمختبر الذي يبحث عن خط أساس يجمّله كان ليكون لديه خيارات أسهل.

تقرير تقييم Meta الخاص بنموذج 1.1 هو أيضاً أكثر صراحة من تسويقها. فبخصوص قدرات البرمجة، يذكر التقرير أن "Muse Spark 1.1 يتأخر عن Claude 4.8 Opus و/أو GPT 5.5".7 المختبر الذي ينشر ذلك عن نموذجه الخاص لا يبدو أنه يدير عملية خداع في الاختبارات.

ما تتضمنه وما لا تتضمنه لوحة النتائج الموثقة

تطبق لوحة صدارة Terminal-Bench معياراً إثباتياً مختلفاً عن مخططات الموردين: حيث ينص تذييل الصفحة على أن "عضواً في فريق Terminal-Bench قام بتشغيل التقييم والتحقق من النتائج".4 واعتباراً من 7 أغسطس 2026، تعرض اللوحة 17 من أصل 17 إدخالاً، أحدثها بتاريخ 11 يوليو 2026.

بالنظر إلى جميع الصفوف الـ 17، لا تحتوي اللوحة على أي إدخال لـ Muse Spark 1.2، أو Claude Opus 5، أو GPT-5.6 Sol، أو Kimi K3 أو Gemini 3.6 Flash.4 وأعلى دقة موثقة عليها هي 83.8% ± 1.2%، بواسطة Claude Fable 5 الذي يعمل في Claude Code.

وبناءً على ذلك، فإن مخطط Meta ولوحة النتائج الموثقة ليسا وجهتي نظر لمسابقة واحدة. فهما بالكاد يتداخلان: من بين المنافسين الخمسة المذكورين في وثيقة منهجية Meta، ثلاثة منهم — Claude Opus 5 وGemini 3.6 Flash وKimi K3 — ليس لديهم إدخال موثق في هذا الاختبار، وكذلك الأمر بالنسبة لـ Muse Spark 1.2.34 وهذا ليس انتقاداً لشركة Meta؛ فالموردون يطرحون منتجاتهم بشكل أسرع من الموثقين المتطوعين. ولكن هذا يعني أن نسبة 82.9% المبلغ عنها هي تصريح عن أداة اختبار Meta وليست عن مستوى المنافسة العام.

تنشر اللوحة أيضاً عموداً لـ hacks (التحايلات)، وهي عقوبة يتم تطبيقها عندما يكتشف المقيمون سلوك "اختراق المكافأة" (reward-hacking). ستة عشر من أصل سبعة عشر إدخالاً تقع بين −0.0% و −0.9%. بينما يحمل Grok 4.5 في Cursor CLI نسبة −9.0%.4 وسيدرك قراء مقالنا السابق حول اختبار DeepSWE الذي كشف نموذجاً يقرأ التعديلات الذهبية من سجل .git سبب وجود هذا العمود.

مقيم ثانٍ، وما يختلف حوله فعلياً

تقوم Vals AI بتشغيل تقييم Terminal-Bench 2.1 الخاص بها، وبخلاف Meta أو اللوحة الرسمية، فإنها تحافظ على ثبات أداة الاختبار: "تم اختبار جميع النماذج باستخدام أداة Terminus 2".9 وقد تم تحديد تحديث صفحتها في 6 أغسطس 2026.

في تلك اللوحة، يتصدر GPT-5.6 Sol بنسبة 85.77%، متقدماً على Claude Opus 5 بنسبة 84.64%، يليه Kimi K3 بنسبة 80.90% و Claude Fable 5 بنسبة 80.52%.9 يتصدر Fable 5 اللوحة الرسمية الموثقة ويحتل المركز الرابع هنا. بينما يتصدر GPT-5.6 Sol هذه اللوحة ولا يظهر على اللوحة الرسمية على الإطلاق.

هذا الاختلاف في التصنيف يعود في الغالب إلى الـ harness (بيئة الاختبار)، وليس إلى اختلاف في النتائج — وتتفق اللوحتان بشكل ملحوظ عندما يتم مقارنتهما على أساس متماثل. يحقق Fable 5 في Terminus 2 درجة 80.4% رسمياً و 80.52% في Vals، بفارق 0.12 نقطة.49 التباين الأكبر يظهر في GPT-5.5 في نفس الـ harness: 78.0% رسمياً مقابل 76.40% في Vals، بفارق 1.6 نقطة. وحتى هذا الأمر يعتبر مؤشراً وليس دليلاً قاطعاً، لأن صف GPT-5.5 في اللوحة الرسمية محدد بوضوح كـ xhigh، بينما جدول نتائج Vals لم يظهر مجهود التفكير (reasoning effort) لكل نموذج لأداة جلب البيانات الخاصة بهذا المقال، لذا فإن المجهود لم يتم التحكم فيه بشكل مثبت.

الاستنتاج المفيد هو عكس الاستنتاج البديهي. عندما يقوم مقيمان بتشغيل نفس النموذج في نفس الـ harness، تكون النتائج متقاربة في حدود نقطة ونصف تقريباً. ولكن عند تغيير الـ harness، يتحرك نفس النموذج بمسافة أكبر بعدة مرات. الـ harness هو المتغير المهيمن، وهو المتغير الذي لا يتم تثبيته أبداً في مخططات الإطلاق.

تنشر Vals أيضاً تحذيرات من النوع الذي تتجاهله مخططات الموردين عادةً. استخدم تشغيل Opus 5 نموذج Claude Opus 4.8 كبديل في حالات الرفض، و"تأثرت تسع نتائج مهام ناجحة عبر التشغيلات الثلاثة؛ واحتسابها كإخفاقات يغير الدرجة من 84.64% إلى 81.27%".9 كما تضمن تشغيل Fable 5 نفس البديل لحالات الرفض — وهو أمر يستحق المعرفة، بما أن Fable 5 هو النموذج الذي يتصدر اللوحة الرسمية الموثقة.

التوجه الذي تغير

اقرأ منشوري إطلاق Muse Spark بالتتابع — خط النماذج الذي جعلته Meta ملكية خاصة في وقت سابق من هذا العام — وستجد جملة واحدة تبرز. في يوليو، عند الإعلان عن 1.1، كتبت Meta: "لقد دربنا نموذجنا ليتكيف بسلاسة مع مختلف الـ harnesses"، وقالت إن النموذج "يؤدي بشكل جيد مع إعدادات البرمجة الوكيلية (agentic coding) الشائعة".8 وبعد سبعة وعشرين يوماً، عند الإعلان عن 1.2، أصبحت نقطة البيع هي التدريب المشترك (co-training) مع harness واحد محدد.1

كلا الأمرين يمكن أن يكونا صحيحين — الإصدار 1.2 هو إصدار فرعي يركز على البرمجة، ولا يزال وصف OpenRouter له يشير إلى أنه يعمل "عبر عدة harnesses برمجية".10 لكنه تغيير في التركيز يجب أن يلاحظه القارئ الذي يختار بين الوكلاء، لأن كون النموذج "غير مرتبط بـ harness معين" (harness-agnostic) أو "مدرباً بشكل مشترك مع harness" (harness-co-trained) له تداعيات مختلفة على ما إذا كان رقم المعيار (benchmark) ينتقل مع النموذج عند استخدامه في مكان آخر. هذا السؤال — هل تتبع الدرجةُ النموذجَ أم تبقى مع النظام — هو نفس السؤال الذي يواجه الآن كل بيئة تشغيل و harness للوكلاء التجاريين يتم إطلاقها في هذا الربع.

ما هي التكلفة

يتوفر Muse Spark 1.2 في Muse Code وفي Meta Model API بما تسميه Meta وصولاً عالمياً موسعاً.1 الأسعار القياسية هي 1.25 دولار لكل مليون توكن مدخل و 4.25 دولار لكل مليون توكن مخرج، مع نافذة سياق تبلغ 1,048,576 توكن — وهي أرقام مدرجة بواسطة OpenRouter، التي تسجل أيضاً تاريخ الإصدار في 5 أغسطس 2026.10 ويُذكر أن المدخلات المخزنة مؤقتاً (Cached input) تبلغ 0.15 دولار لكل مليون.2

يتضمن الإطلاق أيضاً مستوى ثانياً. حيث تم الإبلاغ عن مستوى المساهمين (contributor tier) بسعر 0.10 دولار لكل مليون توكن مدخل و 0.20 دولار لكل مليون توكن مخرج، مع مدخلات مخزنة مؤقتاً بسعر 0.002 دولار، وذلك مقابل استخدام Meta للمطالبات (prompts) والاستكمالات (completions) الخاصة بك لتدريب النماذج المستقبلية؛ بينما يُذكر أن المستوى القياسي لا يُستخدم لتحسين منتجات Meta.2 هذه الأرقام مستمدة من تغطية الإطلاق وليس من صفحة تابعة لـ Meta استطاع هذا المقال تحميلها، لذا تعامل معها كأرقام مُبلغ عنها وليست مؤكدة.

إذا كانت هذه الأرقام دقيقة، فإن النسب هي 12.5 ضعفاً في المدخلات وحوالي 21 ضعفاً في المخرجات. هذا ليس مجرد خصم، بل هي عملية تبادل مختلفة، وتحديد أيهما الأنسب لك يعتمد على ما يوجد في مستودع الكود الخاص بك بدلاً من ميزانيتك. الأعمال مفتوحة المصدر والأعمال المؤقتة تجعل هذه المقايضة رخيصة. أما أكواد العملاء الخاضعة لاتفاقيات عدم الإفصاح (NDA) فلا تسمح بذلك، وفي معظم جهات العمل يكون هذا قرار شراء وتوريد وليس قرار مطور.

بخصوص المنصات: تغطي تعليمات التثبيت الخاصة بـ Meta نظامي macOS و Linux، ولا يذكر منشور الإطلاق نظام Windows.1 وبالمثل، لا يذكر المنشور أوزانًا (weights) قابلة للتنزيل، لذا يجب التعامل مع Muse Code كاعتمادية مستضافة (hosted dependency).15

كيف تقرأ المقالات القادمة من هذا النوع

الاستنتاج المحدد هنا يتعلق بـ Meta، ولكن الاستنتاج العام لا يقتصر عليها، وتطبيقه سهل وغير مكلف.

عندما ينشر مورد ما مكاسب في معايير الأداء (benchmark) من جيل إلى جيل، تحقق من ثلاثة أشياء قبل أن تصدق الفارق. هل تغيرت بيئة الاختبار (harness) بين التشغيلين؟ إذا حدث ذلك، فإن الرقم يقيس نظاماً وليس نموذجاً — وإذا تم تدريب النموذج الأحدث على بيئة الاختبار الأحدث، فلا يمكن الفصل بينهما على الإطلاق. ما هي المتغيرات التي ثبتها المورد؟ قامت Meta بتثبيت جهد الاستنتاج (reasoning effort) وصرحت بذلك، وهو أكثر مما يكشف عنه الكثيرون؛ وهذا يخبرك أين تبحث عن المتغيرات التي لم يتم تثبيتها. هل هناك إدخال تم التحقق منه؟ إذا لم يكن الأمر كذلك، فإن الادعاء هو ادعاء من المورد، وهو ليس بالضرورة كاذباً ولكنه يندرج تحت فئة أدلة مختلفة.

هذه الأسئلة الثلاثة تستغرق حوالي عشر دقائق، وعند تطبيقها على معايير Muse Code، فإنها تنقل العنوان من "قفزة جيلية واضحة" إلى "تحسين في النظام بتكوين غير معروف، دون وجود إدخال مستقل حتى الآن، من مختبر جاء نموذجه السابق بنتيجة أقل من الرقم الذي نشره هو نفسه عندما قام شخص آخر بتشغيله". لا يزال هذا إصداراً حقيقياً من مختبر جاد، ولكنه ادعاء أصغر وأكثر دقة من الادعاء الذي انتشر.

الخلاصة

Muse Code هو منتج حقيقي يحتوي على فكرتين تصميميتين على الأقل — وكلاء خلفية مستمرون (persistent background agents) وسجل أحداث دقيق لإعادة التشغيل (replay-exact event log) — وهما يسبقان المجال الحالي ويستحقان التجربة على مستودع أكواد يمكنك تحمل مخاطرة تعطيله. الهندسة التي قدمتها Meta هنا تستحق اهتماماً أكثر مما يستحقه مخططها البياني.

المخطط يستحق اهتماماً أقل، ولكن لسبب أكثر تحديداً من السبب المعتاد. إن تحقيق مكسب جيلي يتم قياسه عبر تغيير في بيئة الاختبار، بواسطة موديل تم تدريبه على تلك البيئة، مع عدم وجود إدخال موثق في اللوحة، لا يعد تحسناً في الموديل. بل هو تحسن في النظام بتكوين غير معروف — وبناءً على أدلة لوحة الصدارة نفسها، فإن "غير معروف" تعني حقاً غير معروف، لأن تبديل بيئة الاختبار قد حرك الدرجات في كلا الاتجاهين وبمقدار أكبر من المكسب الذي يتم الادعاء به.

انتظر إدخالاً موثقاً. وحتى ذلك الحين، الملخص الصادق هو أن Meta أطلقت وكيلاً (agent) مثيراً للاهتمام ورقماً لا يمكن تفسيره من الخارج.


Footnotes

  1. مختبرات Meta Superintelligence، "Introducing Muse Code and Muse Spark 1.2"، Meta AI Research، 5 أغسطس 2026. المصدر لتاريخ الإطلاق، وتثبيت macOS/Linux، والوكلاء الخلفيين غير المتزامنين المستمرين، وسجل الأحداث المخصص للإضافة فقط، ومهارات /plan و /grill و /goal، واقتباس التدريب المشترك، ودراسة حالة تحسين النواة (kernel-optimisation)، والتوافر، وعدم وجود أي ذكر لـ Windows أو أوزان قابلة للتنزيل. وأيضاً المصدر للملاحظة بأن مخططات التقييم هي صور لا يحتوي النص البديل الخاص بها على أي أرقام. 2 3 4 5 6 7 8 9 10 11 12 13 14 15

  2. أغسطس 2026. المصدر لرقم 82.9% المذكور، وموقع Claude Opus 5 المذكور أمام Muse Spark 1.2 في مخطط Meta، ورقم 80.0 المنشور عند إطلاق Muse Spark 1.1، والحد الأعلى الموثق بنسبة 77.4%، وأسعار فئة المساهمين والمدخلات المخبأة (cached-input) المذكورة. يذكر المقال أنه لم يتمكن من قراءة القيم الأساسية في مخططات Meta، والتي نُشرت كصور؛ لذا فإن رقم 82.9% هو رقم منقول وليس مؤكداً من مصدر أولي. 2 3 4 5 6 7 8 9 10 11

  3. Meta، "Muse Spark 1.2 & Muse Code Evaluation Methodology"، research.meta.ai، 5 أغسطس 2026 (PDF). المصدر لتخصيص harness لكل نموذج، وإعداد xhigh لجهد الاستدلال (reasoning-effort) لكلا إصداري Muse Spark، وتكوين Terminal-Bench 2.1 المكون من 89 مهمة، وتكوين DeepSWE v1.1، وملاحظة "ليس مطابقاً لـ harness الخاص بلوحة المتصدرين"، وملاحظة "ليست مقارنات لوكيل CLI" بخصوص GDPVal-AA v2 و MCP Atlas، وتحذير الضبط (tuning) من طرف ثالث. 2 3 4 5 6 7 8 9

  4. "terminal-bench@2.1 Leaderboard"، Terminal-Bench، تم الاسترجاع في 7 أغسطس 2026. جميع المدخلات الـ 17 الموثقة مع أدوات الاختبار (harnesses) الخاصة بها، وجهود الاستدلال، وفترات الثقة، وتواريخ التحقق، وعقوبات الاختراق (hacks penalties)، بما في ذلك Muse Spark 1.1 بنسبة 76.2% ± 1.2%. أما أزواج أدوات الاختبار ذات النموذج/الجهد المتماثل الأربعة، والفروقات (deltas) بينها، والنطاق البالغ 13.2 نقطة، ومتوسط الفرق المطلق البالغ 4.05 نقطة، ومتوسط الفرق الموجه الصفري، فهي نتاج العمليات الحسابية الخاصة بهذا المقال على تلك الصفوف. 2 3 4 5 6 7 8 9 10 11 12 13 14

  5. Asif Razzaq، "Meta AI Releases Muse Code (Beta): A Terminal Coding Agent Powered by the New Muse Spark 1.2 Model"، MarkTechPost، 5 أغسطس 2026. المصدر لعبارة "صفحة نموذج Meta تدرج Muse Spark 1.1 عند 80.0 في Terminal-Bench 2.1"، مع رابط إلى developer.meta.com؛ ولملخص تكوينات المعيار (benchmark) في وثيقة المنهجية؛ وللملاحظة المستقلة بأن منشور الإطلاق لا يذكر أوزانًا قابلة للتنزيل. لاحظ أن 2 يذكر نفس الرقم 80.0 ولكنه ينسبه إلى النشر عند إطلاق الإصدار 1.1 بدلاً من صفحة النموذج؛ يختلف الروايتان في المصدر، ولم يتمكن هذا المقال من تحميل أي منهما. 2 3 4 5

  6. "Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows", arXiv, 27 مايو 2026. معيار لقياس مدى تأثير حزمة تنفيذ العميل (agent execution stack) المحيطة بالنموذج على نتائجه، وذلك عبر مهام العملاء في البيئات المعزولة (sandboxed) بشكل عام بدلاً من معايير البرمجة تحديداً. تم الاستشهاد به لإثبات أن تأثيرات الحزمة (harness effects) هي مجال دراسة قائم، بحيث يُفهم إسهام هذا المقال على أنه تطبيق لهذا المنظور على مقارنة Meta المحددة بدلاً من كونه ملاحظة جديدة.

  7. Meta, "Muse Spark 1.1 Evaluation Report", research.meta.ai (PDF). المصدر لعبارة "بالنسبة لقدرات البرمجة (مثل Terminal-Bench 2.1، SWE-Bench Pro)، يتأخر Muse Spark 1.1 عن Claude 4.8 Opus و/أو GPT 5.5." يذكر التقرير Terminal-Bench 2.1 ولكنه لا ينشر أي درجة رقمية له في النص. 2

  8. Meta Superintelligence Labs, "Introducing Muse Spark 1.1", Meta AI Research, 9 يوليو 2026. المصدر لتاريخ الإصدار في 9 يوليو، ونافذة السياق التي تبلغ مليون توكن، والمعاينة العامة لـ Meta Model API، واقتباس "دربنا نموذجنا ليتكيف بسلاسة مع الحزم المتنوعة". 2

  9. "Terminal-Bench 2.1", Vals AI, صفحة محدثة بتاريخ 6 أغسطس 2026. المصدر لمنهجية الحزمة الواحدة (Terminus 2)، وأرقام GPT-5.6 Sol، وOpus 5، وKimi K3، وFable 5، وGPT-5.6 Luna، وGPT-5.5 وSonnet 5، وتحذيرات التراجع عند الرفض (refusal-fallback) لكل من Opus 5 وFable 5. تذكر أقسام "النتائج الرئيسية" و"المنهجية" في الصفحة عدم وجود جهد استدلال لكل نموذج، وجدول نتائجها يتم رندرتُه من جهة العميل (client-rendered) ولم يرجع تفاصيل لكل صف إلى أداة جلب البيانات الخاصة بهذا المقال. 2 3 4 5

  10. "Meta: Muse Spark 1.2 — API Pricing & Providers", OpenRouter, تم الاسترجاع في 7 أغسطس 2026. قائمة بأسعار التسعير القياسية 1.25 دولار / 4.25 دولار لكل مليون، ونافذة سياق تبلغ 1,048,576 توكن، وتاريخ الإصدار في 5 أغسطس 2026، ووصف "يعمل عبر حزم برمجة متعددة". يقوم OpenRouter بنقل الأسعار المقدمة من المزود بدلاً من تدقيقها بشكل مستقل. 2

الأسئلة الشائعة

ليس في اللوحة الرسمية. حتى 7 أغسطس 2026، تعرض لوحة صدارة Terminal-Bench 17 إدخالاً وليس من بينها Muse Spark 1.2. 4 رقم 82.9% هو رقم Meta الخاص، تم إنتاجه في إطار تقييم Meta الخاص، وتم الإبلاغ عنه من خلال التغطية الإعلامية بدلاً من نشره كنص رسمي من قبل Meta. 2