OSWorld 2.0: أفضل وكلاء AI ينجزون 20.6% فقط من المهام
٣١ يوليو ٢٠٢٦

في سطر واحد: OSWorld 2.0 هو مقياس لاستخدام الكمبيوتر يتكون من 108 سير عمل حقيقي يستغرق الإنسان الماهر وسيطاً قدره 1.6 ساعة، وأفضل وكيل متطور أكمل 20.6% منها من البداية إلى النهاية — وهو انهيار ناتج عن إدارة الحالة، وليس عن مهارة واجهة المستخدم الرسومية (GUI).
ملخص
قام فريق بقيادة XLANG Lab في جامعة هونج كونج، مع Snorkel AI كشريك في البحث والبيانات، بنشر OSWorld 2.0 على arXiv في 28 يونيو 2026، مع مراجعته في 13 يوليو.1 وهو يستبدل مهام سطح المكتب القصيرة في OSWorld الأصلي بـ 108 سير عمل طويلة المدى تستغرق من البشر المهرة وسيطاً قدره حوالي 1.6 ساعة، مع 69.6% منها تستغرق أكثر من ساعة.2
النتيجة الرئيسية: عند ميزانية قدرها 500 خطوة، يتصدر Claude Opus 4.8 مع أقصى قدر من التفكير واستدعاءات الأدوات المجمعة بنسبة إكمال ثنائية قدرها 20.6% ودرجة جزئية 54.8%. أما GPT-5.5 فيثبت عند 13% — وهي نفس القيمة عند 150 و300 و500 خطوة.3 وفي لوحة المتصدرين المعتمدة، لا يوجد نظام تم تقييمه يتجاوز 21% من البداية إلى النهاية.
تنبيه واحد قبل المتابعة، لأنه يتسبب بالفعل في ارتباك في التغطيات الثانوية: OSWorld 2.0 يذكر رقمين مختلفين، وغالباً ما تقتبس الشركات الرقم الأعلى. تضع مواد OpenAI الخاصة بـ GPT-5.6 Sol نسبة 62.6% في OSWorld 2.0 — ولكن هذه هي الدرجة الجزئية، وليست الإكمال من البداية إلى النهاية.4 المزيد حول سبب أهمية هذا التمييز أدناه.
الجزء المثير للاهتمام ليس الرقم المنخفض، بل لماذا هو منخفض. الورقة البحثية صريحة: الوكلاء لا "يتعثرون في التحكم الأساسي في واجهة المستخدم الرسومية أو البرمجة"، بل "يفقدون تتبع القيود، ويفوتون المعلومات التي تصل في منتصف المهمة، ويخمنون بدلاً من سؤال المستخدم، ويتجاوزون عملية التحقق".1 لقد انتقلت نقطة الاختناق من الإدراك إلى الذاكرة.
ما ستتعلمه
- ما الذي يقيسه OSWorld 2.0 وكيف يختلف عن OSWorld الأصلي
- لماذا يحقق نفس النموذج درجة 83.4% في أحد إصدارات OSWorld و20.6% في الآخر
- النقطة الدقيقة على المحور الزمني التي ينهار عندها إكمال الوكيل إلى الصفر
- أنماط الفشل التي يعزلها المقياس، مع أمثلة حقيقية لمسارات التنفيذ
- لوحة المتصدرين الكاملة، بما في ذلك تكلفة كل عملية تقييم
- لماذا تكون درجات OSWorld 2.0 التي تقتبسها الشركات أعلى بـ 3 مرات من لوحة المتصدرين
- التحذيرات المنهجية — بما في ذلك النماذج المفقودة
- ما الذي يجب تغييره إذا كنت تقوم بإطلاق وكلاء يعملون لفترات طويلة
ما الذي يقيسه OSWorld 2.0 فعلياً
OSWorld 2.0 هو مقياس يقيم وكلاء استخدام الكمبيوتر بناءً على سير عمل مهني كامل بدلاً من إجراءات سطح مكتب معزولة. كل مهمة من مهامه الـ 108 هي وظيفة من البداية إلى النهاية — مثل تقديم طلب استرداد أموال، أو تسوية موافقات الشراء، أو بناء نموذج CAD وفقاً لرسم هندسي — يتم تنفيذها عبر تطبيقات سطح المكتب و31 موقعاً إلكترونياً مستضافاً ذاتياً.2
تغيير المقياس مقارنة بـ OSWorld 1.0 هو الهدف الأساسي. كانت المهام في الإصدار الأصلي تستغرق في المتوسط أقل من 30 خطوة للوكيل. أما OSWorld 2.0 فيستغرق في المتوسط أكثر من 250 خطوة.2 وبالقياس من خلال استدعاءات الأدوات، تستغرق المهمة الواحدة في المتوسط 318 استدعاءً مع Claude Opus 4.7 عند أقصى قدر من التفكير، مقابل حوالي 30 في الإصدار 1.0 — أي حوالي عشر أضعاف الحمل التشغيلي.1
تغير نظام التقييم أيضاً. كان الإصدار 1.0 ثنائياً: إما أن تنهي المهمة أو لا. أما OSWorld 2.0 فيقدم كلاً من معدل الإكمال الثنائي ودرجة جزئية يتم حساب متوسطها عبر 27.25 نقطة تفتيش لكل مهمة، منها 11.53% تأتي من فحوصات معتمدة قائمة على النماذج بدلاً من المقيمين الحتميين.2
تغطي المهام الـ 108 سبعة مجالات مهنية و21 فئة فرعية — البحث، الإنتاج الإبداعي، الهندسة، الخدمات الشخصية، الأعمال والتمويل، الإدارة والامتثال، والرعاية الصحية. قام المؤلفون بربطها بالعائلات الوظيفية واستخدموا مؤشر فاتورة الأجور في الناتج المحلي الإجمالي بقيمة 1.64 تريليون دولار لإثبات أن مجموعة البيانات تغطي أعمالاً حقيقية من الناحية الاقتصادية.5
هناك مسار عمل منفصل يجري ثمانية فحوصات تشخيصية للسلامة لكل مسار، ويتم تقييمها بشكل مستقل عن إكمال المهمة — بحيث يظل العميل الذي يصل إلى النتيجة الصحيحة بوسائل غير آمنة مرئياً.2
نفس النموذج، معياران مختلفان، وفارق 63 نقطة
إليك المقارنة التي تجعل OSWorld 2.0 جديراً باهتمامك. كل صف يمثل نموذجاً واحداً، تم قياسه بناءً على معيارين، وكلا الرقمين محدثان.
| النموذج | OSWorld-Verified | OSWorld 2.0 (ثنائي، 500 خطوة) | الفجوة |
|---|---|---|---|
| Claude Opus 4.8 | 83.4%6 | 20.6%3 | 62.8 نقطة |
| GPT-5.5 | 78.7%6 | 13%3 | 65.7 نقطة |
حقق نموذج Claude Opus 4.8، الذي صدر في 28 مايو 2026، درجة 83.4% في OSWorld-Verified.6 وللمرجعية، ذكرت ورقة OSWorld الأصلية لعام 2024 خط أساس بشري بنسبة 72.36% — رغم أن هذا الرقم تم قياسه على مجموعة المهام الكاملة المكونة من 369 مهمة، وليس على المجموعة الفرعية المعتمدة (Verified)، لذا تعامل معه كمؤشر تقريبي وليس كمقارنة متطابقة.7 أما في OSWorld 2.0، فينهي نفس النموذج 20.6% من المهام. هذا يمثل فارقاً قدره 62.8 نقطة. وبالنسبة لـ GPT-5.5، الذي صدر في 23 أبريل 2026، فإن الفارق هو 65.7 نقطة.89
هذا ليس تراجعاً في الأداء، وليس مقارنة متكافئة تماماً — فمجموعات المهام مختلفة، والمقيمون مختلفون، وأدوات الاختبار مختلفة. ما يقيسه هذا هو مدى كون درجة المعيار دالة في طول المهمة. ثبت النموذج، ووسع الأفق من ثلاثين خطوة إلى مائتين وخمسين، وستجد أن ما بين ثلاثة أرباع وأربعة أخماس القدرة الظاهرية قد اختفت.
من الجدير بالذكر وبوضوح: أن أرقام OSWorld-Verified هي تقارير ذاتية من الموردين. فالمتتبع الذي يجمع هذه البيانات يدرج 21 نتيجة مُبلغ عنها ذاتياً وصفر نتيجة تم التحقق منها بشكل مستقل.6 كما قامت Anthropic بتغيير طريقة تشغيل التقييم لإصدار Opus 4.8، حيث أعادت صياغة درجة Opus 4.7 لترتفع إلى 82.3% بموجب نظام الاختبار الجديد — لذا فإن جزءاً من أي مكسب جيلي هناك يعود للمنهجية، وليس للموديل.8
جدار الأفق
أكثر النتائج ملموسية في هذا المقياس هي وجود جدار على محور الوقت، وقد رسم المؤلفون بدقة مكان وجوده.
في المهام التي ينهيها البشر في أقل من 45 دقيقة، يصل GPT-5.5 و Claude Opus 4.7 إلى نسبة إكمال ثنائية تتراوح بين 20-24%.5 ثم ينخفض الأداء بشكل مطرد. وبحلول الفئة الزمنية 137-163 دقيقة، لا يتجاوز أي موديل نسبة 10%. وما فوق 163 دقيقة، تنخفض نسبة الإكمال الثنائية إلى صفر لكل موديل تم الاحتفاظ به في الرسم البياني.5
أما الدرجات الجزئية فتروي قصة أخف وطأة: فهي تتجمع في نطاق 20-55% عبر كل نظام تم تقييمه.2 العملاء البرمجيون (Agents) لا يتخبطون؛ بل يحققون تقدماً ملموساً ومثبتاً بنقاط تفتيش في كل مهمة تقريباً — ثم يفشلون في إتمامها.
التكلفة تتزايد بشكل أسوأ من القدرة. يشير تحليل Snorkel إلى أن تجاوز عتبة الدرجة الجزئية بنسبة 50% يتطلب توكنز (tokens) أكثر بعشرة أضعاف مما يتطلبه الوصول إلى 25%.2 إن شراء المرحلة الأخيرة من التقدم مكلف بشكل غير متناسب.
أين ينهار العملاء البرمجيون
قام المؤلفون بتصنيف كل مهمة بظواهر تحديات متكررة، مما يحول عبارة "فشل العميل البرمجي" إلى شيء يمكن تشخيصه. وهذه هي الظواهر الخمس الأكثر شيوعاً عبر 108 مهام:5
| ظاهرة التحدي | المهام | الحصة |
|---|---|---|
| الاستدلال عبر المصادر | 46 | 42.6% |
| الدقة البصرية-المكانية | 45 | 41.7% |
| استنتاج الحالة الضمنية | 43 | 39.8% |
| تتبع حالة عناصر متعددة | 43 | 39.8% |
| إزالة غموض التعارض | 39 | 36.1% |
تتداخل التصنيفات — حيث يمكن أن تحمل المهمة الواحدة عدة تصنيفات — لكن النمط ثابت: الجزء الصعب هو التوفيق بين الحقائق المبعثرة عبر البريد الإلكتروني والمستندات والسجلات والرسائل السابقة، واستعادة حالة لم يذكرها أحد في الأمر (prompt).
وتجعل مسارات الفشل المنشورة الأمر ملموساً. في Task035، يقوم عميل برمجي بتجميع ورقة طلب شراء من رسائل دردشة الفريق وجدول بيانات، ويلاحظ وصول موافقة متأخرة في منتصف التشغيل، فيقوم بتصنيفها كاستثناء لمرة واحدة، ثم ينفذ بناءً على الجدول القديم الذي أنشأه سابقاً. ويؤكد التحقق الذاتي النهائي قصته الداخلية المكونة من خمسة صفوف بدلاً من المتطلبات الفعلية — وبذلك يثبت صحة مستند يفتقد إلى طلب معتمد.5
في Task008، يستمر عميل يقوم بجمع أدلة استرداد المصروفات في توسيع نطاق بحثه، وينحرف لكتابة سكريبت لإنشاء مستند بعد أن أعاد API الخطأ 404، ولا ينتقل إلى تطبيق المصروفات المستهدف إلا في الخطوة 446 من ميزانية مكونة من 500 خطوة — مع تحميل النموذج نفسه في الخطوة 459. وينتهي التشغيل بمحاولة هندسة عكسية لحقل تاريخ للقراءة فقط. كانت كل خطوة فردية منطقية، لكن الوقت المتاح نفد قبل التسليم.5
هذا هو الخيط الرابط. هذه ليست إخفاقات في التثبيت (grounding). بل هي إخفاقات في معرفة متى يجب التوقف عن الجمع، وما الذي يجب إعادة فحصه، وأي استنتاج سابق أصبح الآن باطلاً.
لوحة المتصدرين الكاملة
عند ميزانية 500 خطوة، عشرة تكوينات عبر سبعة نماذج:3
| النموذج | الجهد | النهج | ثنائي (Binary) | جزئي | التكلفة التقديرية |
|---|---|---|---|---|---|
| Claude Opus 4.8 | max | Batched tool | 20.6% | 54.8% | n/a |
| Claude Opus 4.8 | max | Standard | 18.52% | 49.33% | n/a |
| Claude Opus 4.7 | max | Batched tool | 18.2% | 48.91% | n/a |
| Claude Opus 4.7 | max | Standard | 13.9% | 49.1% | $3.87K |
| GPT-5.5 | xhigh | Batch tool | 13% | 49.5% | $2.75K |
| Claude Sonnet 4.6 | medium | Standard | 9.3% | 33.9% | $1.55K |
| Claude Sonnet 4.6 | max | Standard | 8.3% | 41.5% | $2.41K |
| MiniMax M3 | enabled | Standard | 4.6% | 22.3% | $258.78 |
| Kimi K2.6 | enabled | Standard | 4.6% | 22.1% | $708 |
| Qwen3.7-Plus | thinking | Standard | 2.8% | 21.5% | $411.56 |
هناك تفصيلان يستحقان الانتباه. استدعاءات الأدوات المجمعة (Batched tool calls) تحقق نقاطاً حقيقية — حيث يكتسب Opus 4.8 ما يزيد قليلاً عن نقطتين ويكتسب Opus 4.7 حوالي 4.3 نقطة مقارنة بتكويناتهما القياسية، وذلك فقط من خلال طريقة إصدار الاستدعاءات.
و GPT-5.5 لا يتحرك على الإطلاق مع زيادة الخطوات: 13% عند 150 و300 و500 خطوة.3 إنه صاحب أعلى نتيجة عند ميزانية 150 خطوة — حيث يحقق ثاني أفضل نظام نسبة 4.6% — وفي الوقت نفسه هو النظام الوحيد الذي لا يستفيد شيئاً من زيادة عدد الخطوات المسموح بها. تصفه الورقة البحثية بأنه "أكثر كفاءة بكثير في استخدام التوكنز (tokens)"، وهذه الكفاءة حقيقية؛ لكنها ببساطة لا تؤدي إلى إكمال مهام إضافية.13
الرقمان اللذان يخلط بينهما الجميع
لقد تم قياس النماذج الأحدث على OSWorld 2.0 — ولكن ليس على لوحة المتصدرين الثنائية المعتمدة، وليس باستخدام نفس المقياس. هذا هو الموضع الذي تخطئ فيه معظم التغطيات الحالية، لذا يستحق الأمر شرحه بعناية.
يتضمن إعلان OpenAI عن GPT-5.6، المنشور في 9 يوليو 2026، جدولاً لاستخدام الكمبيوتر يحتوي على صف خاص بـ OSWorld 2.0:4
| الموديل | OSWorld 2.0 (جدول OpenAI) |
|---|---|
| GPT-5.6 Sol | 62.6% |
| GPT-5.6 Terra | 50.2% |
| GPT-5.6 Luna | 45.6% |
| Claude Opus 4.8 | 54.8% |
| GPT-5.5 | 47.5% |
انظر إلى صف Claude Opus 4.8: 54.8%. هذه هي بالضبط درجة Opus 4.8 الجزئية في لوحة صدارة Snorkel — حيث تبلغ نسبة الإكمال الثنائي (binary completion) الخاصة به 20.6%.3 OpenAI تقوم بتقديم مقياس الائتمان الجزئي (partial-credit metric).
وبالتالي، فإن نسبة 62.6% لـ GPT-5.6 Sol هي درجة جزئية، والمقارنة العادلة هي 62.6% مقابل 54.8% لـ Opus 4.8 — وهو مكسب يقارب 8 نقاط في الائتمان الجزئي، وليس مضاعفة ثلاث مرات للإكمال من البداية للنهاية. تذكر OpenAI المقارنة بشكل صحيح، مشيرة إلى أن Sol "يتفوق على Opus 4.8 مع استخدام توكنات مخرجات أقل بنسبة 85%".4
نشرت Anthropic نتيجة OSWorld 2.0 لـ Claude Opus 5 في 24 يوليو، وأفادت بأنه "يتفوق على كل موديل آخر عند أي تكلفة محددة، متجاوزاً أفضل نتيجة لـ Fable 5 بتكلفة تزيد قليلاً عن الثلث".10 تُنشر مخططات Anthropic كصور بدلاً من جداول نصية، لذا لا يظهر رقم مطلق في نص الإعلان. الأرقام المتداولة على نطاق واسع من جهات خارجية والتي تبلغ حوالي 70% لـ Opus 5 تربطه بقيمة Opus 4.8 تقارب 55.7% — مرة أخرى، هذا مقياس الدرجة الجزئية، وليس الثنائي.
أين يكمن الخلل في التطبيق العملي: يقوم مجمع بيانات واحد على الأقل الآن بنشر جدول OSWorld 2.0 واحد يدرج GPT-5.6 Sol بنسبة 62.6% إلى جانب Claude Opus 4.8 بنسبة 20.6%، واصفاً العمود بأنه "الإكمال الثنائي". هذان الرقمان يأتيان من مقاييس مختلفة. إذا قرأت هذا الجدول كما هو، ستستنتج أن GPT-5.6 ضاعف مستوى التطور التقني ثلاث مرات في ثلاثة أسابيع. وهذا لم يحدث.
الملخص القابل للدفاع عنه: في الإكمال الثنائي من البداية للنهاية، لا تزال أفضل نتيجة تم التحقق منها هي 20.6%، وحتى 31 يوليو 2026، لم ينشر أي موديل أحدث رقماً للإكمال الثنائي. وفي الائتمان الجزئي، يتصدر GPT-5.6 Sol بنسبة 62.6% ويدعي Opus 5 نتيجة أفضل. لا تقارن أبداً بين المقياسين.
ما لا يخبرك به المقياس المرجعي
أربعة تحذيرات إضافية.
لوحة الصدارة الموثقة تتأخر عن النماذج الرائدة. اعتباراً من تحديث 28 يوليو، فإن أعلى إدخال في Snorkel هو Claude Opus 4.8 (28 مايو 2026). تم إطلاق Claude Fable 5 في 9 يونيو، وGPT-5.6 في 9 يوليو، وClaude Opus 5 في 24 يوليو.810114 نتائج OSWorld 2.0 الخاصة بهم تم تشغيلها والإبلاغ عنها من قبل الموردين، ولم يتم التحقق منها بشكل مستقل من خلال عملية التقييم الخاصة بالمشروع.
OSWorld 2.0 ليس أول مقياس مرجعي للعملاء (agents) ذوي الأفق الطويل. تستهدف OS-Marathon و Odysseys و Long-Horizon-Terminal-Bench جميعاً مجالات متداخلة.121314 ما يضيفه OSWorld 2.0 هو مجموعة البيئات المستضافة ذاتياً، والائتمان الجزئي على مستوى نقاط التفتيش (checkpoint)، وتصنيف ظواهر التحديات — وليس الفكرة نفسها.
الملخص يتناقض مع نفسه في رقم واحد. موقع المشروع يضع GPT-5.5 "قرب 14%"؛ بينما يقول ملخص arXiv v2 "قرب 13%".15 لوحة الصدارة تحسم الأمر عند 13%، وهذا هو الرقم المستخدم هنا.3 كما تختلف الدرجات الجزئية للمورد ولوحة الصدارة قليلاً لنفس النموذج — GPT-5.5 حقق 49.5% في Snorkel و 47.5% في جدول OpenAI، مما يعكس عمليات تشغيل مختلفة.34
فئات المهام مقيدة. يتم إرسال تعريفات المهام الرسمية عبر مجموعة بيانات Hugging Face مقيدة للحد من تسريب المعايير المرجعية، بينما تظل الأكواد والوثائق عامة. يتطلب التواجد في لوحة الصدارة تشغيل تقييم منسق أو تقديم مسار من مؤسسة موثوقة.2
ماذا يعني هذا إذا كنت تقوم بإطلاق عملاء ذكيين (Agents)
القراءة العملية هي أن طول الأفق، وليس اختيار النموذج، هو المتغير الذي يحدد ما إذا كان العميل الخاص بك سينهي المهمة أم لا.
حدد الميزانية بناءً على مدة المهمة، وليس نوعها. فوق 2 ساعة و 45 دقيقة تقريباً من وقت العمل البشري، ينخفض معدل الإكمال الثنائي إلى صفر لكل نموذج في المخطط المنشور — وهو بالفعل أقل من 10% بعد حوالي ساعتين وربع.5 قم بتفكيك العمل، أو ضع نقطة تفتيش في المنتصف.
امنح العميل حالة مستدامة (Durable State). في كل مسار من مسارات الفشل الثلاثة التي نشرها المؤلفون، يثق العميل في ملخصه التراكمي أكثر من ثقته في البيئة.5 وجود مجموعة عمل تعيش خارج نافذة السياق — ويتم إعادة قراءتها، لا تذكرها فقط — يعالج نمط الفشل هذا بشكل مباشر. منشورنا حول أنظمة ذاكرة العملاء الذكيين من Microsoft و Huawei يغطي كيف يبدو هذا البناء التحتِي حالياً.
فرض إعادة التحقق قبل الإجراءات النهائية. فشلت المهمة Task035 في فحصها النهائي لأنها تحققت من نموذجها الداخلي بدلاً من المتطلبات. خطوة تحقق تعيد قراءة المصادر بدلاً من ملاحظات العميل كانت ستكشف ذلك.
التصميم مع مراعاة المقاطعات. 9.3% فقط من مهام OSWorld 2.0 مصنفة كـ "بيئة ديناميكية" — أي وصول معلومات جديدة في منتصف التشغيل — ومع ذلك، توفر هذه الفئة واحداً من مسارات الفشل الثلاثة التي اختار المؤلفون نشرها.5 إذا كان سير عملك يتصل بصندوق وارد مباشر أو قناة دردشة، افترض أن الخطة ستصبح قديمة في منتصف التنفيذ.
راقب التكلفة، وليس الدقة فقط. أغلى عملية تشغيل أبلغ عنها Snorkel في هذه المجموعة هي 3.87 ألف دولار، وأعلى تكوينين في النقاط لم يذكرا أي رقم للتكلفة على الإطلاق.3 اقرأ ذلك جنباً إلى جنب مع التكلفة الفعلية لمهمة العميل الواحد من حيث التوكنز (tokens) قبل الالتزام بتصميم طويل الأفق.
للمقارنة في صياغة الأمور، تغطيتنا السابقة لـ تجاوز GPT-5.4 للمستوى البشري في استخدام الكمبيوتر تصف الصورة قصيرة الأفق التي بُني OSWorld 2.0 لتعقيدها.
الخلاصة
لا يظهر OSWorld 2.0 أن وكلاء استخدام الكمبيوتر أصبحوا أسوأ. بل يظهر أن المقياس الذي كان الجميع يستشهد به كان يقيس مشكلة أقصر من تلك التي تشتريها الشركات.
يمكن لنموذج أن يحقق درجة في الثمانينيات في مهام سطح المكتب المكونة من 30 خطوة، ومع ذلك لا ينهي سوى واحد من كل خمسة سير عمل حقيقي من البداية إلى النهاية. الفجوة بين هذين الرقمين — 62.8 نقطة لـ Claude Opus 4.8 — هي الحجم الحقيقي للمسافة بين العرض التجريبي والنشر الفعلي في الوقت الحالي.
الجانب المشجع هو أن الدرجات الجزئية تتراوح بين 20% و 55% في لوحة المتصدرين المعتمدة، والدرجات الجزئية التي أبلغ عنها الموردون لأحدث النماذج أعلى من ذلك. الوكلاء يقومون بمعظم العمل. ما ينقصهم هو الانضباط في تتبع ما تغير، وإعادة التحقق قبل الاعتماد، والسؤال عندما تتعارض الأدلة. هذه مشكلات هندسية ذات أشكال معروفة — حالة مستديمة، تحقق إجباري، نقاط تفتيش بشرية — وليست جداراً يتطلب كسر جيل النماذج القادم.
نقطة البيانات التي لا تزال مفقودة هي رقم إكمال ثنائي تم التحقق منه بشكل مستقل لـ Opus 5 أو Fable 5 أو GPT-5.6. وإلى أن يتوفر ذلك، فإن نسبة 20.6% هي الرقم الذي يجب التخطيط بناءً عليه — وأي رقم من OSWorld 2.0 تراه مقتبساً فوق 45% تقريباً هو على الأرجح درجة جزئية، وليس عملاً مكتملاً.
Footnotes
-
Yuan, M., Zhou, Z., Xiong, X., et al. "OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks." arXiv:2606.29537, submitted June 28, 2026, revised July 13, 2026. https://arxiv.org/abs/2606.29537 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
Snorkel AI، "OSWorld 2.0: Long-Horizon Computer-Use Benchmark"، صفحة لوحة المتصدرين والمنهجية، تم التحديث في 28 يوليو 2026. https://snorkel.ai/leaderboard/os-world-2-0/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
-
لوحة متصدري OSWorld 2.0، نتائج 150/300/500 خطوة، Snorkel AI، تم التحديث في 28 يوليو 2026. https://snorkel.ai/leaderboard/os-world-2-0/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13
-
OpenAI، "GPT-5.6: ذكاء رائد يتوسع مع طموحك،" 9 يوليو 2026 — يسرد جدول استخدام الكمبيوتر درجات OSWorld 2.0 بنسبة 62.6% (Sol)، و50.2% (Terra)، و45.6% (Luna)، و47.5% (GPT-5.5) و54.8% (Claude Opus 4.8). https://openai.com/index/gpt-5-6/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7
-
موقع مشروع OSWorld 2.0، مختبر XLANG، جامعة هونج كونج — إحصائيات المهام، ظواهر التحدي، النتائج الرئيسية ومسارات الفشل. https://osworld-v2.xlang.ai/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11
-
لوحة صدارة OSWorld-Verified، إحصائيات LLM، آخر تحديث 26 يوليو 2026 (21 نموذجًا، جميعها تقارير ذاتية، ولم يتم التحقق من أي منها بشكل مستقل). https://llm-stats.com/benchmarks/osworld-verified ↩ ↩2 ↩3 ↩4
-
Xie, T., Zhang, D., Chen, J., وآخرون. "OSWorld: قياس أداء الوكلاء متعددي الوسائط للمهام المفتوحة في بيئات الكمبيوتر الحقيقية." arXiv:2404.07972، 11 أبريل 2024 — 369 مهمة، 72.36% كخط أساس بشري، 12.24% لأفضل نموذج عند النشر. https://arxiv.org/abs/2404.07972 ↩
-
Anthropic، "Introducing Claude Opus 4.8"، 28 مايو 2026 — بما في ذلك الحاشية التي تعيد تحديد درجة OSWorld-Verified لـ Opus 4.7 لتصبح 82.3% بموجب نظام اختبار مُعدل. https://www.anthropic.com/news/claude-opus-4-8 ↩ ↩2 ↩3
-
OpenAI، "Introducing GPT-5.5"، 23 أبريل 2026 — يدرج جدول استخدام الكمبيوتر والرؤية GPT-5.5 بنسبة 78.7% في OSWorld-Verified و Claude Opus 4.7 بنسبة 78.0%. https://openai.com/index/introducing-gpt-5-5/ ↩
-
Anthropic، "Introducing Claude Opus 5"، 24 يوليو 2026 — بما في ذلك ادعاء OSWorld 2.0 بأن Opus 5 "يتفوق على أي نموذج آخر عند أي تكلفة محددة، متجاوزاً أفضل نتيجة لـ Fable 5 بما يزيد قليلاً عن ثلث التكلفة". https://www.anthropic.com/news/claude-opus-5 ↩ ↩2 ↩3
-
Anthropic، "Claude Fable 5 and Claude Mythos 5"، تم الإعلان عنها في 9 يونيو 2026. https://www.anthropic.com/news/claude-fable-5-mythos-5 ↩
-
"OS-Marathon: Benchmarking Computer-Use Agents on Long-Horizon Repetitive Tasks." arXiv:2601.20650. https://arxiv.org/abs/2601.20650 ↩
-
"Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks." arXiv:2604.24964. https://arxiv.org/abs/2604.24964 ↩
-
"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading." arXiv:2607.08964. https://arxiv.org/abs/2607.08964 ↩

