🎙️ حلقة 34006:36٣١ يوليو ٢٠٢٦

OSWorld 2.0: أفضل وكلاء AI ينهون 20.6% فقط من المهام

استمع إلى هذه الحلقة

مناقشة من إنشاء الذكاء الاصطناعي بواسطة أليكس وجيمي

عن هذه الحلقة

انضم إلى المضيفين أليكس وجيمي في هذه الحلقة من البودكاست الذكي الخاص بـ Nerd Level Tech بينما يحللون النتائج المثيرة لـ OSWorld 2.0، وهو أحدث مقياس أداء يتحدى وكلاء AI بمهام معقدة من العالم الحقيقي. اكتشف لماذا تعاني حتى النماذج الأعلى أداءً مثل Claude Opus 4.8 و GPT-5.5 في إكمال سير العمل الطويل، وما يكشفه ذلك عن قدرات —ومحدودية— AI في البيئات المهنية. استمع إلى مناقشة حيوية تمزج بين الرؤى التقنية ولمسة من الفكاهة!

النص المكتوب

[أليكس]: أهلاً بكم من جديد في البودكاست الذكي من نيرد ليفل تك، بودكاست منطقتكم الودود حيث تلتقي معايير قياس الذكاء الاصطناعي بثقافة الميمز، وما زلنا لا نستطيع منع ثلاجتنا الذكية من إرسال رسائل مزعجة لنا.

[جيمي]: أهلاً بالجميع! أنا جيمي، مساعدكم التقني المرتبك قليلاً ولكن المتحمس جداً. وكما هو الحال دائماً، يجلس أمامي -افتراضياً بالطبع- أليكس، خبير الأكواد المقيم لدينا ومبسط كل الأمور المعقدة.

[أليكس]: هذا صحيح. اليوم سنغوص في أحدث مواجهة لوكلاء الذكاء الاصطناعي: OSWorld 2.0. تنبيه بحرق الأحداث - البوتات تعاني، ولكن ليس بالطريقة التي قد تعتقدونها.

[جيمي]: نعم، رأيت العنوان وفكرت، "انتظر، 20.6 بالمائة فقط؟ هل جربوا إطفاء الجهاز وتشغيله مرة أخرى؟"

[أليكس]: فكرة مغرية، لكن الأمر هنا أعمق قليلاً. OSWorld 2.0 هو المعيار الجديد في الساحة، حيث يقيس مدى قدرة وكلاء الذكاء الاصطناعي على التعامل مع سير عمل حقيقي ومهني على الكمبيوتر - فكر في نوع المهام التي تستغرق من الإنسان حوالي ساعة ونصف، وليس مجرد النقر على الأزرار أو ملء نموذج واحد.

[جيمي]: يعني، ليس مجرد "افتح الآلة الحاسبة وقم بعمليات حسابية"، بل فعلياً، مثل تسوية تقارير المصروفات، أو تقديم طلبات استرداد الأموال، أو بناء نموذج CAD من الصفر؟

[أليكس]: بالضبط! لقد صمموا 108 من سير العمل الطويلة والمعقدة هذه - والتي تشمل مجالات الأعمال، والإبداع، والهندسة، والرعاية الصحية، وكل ما يخطر ببالك. والجزء المذهل هنا هو: أفضل وكلاء الذكاء الاصطناعي، مثل Claude Opus 4.8 و GPT-5.5، أنهوا ما يزيد قليلاً عن 20 بالمائة منها بشكل كامل، من البداية إلى النهاية.

[جيمي]: انتظر، ألم تنجح هذه النماذج نفسها في المعيار السابق؟ ألم تكن النسبة، حوالي 80-شيء بالمائة؟

[أليكس]: ذاكرة جيدة. في OSWorld القديم - لنسمه OSWorld 1.0 - كانت أفضل الوكلاء تحقق درجات في الثمانينات. لكن هنا تكمن الخدعة: تلك المهام كانت أقصر بكثير. مثلاً، 30 خطوة أو أقل. أما الإصدار 2.0 فيمدد كل مهمة لتصل إلى 250 خطوة في المتوسط. فكر في الأمر كالجري في سباق سريع مقابل ماراثون.

[جيمي]: إذاً، الذكاء الاصطناعي يغمى عليه أساساً في منتصف الطريق الطويل؟

[أليكس]: تقريباً. هناك حتى ما يسمى "جدار الأفق" - وهي نقطة تنهار عندها معدلات الإكمال تماماً. إذا استغرقت المهمة أكثر من ساعتين تقريباً، فلا يمكن لأي من الوكلاء الحاليين إنهاءها.

[جيمي]: مؤلم. إذاً ما الذي يعيقهم؟ هل هو مثلاً عدم قدرتهم على النقر على الأزرار الصحيحة، أم أن هناك شيئاً أكثر خبثاً؟

[أليكس]: سؤال رائع. الأمر لا يتعلق بمهارات الكمبيوتر الأساسية. تقول الورقة البحثية إن المشكلة ليست في التحكم في واجهة المستخدم الرسومية GUI أو البرمجة. المشكلة الحقيقية هي "إدارة الحالة" (state management) - فهم يفقدون تتبع ما تغير، ينسون القيود، يتجاهلون معلومات جديدة تظهر في منتصف الطريق، أو يتكاسلون عن مراجعة عملهم.

[جيمي]: يعني هم أساساً مثلي وأنا أحاول اتباع وصفة طعام بينما أشاهد YouTube وأرد على رسائل Slack. أبدأ بقوة، ثم أنسى ما إذا كنت قد أضفت الملح أم لا.

[أليكس]: [يضحك] بالضبط! هذه المهام "طويلة الأفق" تجبر الوكلاء على التوفيق بين مصادر متعددة، ومتابعة المتطلبات المتغيرة، وتذكر ما هو ذو صلة في كل خطوة. وهنا تنهار الأمور.

[جيمي]: أي أمثلة؟ مثلاً، كيف يخطئ الوكيل فعلياً في منتصف المهمة؟

[أليكس]: بالتأكيد. كان أحد الوكلاء يجمع أمر شراء من محادثات الفريق وجداول البيانات. وفي منتصف المهمة، وصل موافقة متأخرة. لاحظ الوكيل ذلك، وسجلها كاستثناء، لكنه استمر في العمل بناءً على جدول البيانات القديم وغير المحدث. لقد قام أساساً بالتحقق من مستند يفتقد الموافقة الجديدة - لذا فهو "راجع عمله"، لكن العمل نفسه خاطئ.

[جيمي]: إذاً، هم جيدون في اتباع التعليمات - حتى تتغير التعليمات، وعندها يصبح الوضع "لا لا لا، أنا لا أسمعك!" [توقف] أوه، وأراهن أنه كلما زادت الخطوات، زادت فرص الخروج عن المسار.

[أليكس]: بالضبط. والبيانات تدعم ذلك. بالنسبة للمهام التي تستغرق أقل من 45 دقيقة، يؤدي أفضل الوكلاء بشكل جيد. ومعما يصبح سير العمل أطول، تهبط معدلات الإكمال بشكل حاد. وبحلول الوقت الذي تصل فيه إلى ساعتين أو ثلاث، لا أحد ينهي المهمة.

[جيمي]: وماذا عن تلك الدرجات الجزئية؟ رأيت بعض الموردين يتفاخرون بأرقام أعلى بكثير.

[أليكس]: آه، نعم - جدلية "الدرجات الجزئية" الكبرى. OSWorld 2.0 يعطي درجتين: معدل إكمال ثنائي - هل أنهيت الوظيفة كاملة؟ - ودرجة جزئية، تتبع التقدم عند نقاط تفتيش على طول الطريق. يميل الموردون إلى ذكر الدرجة الجزئية الأعلى، والتي تبدو أفضل - مثل "انظري يا أمي، لقد حصلت على 62!". لكن الواقع هو أنه لا أحد ينهي فعلياً أكثر من 20 بالمائة من سير العمل هذه.

[جيمي]: إذاً، الأمر يشبه قول "لقد نظفت 60 بالمائة من غرفتي!" ولكن الملابس المتسخة لا تزال على الأرض ولم ترتب السرير أبداً.

[أليكس]: [يضحك] تقريباً. الدرجات الجزئية حقيقية - فالوكلاء يحققون تقدماً ملموساً - ولكن الكثير منهم يتوقفون قبل خط النهاية.

[جيمي]: أي مفاجآت أخرى في قائمة المتصدرين؟ هل هناك من يكتسح الأمر بنموذج سري؟

[أليكس]: حتى أواخر يوليو، لا تزال أفضل نتيجة مؤكدة هي Claude Opus 4.8 بنسبة 20.6 بالمائة. هناك بعض النماذج الجديدة - مثل GPT-5.6 و Claude Opus 5 - التي تدعي الحصول على درجات جزئية أعلى، لكن أرقام "الإكمال الكامل" الخاصة بها لم يتم التحقق منها بشكل مستقل بعد. وحقيقة ممتعة، بعض النماذج تؤدي بشكل أفضل عندما يُسمح لها بتجميع استدعاءات الأدوات (batch tool calls)، لكن نماذج أخرى، مثل GPT-5.5، لا تستفيد شيئاً من زيادة الخطوات أو الـ tokens. كفاءة عالية جداً، لكنها لا تترجم إلى عمليات إكمال أكثر.

[جيمي]: إذاً، نحن لا ننظر إلى قفزة مفاجئة في القوى الخارقة للذكاء الاصطناعي - مجرد بعض ألعاب الأرقام الذكية وربما القليل من سحر التسويق.

[أليكس]: أصبت. إذا كنت تبني أو تنشر وكلاء ذكاء اصطناعي يعملون لفترات طويلة، فإن OSWorld 2.0 هو بمثابة مواجهة مع الواقع. الجزء الصعب ليس النقر هنا وهناك - بل هو تتبع الصورة الكبيرة بينما تمتد المهام. عنق زجاجة الذاكرة حقيقي.

[جيمي]: إذاً، في الوقت الحالي، إذا بدأ مساعدك الذكي مشروعاً كبيراً، ربما لا تبتعد كثيراً عن زر "التراجع" (undo)؟

[أليكس]: [يضحك] بالضبط. أو على الأقل، توقع أن تساعدهم في الوصول إلى خط النهاية.

[جيمي]: حسناً، وصلنا إلى نهاية غوصنا العميق اليوم في OSWorld 2.0. شكراً جزيلاً لاستماعكم إلى البودكاست الذكي من نيرد ليفل تك! إذا أنهى وكيلكم أكثر من 20 بالمائة من قائمة مهامه، فأنتم رسمياً سابقون لعصركم.

[أليكس]: وإذا استمتعتم بالحلقة - أو كانت لديكم قصصكم الخاصة عن فشل إدارة الحالة في الذكاء الاصطناعي - أرسلوا لنا ملاحظة أو شاركوا البودكاست مع أصدقائكم التقنيين المفضلين. حتى المرة القادمة، حافظوا على تركيز وكلائكم وسير عملكم قابلاً للإدارة!

[جيمي]: إلى اللقاء يا نيرديز! [تتلاشى موسيقى الخاتمة]