OSWorld 2.0: أفضل وكلاء AI ينهون 20.6% فقط من المهام
٣١ يوليو ٢٠٢٦
يختبر OSWorld 2.0 عملاء AI في سير عمل يستغرق البشر 1.6 ساعة لإنجازه. وأنهى أفضل نموذج 20.6% منها — بعد أن حقق نتيجة 83.4% في إصدار OSWorld الأقدم.
يختبر OSWorld 2.0 عملاء AI في سير عمل يستغرق البشر 1.6 ساعة لإنجازه. وأنهى أفضل نموذج 20.6% منها — بعد أن حقق نتيجة 83.4% في إصدار OSWorld الأقدم.
حقق نموذج GPT-5.6 من OpenAI نتيجة قياسية جديدة في Agents' Last Exam، وهو واحد من أصعب اختبارات قياس أداء الوكلاء في مجال الذكاء الاصطناعي — وتظهر الأرقام مدى بعد هؤلاء الوكلاء عن القيام بعمل حقيقي.