معيار موثوقية وكلاء الذكاء الاصطناعي ٢٠٢٦: ٦٥٪ مرة واحدة، ٢٥٪ دائماً
٢٦ أغسطس ٢٠٢٦
ThinkingBox هو معيار جديد لقياس موثوقية وكلاء AI: حقق أفضل نموذج نسبة نجاح 65.36% في pass@1 ولكن 25.25% فقط في pass^20 عبر 507 مهمة لوكلاء أعمال ذوي حالة (stateful).
ThinkingBox هو معيار جديد لقياس موثوقية وكلاء AI: حقق أفضل نموذج نسبة نجاح 65.36% في pass@1 ولكن 25.25% فقط في pass^20 عبر 507 مهمة لوكلاء أعمال ذوي حالة (stateful).
حققت Muse Code من Meta مكاسب كبيرة في Terminal-Bench 2.1 مقارنة بـ Muse Spark 1.1 — ولكن أدوات الاختبار تغيرت أيضاً. إليكم ما تقوله لوحة المتصدرين الموثقة عن قيمة أدوات الاختبار.
قاست ثلاث أوراق بحثية في يوليو 2026 مدى موثوقية وكلاء AI: حيث أضافت حلقة التحقق 1.5 نقطة، واستعادت الحواجز الوقائية (guardrails) نسبة 19.9% من الإخفاقات، بينما لم تؤثر قواعد التلقين (prompt rules) تقريباً.
قم بتركيب OpenTelemetry في حلقة Claude Agent SDK داخل TypeScript: قم بتفعيل تصدير التتبع (trace export)، وقراءة شجرة spans الخاصة بـ claude_code، وإرسال spans حقيقية إلى backend.