Kimi K3 ضد Fable 5، وGPT-5.6، وGrok: اختبارات الأداء لعام 2026
Kimi K3 هو أول نموذج مفتوح من فئة 3T. شاهد كيف تقارن نتائج اختبارات إطلاق Moonshot مع Claude Fable 5 و GPT-5.6 Sol و Grok 4.5 و Gemini في عام 2026.
Kimi K3 هو أول نموذج مفتوح من فئة 3T. شاهد كيف تقارن نتائج اختبارات إطلاق Moonshot مع Claude Fable 5 و GPT-5.6 Sol و Grok 4.5 و Gemini في عام 2026.
صلح FrontierMath v2 الخاص بـ Epoch AI أخطاء في ٤٢٪ من المسائل في ١٢ يونيو ٢٠٢٦. إليكم إيه اللي باظ، وإزاي تم اكتشافه، وده معناه إيه بالنسبة للثقة في مقاييس أداء الذكاء الاصطناعي.
Gemini 3.5 Flash متاح دلوقتي بشكل عام (GA): موديل برمجة وكيل (agentic) بسعة 1 مليون توكن بسعر 1.50 دولار / 9 دولار لكل مليون توكن. شوف نتايج الاختبارات (benchmarks)، وتغييرات API، والأسعار، وهل المفروض تحول ليه.
نموذج GLM-5.1 من Z.ai هو أول نموذج مفتوح الأوزان يتصدر SWE-bench Pro بنسبة 58.4%، متفوقاً على GPT-5.4 ومبني بالكامل على رقائق Huawei. مرخص برخصة MIT ومجاني للنشر.
يتصدر Claude Opus 4.7 اختبار SWE-bench Pro بنسبة 64.3% واختبار OSWorld بنسبة 78.0%. تحليل كامل لاختبارات الأداء، والميزات الجديدة، والأسعار، وما الذي تغير عن Claude Opus 4.6.
مؤشر ستانفورد للذكاء الاصطناعي لعام 2026: الولايات المتحدة تتفوق على الصين بفارق 2.7 نقطة فقط على Arena، وتبني المؤسسات للذكاء الاصطناعي يصل إلى 88 بالمئة، والشفافية تنهار من 58 إلى 40.
- يقوم Kimi-K2 من Moonshot بهز عالم الذكاء الاصطناعي. بمقياس تريليونات من المعاملات ونتائج مذهلة، فهو يعيد تعريف البرمجة وبناء التطبيقات - دون تكلفة.