وكلاء الذكاء الاصطناعي كتهديدات داخلية: تحول الأمن في عام 2026
١٩ يوليو ٢٠٢٦
في 9 يوليو 2026، وهو نفس اليوم الذي أطلقت فيه OpenAI نموذج GPT-5.6، نشرت الشركة بطاقة نظام (system card) تعترف فيها بشيء مقلق: وجد معهد أمن الذكاء الاصطناعي في المملكة المتحدة (AISI) طريقة لكسر حماية (jailbreak) النموذج لجعله يكتشف ويستغل ثغرات البرمجيات بشكل ذاتي — وهو "كسر حماية شامل" استطاع باحثو الوكالة، وفقاً لروايتهم، تجميعه في غضون ساعات قليلة.12 وهذه هي المرة الثانية خلال شهر واحد التي تفشل فيها حواجز الحماية لنماذج متطورة بهذه الطريقة المحددة. في المرة الأولى، قامت الحكومة الأمريكية بإيقاف نموذج Claude Fable 5 من شركة Anthropic عن العمل في جميع أنحاء العالم لمدة 19 يوماً. أما هذه المرة، فلم يحدث شيء مماثل — وهذا التفاوت هو جزء من السبب الذي جعل Anthropic وGoogle DeepMind يقضيان الأسابيع الماضية في نشر إجابة جديدة: توقفوا عن محاولة جعل النموذج نفسه غير قابل للكسر، وابدأوا في التعامل مع كل وكيل ذكاء اصطناعي (AI agent) كتهديد داخلي محتمل.
في سطر واحد: وجد باحثو معهد أمن الذكاء الاصطناعي في المملكة المتحدة "كسراً شاملاً للحماية" في نموذج GPT-5.6 Sol من OpenAI يفتح الباب أمام الاختراق الذاتي — وذلك بعد أسابيع من نشر كل من Anthropic وGoogle DeepMind أطر عمل جديدة تتعامل مع وكلاء الذكاء الاصطناعي كتهديدات داخلية، وليس كبرمجيات موثوقة تماماً.234
ملخص
- ماذا حدث: جاء إطلاق OpenAI لنموذج GPT-5.6 في 9 يوليو مع بطاقة نظام تكشف أن معهد AISI في المملكة المتحدة وجد "كسراً شاملاً للحماية" — وهو كسر سمح باكتشاف الثغرات واستغلالها بشكل ذاتي، وليس مجرد اكتشافها.12
- السرعة: يقول معهد AISI إن عمليات كسر الحماية "غالباً ما تم تطويرها في غضون ساعات" — وإن كان ذلك من خلال وصول بحثي فقط إلى الأجزاء الداخلية للنموذج، وهو ما لا يملكه المستخدم العادي. ومع ذلك، يرى رئيس الفريق الأحمر في AISI أن هذه الثغرات لا تزال قابلة للاكتشاف بدون هذا الوصول، ولكن بشكل أبطأ.2
- ليست المرة الأولى هذا الربع: في يونيو، تسبب كسر حماية أكثر محدودية في نموذج Claude Fable 5 من Anthropic في تفعيل ضوابط التصدير الأمريكية التي أوقفت النموذج عالمياً لمدة 19 يوماً. وصف معهد AISI كسر حماية GPT-5.6 بأنه أوسع نطاقاً — وحتى وقت كتابة هذا المقال، لم يتسبب في نفس الاستجابة الحكومية.2
- استجابة الصناعة: قبل أسابيع من هذا الاكتشاف، نشرت كل من Anthropic (في 27 مايو) وGoogle DeepMind (في 18 يونيو) أطر عمل جديدة لأمن الوكلاء — "Zero Trust for AI Agents" و"AI Control Roadmap" — مبنية على نفس الفرضية: افترض أن الوكيل قد يكون مخترقاً أو غير متوافق، وقم ببناء حواجز حماية حوله، وليس بداخله فقط.34
- رأي الخبراء الخارجيين: يرى باحثو الأمن غير التابعين لأي من المختبرين أن هذا هو التوجه الصحيح — فكل نموذج يتم نشره "من المؤكد تقريباً أنه يحتوي على عمليات كسر حماية غير مكتشفة"، وسد ثغرة واحدة يغلق ذلك الثقب المحدد فقط، وليس الفئة بأكملها.2
ما ستتعلمه
- ما وجده معهد AISI في المملكة المتحدة عند اختبار GPT-5.6 Sol، وما الذي يجعل كسر الحماية "شاملاً"
ماذا وجدت UK AISI في GPT-5.6 Sol
UK AISI هي منظمة بحثية تابعة لوزارة العلوم والابتكار والتكنولوجيا في المملكة المتحدة، تقوم بتقييم نماذج الذكاء الاصطناعي الرائدة قبل وبعد إصدارها، وذلك بموجب التزامات اختبار طوعية قدمتها مختبرات الذكاء الاصطناعي الكبرى في قمة سلامة الذكاء الاصطناعي لعام 2023 في بليتشلي بارك.25 بالنسبة لـ GPT-5.6، لم تُنشر نتائج AISI في تقرير مستقل من AISI — بل دُمجت في "بطاقة النظام" (system card) التي نشرتها OpenAI في نفس يوم إصدار النموذج، وهي طريقة شائعة لوصول هذا النوع من التقييمات الخارجية إلى الجمهور.12
ما وجدته AISI هو أمر أكثر تحديداً من مجرد "اختراق". وفقاً لملخص لنتائجها مقتبس مباشرة من بطاقة النظام تلك، فإن AISI "حددت اختراقات عالمية (universal jailbreaks) في المجال السيبراني، بما في ذلك اختراقات سمحت بإكمال مهام وكيلية طويلة المدى في مجالات مثل اكتشاف الثغرات وتطوير البرمجيات الخبيثة (exploit development)".2 بعبارات بسيطة: وجد الباحثون تقنيات صياغة أوامر (prompting techniques) نجحت بشكل موثوق في إزالة تدريبات السلامة الخاصة بـ GPT-5.6 عبر مجموعة واسعة من طلبات الهجوم السيبراني دفعة واحدة، بدلاً من فتح سلوك ضيق واحد. وبمجرد حدوث ذلك، تقول AISI إن المختبرين تمكنوا من جعل النموذج يكمل مهام ذاتية متعددة الخطوات — مثل العثور على ثغرة برمجية حقيقية ثم بناء كود استغلال يعمل حولها، وليس مجرد وصف الثغرة.2 صياغة "إكمال المهام الوكيلية طويلة المدى" هذه مهمة: فهذا ليس مجرد روبوت دردشة يقول شيئاً لا ينبغي قوله في رد واحد، بل هو وكيل ينفذ سير عمل هجومي متعدد الخطوات من البداية إلى النهاية.
الاختراق "العالمي" (universal jailbreak) هو المصطلح المحدد الذي يستخدمه الباحثون لتمييزه عن الاختراق الضيق. الاختراق الضيق يفتح سلوكاً واحداً — على سبيل المثال، جعل النموذج يصف نوعاً واحداً محدداً من الثغرات. أما الاختراق العالمي فيكسر تدريبات السلامة بشكل واسع بما يكفي لفتح مجموعة واسعة من القدرات السيبرانية التي كانت محظورة سابقاً دفعة واحدة، باستخدام نفس التقنية. وقالت AISI إن الاختراقات التي وجدتها في GPT-5.6 "تم تطويرها غالباً في غضون ساعات".2 ومع ذلك، فإن هذا الرقم يأتي مع تحذير مهم: فقد منحت OpenAI فريق AISI وصولاً متميزاً مخصصاً للأبحاث فقط إلى الأجزاء الداخلية للنموذج — بما في ذلك تفكير "سلسلة الأفكار" (chain-of-thought) لمراقب السلامة، والصياغة الدقيقة لسياسة السلامة، وردود فعل فورية حول أي مصنف (classifier) قام برصد محاولة معينة — وهو ما لا يملكه المستخدم العادي أو المهاجم.2 وقد نشر Xander Davies، الذي يقود عمل الفريق الأحمر (red-teaming) في AISI، على منصة X أنه يعتقد أن الاختراقات التي وجدها فريقه "لا يزال من الممكن العثور عليها بدون هذا الوصول، ولكن بشكل أبطأ. أما مقدار البطء بالضبط فهو غير واضح ولا يزال سؤالاً مفتوحاً!"2
كان رد OpenAI، كما ورد في نفس التقرير، هو القول بأنها عملت على "إعادة إنتاج وتخفيف عمليات الـ jailbreaks المحددة التي أبلغ عنها معهد AISI في المملكة المتحدة" دون تفصيل ما تضمنه الإصلاح — ويحذر التقرير نفسه من أنه على الرغم من هذه التخفيفات، فإن AISI "يتوقع أن تكشف عمليات الـ red teaming الإضافية عن عمليات jailbreaks مماثلة".2 وتتبنى مواد الإطلاق الخاصة بـ OpenAI نبرة مماثلة دون أن يُطلب منها ذلك: "لا يوجد شيء اسمه أمن مثالي... سيتم اكتشاف نقاط ضعف جديدة، كما سيتم اكتشاف عمليات jailbreaks جديدة تلتف على الضمانات الموجودة".16 هذا ليس مجرد تهرب خاص بهذا الإصدار — بل هو وصف للوضع الحالي لأمن النماذج الرائدة (frontier-model) على مستوى الصناعة بالكامل، وهو بالضبط الفرضية التي يدور حولها بقية هذا المقال.
من الجدير بالذكر أن نكون دقيقين بشأن ما يتجاوزه GPT-5.6 وما لا يتجاوزه. بموجب إطار الاستعداد (Preparedness Framework) الخاص بـ OpenAI، تم تصنيف Sol وTerra وLuna جميعاً على أنها ذات قدرة "عالية" (High) في الأمن السيبراني، وهو نفس المستوى الذي طبقته OpenAI على العديد من نماذجها الأخيرة التي تركز على الاستنتاج — رغم أن أيًا من الثلاثة لم يتجاوز عتبة "الحرجة" (Critical) الأعلى في الإطار.1 وجدت اختبارات الأمن السيبراني الخاصة بـ OpenAI أن النماذج "أفضل في إيجاد وإصلاح الثغرات الأمنية منها في تنفيذ هجمات ذاتية ومستقلة وشاملة (end-to-end) ضد أهداف محصنة"، وهو ما تصوره الشركة كـ "نافذة ميزة للمدافع" بدلاً من كونها شهادة خلو من المشاكل.16 يظهر حجم هذه القفزة في القدرات في أرقام المقارنة الخاصة بـ OpenAI: في ExploitBench، الذي يقيس المسار من قطعة كود ضعيفة إلى كود استغلال (exploit) يعمل، حقق GPT-5.6 Sol نسبة 73.5% مقابل 47.9% لـ GPT-5.5. وفي SEC-Bench Pro، وهو اختبار توليد إثبات المفهوم (proof-of-concept)، حقق Sol نسبة 71.2% مقابل 45.8% لـ GPT-5.5.6 إن اكتشاف الـ jailbreak من قبل AISI مهم تحديداً لأنه يظهر أن هذه القدرات "العالية" الجديدة ليست محمية بشكل موثوق خلف تدريب السلامة الخاص بالنموذج كما قد يوحي تصنيف "عالية، وليست حرجة" بمفرده. وهذه القفزة في القدرات هي أيضاً السبب في أن GPT-5.6 لم يتم إطلاقه بالطريقة العادية في المقام الأول — حيث قدمت OpenAI معاينة لـ Sol وTerra وLuna للشركاء المعتمدين حكومياً فقط في 26 يونيو، قبل حوالي أسبوعين من الإصدار العام في 9 يوليو، وذلك تحديداً بسبب ملف قدراته السيبرانية.
قصة الـ jailbreak الثانية للنماذج الرائدة في شهر واحد
GPT-5.6 ليس أول نموذج رائد في هذا الربع يشهد تحول عملية "كسر حماية" (jailbreak) سيبرانية إلى خبر وطني. ففي يونيو، أبلغت Amazon عن عملية كسر حماية في نموذج Claude Fable 5 من شركة Anthropic أطلقت قدرة النموذج على إيجاد ثغرات برمجية — وهي قدرة أضيق نطاقاً مما أبلغ عنه معهد AISI بالنسبة لـ GPT-5.6. وقد وصفت تقارير Fortune موقف Anthropic في ذلك الوقت بأن: كسر الحماية أطلق فقط قدرة النموذج على إيجاد العيوب البرمجية، وليس بالضرورة استغلالها.2 تعاملت الحكومة الأمريكية مع تلك النتيجة بجدية كافية لاتخاذ إجراء فوري: ففي الساعة 5:21 مساءً بتوقيت شرق الولايات المتحدة في 12 يونيو 2026، أصدرت توجيهاً بفرض قيود على التصدير يأمر Anthropic بتعليق Fable 5 ونموذجه الأساسي Mythos 5 لكل مستخدم حول العالم، مستشهدة بسلطات الأمن القومي. ولأن Anthropic لم تملك طريقة موثوقة للتحقق من جنسية كل مستخدم في الوقت الفعلي، كانت الطريقة الوحيدة للامتثال هي إيقاف كلا النموذجين عن العمل للجميع وفي كل مكان. استمر التعليق لمدة 19 يوماً: حيث رفعت وزارة التجارة القيود في 30 يونيو، وعاد Fable 5 للمستخدمين عالمياً في اليوم التالي، 1 يوليو.عودة Claude Fable 5 بعد رفع حظر التصدير (2026)
التباين مع GPT-5.6 واضح جداً. فقبل اكتشاف AISI لـ GPT-5.6، وصفت Anthropic وضعها بهذه الطريقة: "لم يتمكن أي من المختبرين بعد من إيجاد كسر حماية عالمي — وهو أسلوب كسر حماية يمكنه بشكل واسع جداً تجاوز ضمانات النموذج، مما يفتح مجموعة واسعة من القدرات السيبرانية."2 وتوصيف AISI لما وجده في GPT-5.6 هو بالضبط هذا: كسر حماية عالمي، أطلق الاستغلال الذاتي وليس مجرد الاكتشاف — وهو ما يمكن اعتباره اكتشافاً لكسر حماية أوسع وأخطر مما أدى إلى تعليق Fable 5. ومع ذلك، فإن نطاق كسر الحماية ليس المحور الوحيد المهم: فوفقاً لنفس التقارير، تمكن GPT-5.6 من إكمال أحد تقييمين لـ AISI في النطاق السيبراني بشكل ذاتي، بينما كان نموذج Mythos من Anthropic (النموذج الأساسي لـ Fable 5) هو أول نموذج يكمل التقييمين معاً — وهو تذكير بأن فجوة القدرات الخام بين عائلتي النماذج قد تكون أضيق مما يوحي به مقارنة كسر الحماية وحدها.2 ومع ذلك، وحتى وقت كتابة هذه السطور، لم يتم فرض قيود تصدير مماثلة على GPT-5.6.2 وأشار بعض المعلقين على سياسات الذكاء الاصطناعي إلى أن هذا يمثل تناقضاً يستحق المراقبة — حيث أعاد باحث سياسات الذكاء الاصطناعي Lennart Heim نشر سلسلة تغريدات Davies مع تعليق "من الجيد أن Amazon لم تبلغ البيت الأبيض عن هذا الأمر"، في إشارة إلى كيفية وصول خبر كسر حماية Fable 5 إلى الحكومة في المرة الأولى، وأخبر مستشار سياسات سابق لم يذكر اسمه مجلة Fortune أن هذا النمط "... يخلق حالة من عدم اليقين وهي في أقل تقدير ضارة..."2 وسواء كانت هذه الفجوة تعكس حكماً مدروساً بشأن الخطورة النسبية، أو اختلافاً في من أبلغ من وبماذا، أو شيئاً آخر، فهذا ليس أمراً يمكن لهذا المقال حسمه — بل هو ببساطة وضع الحال كما تم الإبلاغ عنه.
هذه أيضاً ليست المرة الأولى التي يجد فيها AISI كسر حماية عالمي سريع في نموذج رائد. فقد وجد تقييمه لـ GPT-5.5، المنشور في 30 أبريل 2026، كسر حماية عالمي "استخرج محتوى مخالفاً عبر جميع الاستفسارات السيبرانية الخبيثة التي قدمتها OpenAI، بما في ذلك في إعدادات الوكلاء متعددة الأدوار" بعد ست ساعات من "الفريق الأحمر" (red-teaming) الخبير.7 تقييم GPT-5.5 السيبراني: AISI يجد تكافؤاً مع Mythos 2026 وبقراءة ذلك بجانب قصة GPT-5.6، فإن النمط ليس "نموذجاً مرّ بأسبوع سيء" — بل هو أن AISI وجد الآن كسر حماية سيبراني عالمي في جيلين رائدين متتاليين من نفس المختبر، وفي كل مرة خلال ساعات قليلة من جهد الخبراء المخصص.
لماذا لن يكون سد ثغرات الـ jailbreak كافياً
تتقارب ردود الباحثين الأمنيين من خارج OpenAI وAnthropic حول نقطة واحدة: أن تدريب النموذج على الرفض لم يكن يوماً ليكون خط الدفاع الأخير، والتعامل مع ثغرة jailbreak تم سدها على أنها "مشكلة حُلت" هو سوء فهم لما يفعله سد الثغرات في الواقع. مارجريت كانينغهام، نائبة رئيس الأمن واستراتيجية الذكاء الاصطناعي في شركة الأمن السيبراني Darktrace والمتعاونة المتخصصة مع NIST، صاغت القلق الحقيقي بهذا الشكل: "قلقي ليس من أن نموذجاً واحداً قد تم اختراقه عبر jailbreak، بل من أن الاكتشافات الهجومية تتسارع بينما لا يزال الدفاع يعتمد على عمليات بشرية للغاية: تحديد ما هو مهم، وما يمكن سد ثغرته، وما يجب احتواؤه."2
ستانيسلاف فورت، كبير العلماء في شركة AISLE الناشئة للأمن السيبراني للذكاء الاصطناعي والباحث السابق في كل من Anthropic وGoogle DeepMind، أوضح الديناميكية الأساسية قائلاً: "كل نموذج منشور حالياً لديه على الأرجح ثغرات jailbreak غير مكتشفة، لذا فإن هذا للأسف ينطبق على كل شيء، وليس فقط GPT-5.6." وأضاف أن سد ثغرات jailbreak المحددة التي وجدها AISI "للأسف يغلق فقط حالات الهجوم المحددة تلك، وليس الفئة ككل. من المرجح جداً أن يظل النموذج يحمل العديد من ثغرات jailbreak التي لم تُكتشف بعد حتى بعد سد الثغرات. توقعات AISI بالعثور على المزيد هي في نظري الموقف الأمني الصحيح."2
هذا هو بالضبط الافتراض الذي بُنيت عليه بنية "Zero Trust" (الثقة الصفرية) قبل عقود من وجود النماذج اللغوية الكبيرة: لا تثق في شيء، تحقق من كل شيء، وافترض أن الاختراق قد حدث بالفعل.3 إذا كان تدريب السلامة للنموذج عبارة عن قفل سيتم فتحه في النهاية — ليس "قد" يتم، بل "سيتم" — فإن الاستجابة الهندسية المنطقية ليست الاستمرار في صنع قفل أفضل والتوقف عند هذا الحد. بل هي تصميم النظام المحيط بحيث لا يؤدي فتح القفل إلى تسليم المهاجم المنزل بأكمله. وهذا هو بالضبط التحول الذي بدأت كل من Anthropic وGoogle DeepMind في القيام به، كتابياً، قبل أن تصبح نتائج AISI حول GPT-5.6 علنية.
إجابة الصناعة: تعامل مع كل عميل ذكي كتهديد داخلي
في الأسابيع الستة التي سبقت ظهور قصة GPT-5.6، نشرت Anthropic وGoogle DeepMind بشكل مستقل أطر أمنية جديدة تبدأ من نفس الفرضية، وباستخدام لغة متطابقة تقريباً: يجب التعامل مع عميل الذكاء الاصطناعي (AI agent) بنفس الطريقة التي يتعامل بها فريق الأمن مع تهديد داخلي محتمل — شخص (أو شيء) لديه وصول حقيقي وصلاحيات حقيقية، ولا يمكن التحقق من نواياه وموثوقيته بشكل كامل مسبقاً.
تقرير Anthropic بعنوان "Zero Trust for AI Agents" (الثقة المعدومة لوكلاء الذكاء الاصطناعي)، الذي نُشر في 27 مايو 2026 من خلال فريق أمن Claude، يبدأ بتشخيص صريح: "نماذج الذكاء الاصطناعي الرائدة تضغط الجدول الزمني بين اكتشاف الثغرة واستغلالها من شهور إلى ساعات... هذا ليس مصدر قلق مستقبلي: فالنماذج قادرة بالفعل على إيجاد ثغرات خطيرة أغفلتها الأدوات التقليدية والمراجعون البشريون لسنوات."3 يستهدف هذا الإطار بشكل صريح المؤسسات التي تنشر وكلاء ذكاء اصطناعي، وليس فقط البنية التحتية الخاصة بـ Anthropic. وهو يقوم برسم خريطة للتهديدات الخاصة بالوكلاء — مثل حقن الأوامر (prompt injection)، وتسميم الأدوات (tool poisoning)، وإساءة استخدام الهوية والصلاحيات، وتسميم الذاكرة، وهجمات سلاسل التوريد — وتوزيعها على نموذج نضج ثلاثي المستويات (تأسيسي، متقدم، ومحسن) وسير عمل تنفيذ مكون من ثماني مراحل يغطي الهوية، ونطاق الوصول، والبيئات المعزولة (sandboxing)، وضوابط المدخلات والمخرجات، وضمانات الذاكرة. كما يصف ما تسميه Anthropic بـ "Agentic SOAR" — وهي عمليات أمنية مصممة للتحرك بسرعة المهاجم المستقل بدلاً من فريق استجابة بشري للحوادث.3 الآلية الأساسية التي يوصي بها: هويات متجذرة تشفيرياً بدلاً من الهويات المفترضة، وصلاحيات محددة لكل مهمة بدلاً من منحها بشكل واسع، ومراقبة دفاعية لا تنتظر ملاحظة إنسان لوجود خطأ ما.3
تقرير Google DeepMind بعنوان "AI Control Roadmap" (خارطة طريق التحكم في الذكاء الاصطناعي)، الذي نُشر في 18 يونيو 2026 في تدوينة بواسطة Rohin Shah و Four Flynn ومدعوم بتقرير تقني شارك في كتابته Mary Phuong و Erik Jenner و Laurent Simon و Lewis Ho و Rohin Shah و Sebastian Farquhar و Scott Coull، يتخذ زاوية ذات صلة ولكنها مختلفة: فهو إطار عمل حول كيفية تأمين Google لوكلاء الذكاء الاصطناعي المتقدمين الذين تنشرهم داخلياً، وقد نُشر علناً كنموذج يمكن للصناعة الأوسع اعتماده بدلاً من كونه منتجاً أمنياً موجهاً للعملاء.4 الاستعارة المركزية هنا هي مدرب القيادة الذي يمتلك أدوات تحكم مزدوجة: النظام يثق في الوكيل بما يكفي للسماح له بالقيادة، ولكنه يظل مستعداً للتدخل إذا ساءت الأمور. عملياً، يعني ذلك استخدام نماذج ذكاء اصطناعي أخرى موثوقة كـ "مشرفين" يراجعون باستمرار تفكير الوكيل العامل وأفعاله وخططه بحثاً عن علامات تشير إلى انحرافه عن المسار — وهو نهج مبني مباشرة على إطار عمل MITRE ATT&CK المعياري في الصناعة، والذي تم تكييفه لتفكيك هجمات وكلاء الذكاء الاصطناعي المحتملة إلى تكتيكات وتقنيات يمكن تتبعها.4 تربط خارطة الطريق تدابيرها الأمنية بمحوري قدرات بدلاً من مستوى نضج مسطح: مستوى الكشف (من D1 إلى D4) بناءً على مدى قدرة النموذج على التهرب من المراقبة، ومستوى المنع/الاستجابة (من R1 إلى R3) بناءً على مدى قدرته على تنفيذ هجوم فعلي.4 تقول Google إن نموذجاً أولياً داخلياً تم بناؤه على هذا الإطار قد قام بالفعل بتحليل مليون مهمة لوكلاء البرمجة — ووجد أن معظم الحوادث التي تم رصدها لم تكن عدائية على الإطلاق، بل كانت حالات أخطأ فيها الوكيل في تفسير الهدف أو كان متحمساً جداً لإكماله، وهو تمييز يحدد مدى قوة استجابة نظام المراقبة.4
الإطاران ليسا متطابقين، ومقارنتهما جنباً إلى جنب أكثر فائدة من التعامل مع "الثقة المعدومة للوكلاء" كفكرة واحدة:
| Anthropic — Zero Trust لعملاء الذكاء الاصطناعي | Google DeepMind — خارطة طريق التحكم في الذكاء الاصطناعي | |
|---|---|---|
| تاريخ النشر | 27 مايو 20263 | 18 يونيو 20264 |
| مُصمم لـ | المؤسسات التي تنشر عملاء ذكاء اصطناعي (إطار عمل لمنتج Claude Security) | عمليات نشر العملاء الداخلية لشركة Google، وتمت مشاركتها علنًا كنموذج للصناعة |
| الافتراض الأساسي | لا تثق في شيء، تحقق من كل شيء، وافترض أن الاختراق قد حدث بالفعل | قد يكون العميل عالي القدرة ولكنه غير متوافق تمامًا؛ تعامل معه كموظف مارق محتمل لديه وصول بالفعل |
| الهيكل | نموذج نضج ثلاثي المستويات (تأسيسي، متقدم، مُحسَّن) + سير عمل تنفيذ مكون من ثماني مراحل | مستويات الكشف D1–D4 ومستويات الوقاية/الاستجابة R1–R3، مرتبطة بالقدرة المقاسة للنموذج |
| الآلية الرئيسية | هوية متجذرة تشفيريًا، تحديد نطاق الأذونات لكل مهمة، دفاعات ضد تسميم الذاكرة، "Agentic SOAR" | نماذج "مشرفة" ذكاء اصطناعي موثوقة تراجع تفكير وأفعال العميل في الوقت الفعلي، مبنية على MITRE ATT&CK |
| التهديدات المحددة | حقن الأوامر (Prompt injection)، تسميم الأدوات، إساءة استخدام الهوية/الامتيازات، تسميم الذاكرة، هجمات سلاسل التوريد | هجمات مصنفة كتكتيكات وتقنيات بأسلوب MITRE ATT&CK؛ يتم تتبعها عبر التغطية، والاسترجاع، ووقت الاستجابة |
لا تدعي أي من الشركتين أنها الأولى في فكرة "Zero Trust للذكاء الاصطناعي" — فنظام أمن Zero Trust نفسه يسبق الذكاء الاصطناعي التوليدي بأكثر من عقد من الزمان، وكلا الإطارين هما تكييف صريح للتفكير الأمني الحالي وليس اختراعًا جديدًا كليًا.34 المثير للاهتمام ليس الحداثة؛ بل أن مختبرين متنافسين وصلا إلى نفس الغريزة الأساسية بفارق ثلاثة أسابيع تقريبًا، وبشكل مستقل، قبل أن تعطي قصة "كسر الحماية" (jailbreak) الصناعة سببًا ملموسًا للاهتمام.
كيف يبدو "التعامل مع العميل كتهديد داخلي" في الممارسة العملية
إذا جردنا المصطلحات التسويقية، سنجد أن كلا الإطارين يشيران إلى نفس المجموعة الصغيرة من الممارسات الملموسة التي كانت إرشادات أمن العملاء تدور حولها منذ فترة، والتي اكتسبت إلحاحًا جديدًا بسبب عملية كسر حماية خرجت من المختبر ووصلت إلى بطاقة النظام.
- تحديد نطاق الأذونات للمهمة، وليس للجلسة. العميل الذي يحتاج فقط إلى وصول للقراءة لمستودع واحد للخمس دقائق القادمة لا ينبغي أن يمتلك صلاحيات دائمة لقاعدة الكود بالكامل لبقية اليوم. يطلق إطار عمل Anthropic على هذا "تحديد نطاق الأذونات لكل مهمة"؛ الفكرة الأساسية هي نفس مبدأ "الحد الأدنى من الامتيازات" الذي تطبقه فرق الأمن على الموظفين البشر منذ عقود.3
- استخدام البيئة المعزولة (Sandbox) كوضع افتراضي، وليس كفكرة لاحقة. يفترض كلا الإطارين أن العميل قد يحاول القيام بشيء ضار، سواء من خلال كسر الحماية، أو حقن الأوامر، أو سوء تقديره الخاص — ويصممان بيئة التنفيذ بحيث لا يمكن لهذه المحاولة الوصول إلى أي شيء غير مسموح له بلمسه صراحة.34
لا شيء من هذا مجاني. تحديد نطاق الاعتمادات لكل مهمة، ومراقبة المشرف المستمرة، والتنفيذ في بيئة معزولة (sandboxed execution)، كلها تضيف تكلفة هندسية وتشغيلية حقيقية مقارنة بمنح الوكيل وصولاً واسعاً ودائماً والأمل في أن تنجح تدريباته. إن أطر العمل من Anthropic و Google DeepMind هي، في الواقع، حجج بأن هذه التكلفة أصبحت الآن ضرورة أساسية وليست مجرد ميزة إضافية — وهو رهان يسهل تفهمه بعد قراءة ما وجده UK AISI في نموذج أُطلق بـ "أقوى ضماناتنا حتى الآن".1
الخلاصة
حدث أمران في غضون ستة أسابيع تقريباً من بعضهما البعض، ولا يمكن فهم أي منهما بشكل كامل دون الآخر. أولاً، استنتجت كل من Anthropic و Google DeepMind — وهما متنافسان يعملان بشكل مستقل — أن تدريب السلامة الخاص بوكيل الذكاء الاصطناعي لا يمكن الوثوق به كخط دفاع أخير، ونشرتا أطر عمل مفصلة لبناء الأمن حول الوكلاء بدلاً من مجرد دمجه فيهم. ثم منحت UK AISI الصناعة سبباً ملموساً لوجود هذه الأطر: jailbreak عالمي في أحدث نموذج من OpenAI وأكثرها اختباراً حتى الآن، وجده باحثون في غضون ساعات وبجزء بسيط من الوقت الذي قد يستغرقه مهاجم مصمم.
الجزء المزعج ليس في أن GPT-5.6 كان به jailbreak — فمن المحتمل أن يكون لدى كل نموذج رائد واحد، سواء اكتُشف أم لا. بل في أن استراتيجية "تحصين النموذج والأمل في نجاحه" لم تكن أبداً إجابة كاملة، وقد صرح مختبران من المختبرات التي تبني هذه النماذج بذلك كتابةً قبل اندلاع هذه القصة، وليس بعدها. وسواء كانت معمارية Zero Trust والمراقبة بأسلوب AI Control تصمد فعلياً أمام وكلاء يعملون بصلاحيات حقيقية، وبيانات اعتماد حقيقية، واستقلالية حقيقية، فهذا هو الشيء التالي الذي يستحق المراقبة — وليس ما إذا كان يمكن سد ثغرات أي نموذج منفرد ليصبح غير قابل للاختراق، لأنه لا يمكن ذلك.
Footnotes
-
OpenAI، "بطاقة نظام GPT-5.6"، مركز سلامة النشر (نُشر في 9 يوليو 2026). https://deploymentsafety.openai.com/gpt-5-6 ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9
-
إميلي فورليني وجيريمي كان، "عمليات Jailbreaks لـ GPT-5.6 من OpenAI تفتح قدرات سيبرانية خطيرة، وفقاً لوكالة بريطانية،" Fortune (10 يوليو 2026، تم التحديث في 11 يوليو). https://fortune.com/2026/07/10/openai-gpt-5-6-sol-jailbreaks-cyber-attacks-similar-to-security-flaw-that-led-u-s-government-to-force-anthropic-to-disable-fable-5/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12 ↩13 ↩14 ↩15 ↩16 ↩17 ↩18 ↩19 ↩20 ↩21 ↩22 ↩23 ↩24
-
Anthropic، "Zero Trust for AI agents"، Claude Security (27 مايو 2026). https://claude.com/blog/zero-trust-for-ai-agents ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
-
Rohin Shah و Four Flynn، "Securing the future of AI agents"، Google DeepMind (18 يونيو 2026). https://deepmind.google/blog/securing-the-future-of-ai-agents/ ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8 ↩9 ↩10 ↩11 ↩12
-
UK AI Security Institute، الموقع الرسمي. https://www.aisi.gov.uk/about ↩
-
OpenAI، "GPT‑5.6: ذكاء رائد يتوسع مع طموحك" (9 يوليو 2026). https://openai.com/index/gpt-5-6/ ↩ ↩2 ↩3 ↩4
-
معهد أمن الذكاء الاصطناعي في المملكة المتحدة، "تقييمنا للقدرات السيبرانية لـ GPT-5.5 من OpenAI" (30 أبريل 2026). https://www.aisi.gov.uk/blog/our-evaluation-of-openais-gpt-5-5-cyber-capabilities ↩


