TL؛ DR
تقوم أدوات فريق الهجوم الأحمر للذكاء الاصطناعي بمهاجمة النموذج من خلال نقطة النهاية الخاصة به: عمليات اختراق الحماية، والحقن الفوري، واستخراج البيانات، والإخراج غير الآمن. إنهم بارعون في ذلك، ومجموعة البرامج مفتوحة المصدر ناضجة بالفعل. لكن ما لا يرونه هو الطبقة التي تحدد مدى انتشار الهجوم الناجح.
- تختبر الأدوات السلوك. أرسل مدخلات معادية، وقيّم الاستجابة، وكرر العملية. هذا يجيب على سؤال "هل يمكن إقناع هذا النموذج بشيء لا ينبغي له قوله؟".
- يقع نطاق الانفجار في مكان آخر. في ملف المهارات، وملف القواعد، وتكوين خادم MCP، ونطاق الأداة، وبيانات الاعتماد التي يعمل بها الوكيل. لا يمكن الوصول إلى أي من ذلك من نقطة النهاية.
- تقرير الفريق الأحمر النظيف وعميل يتمتع بامتيازات مفرطة يتعايشان بشكل مريح. رفض النموذج. ولا يزال لدى الوكيل صلاحية الكتابة التي لم يكن بحاجة إليها.
- قم بتشغيل كليهما. فرق الذكاء الاصطناعي الهجومية لتحليل السلوك والأصول والتكوين بهدف الوصول إلى الهدف. أما النصف الثاني فهو ما لم تبدأه معظم الفرق بعد.
لماذا لم يعد استخدام الذكاء الاصطناعي في فرق الاختبار الأحمر أمراً اختيارياً؟
قبل عامين، كان اختبار نموذج اللغة باستخدام أساليب الخصومة نشاطًا بحثيًا. أما في عام 2026، فقد أصبح بوابةً للإطلاق.
إنّ وظيفة الإلزام تنظيمية بقدر ما هي تقنية: إذ يُلزم قانون الذكاء الاصطناعي في الاتحاد الأوروبي بإجراء اختبارات معادية ضمن نظام إدارة المخاطر لأنظمة الذكاء الاصطناعي عالية المخاطر، ما يحوّل فرق الاختبار الأحمر من ممارسة جيدة إلى دليل يجب تقديمه. وقد نضجت الأدوات بسرعة كافية لتلبية هذا المطلب. وتقوم حزمة البرامج مفتوحة المصدر الآن بمعظم ما كانت تتقاضى مقابله شركات الاستشارات الهجومية قبل عامين.
المشكلة ليست في ضعف أدوات الذكاء الاصطناعي المستخدمة في فرق الاختراق، بل في أن هذه الفئة تجيب على سؤال واحد بشكل جيد، بينما تفترض الفرق أنها أجابت على سؤال آخر لم تتطرق إليه مطلقاً.
ما هي أدوات فريق الهجوم الأحمر التي تعمل بالذكاء الاصطناعي؟
لقد تبلور المشهد حول عدد قليل من المشاريع التي يتم نشرها بالفعل.
| أداة | الشكل | الأفضل في |
|---|---|---|
| غاراك (إنفيديا، أباتشي 2.0) | ماسح ثغرات أمنية يعمل عبر سطر الأوامر، مع أكثر من 120 وحدة فحص. | تغطية استكشافية واسعة النطاق مقابل نقطة نهاية نموذج تم نشرها |
| PyRIT (مايكروسوفت، معهد ماساتشوستس للتكنولوجيا) | إطار عمل تنسيق بايثون، متعدد الأدوار | سلاسل هجوم تكيفية مخصصة تحاكي محادثة حقيقية |
| Promptfoo (معهد ماساتشوستس للتكنولوجيا، استحوذت عليها شركة OpenAI في مارس 2026) | التقييم الأولي للتكوين واختبارات الفريق الأحمر | اختبار الانحدار المتكامل مع التكامل المستمر، مع إعداد مسبق لأفضل 10 مخاطر من OWASP LLM |
| ديب تيم (الذكاء الاصطناعي الواثق، أباتشي 2.0) | إطار عمل اختبار بايثون | عملية إعداد بسيطة ورسم خرائط OWASP LLM Top 10 واضحة |
| المنصات التجارية | حملات مُدارة ومستمرة | اختبارات مجدولة مع تقارير جاهزة للامتثال للمدققين |
إعداد عمل معقول: فحص شامل واحد لكل فرع إصدار، ومجموعة أدوات أخف على كل pull requestوتوليد هجمات جديدة بشكل دوري بدلاً من مستمر. تتبع عدد الاختبارات الفاشلة بمرور الوقت. إذا توقف الفشل، فهذا يعني أن أحدهم قد أطلق تحديثًا برمجيًا دون أن يلاحظه أحد، وهذا بحد ذاته هو الاكتشاف.
الفجوة: السلوك ليس نطاق الانفجار
إليكم الأمر المشترك بين جميع هذه الأدوات. فهي تتفاعل مع النظام بالطريقة التي يتفاعل بها المستخدم، من خلال نقطة النهاية، وتقوم بتقييم ما يتم إرجاعه.
هذا هو الأنسب لاختبار السلوك. من الصعب الوصول إليه هيكليًا.
تخيل ما هو وكيل هو في الواقع نموذج، بالإضافة إلى مجموعة من الأدوات التي قد يستدعيها، بالإضافة إلى هوية يعمل بموجبها، بالإضافة إلى ذاكرة تدوم، بالإضافة إلى ملفات تكوين تخبره بما يجب فعله وما يمكنه تعديله. تمرين فريق الهجوم الأحمر للذكاء الاصطناعيcisهذا هو الأول من بينها. أما الأربعة الأخرى فهي عبارة عن نصوص عادية موجودة في مستودع، وهي التي تحدد ما يحدث بعد نجاح عملية حقن الموجه.
مثال عملي. يقوم فريقك الهجومي بإطلاق ألف حمولة حقن على مساعد برمجة. النموذج سليم. التقرير يُظهر نتائج نظيفة. في هذه الأثناء، في نفس المستودع:
- يُوجّه ملف القواعد المساعد إلى تفضيل سجل حزم داخلي لم يتم التحقق منه من قبل أي شخص. ميتري أطلس يوثق هذا النمط كدراسة حالة حقيقية، وليس كحالة افتراضية.
- يمنح تكوين خادم MCP أداة ما وصولاً أوسع إلى نظام الملفات مما تحتاجه وظيفتها، لأن هذه كانت أسرع طريقة لجعلها تعمل.
- يعمل الوكيل ضمن حساب خدمة مشترك، لذا يسجل سجل التدقيق الحساب بدلاً من الوكيل الذي اختار الإجراء.
- توجد بيانات اعتماد موفر الذكاء الاصطناعي في ملف موجه الأوامر الذي كان commitمثل التوثيق.
لا يُعدّ أيٌّ من هذه السلوكيات الأربعة سلوكًا نموذجيًا. ولا يمكن الوصول إلى أيٍّ منها عبر نقطة نهاية. وتُغيّر هذه السلوكيات الأربعة جميعها نطاق الهجوم الناجح، ولا يُشير حصول الفريق الأحمر على نتيجة مثالية إلى أيٍّ منها.
هذا ليس تفسيراً مخالفاً للرأي السائد. رواية مايكروسوفت الخاصة عن فرق الاختراق. 100 منتج من منتجات الذكاء الاصطناعي التوليدي يصف هذا التحول من اختبار النماذج إلى محاكاة الهجوم على مستوى النظام، قبلcisلأن نقاط الضعف المهمة لم تكن في النموذج وحده. وقد توصل الممارسون الأقرب إلى العمل إلى نفس النتيجة.
ولهذا السبب فإن التأطير الصادق لفرق اختبار الذكاء الاصطناعي ليس "هل هذا كافٍ؟" بل "ما هو النصف الآخر؟".
فرق الاختراق والاختبارات الأمنية باستخدام الذكاء الاصطناعي وتحليل التكوين
ثلاثة تخصصات، يتم الخلط بينها بشكل روتيني في مواد البائعين، والمشتري الذي يخلط بينها ينتهي به الأمر باثنين من الثلاثة ونقطة عمياء.
| البعد | اختبار الاختراق التقليدي | فريق الذكاء الاصطناعي الأحمر | تحليل التكوين |
|---|---|---|---|
| الهدف | البنية التحتية، الشبكات، الحسابات | سلوك النموذج في ظل المدخلات العدائية | توصيل الوكيل: الأدوات، الهوية، الذاكرة، ملفات التكوين |
| استخدم | من الخارج، ضد الأنظمة الجارية | من خلال نقطة نهاية النموذج | من داخل المستودع |
| الطبيعة | حتمية. نفس المدخلات، نفس المخرجات | احتمالية. معدلات، وليس استغلالات فردية | ثابت. ما تسمح به الملفات |
| الأجوبة | هل يستطيع المهاجم الدخول؟ | هل يمكن إقناع النموذج بذلك؟ | ما هي المسافة التي تقطعها بعد ذلك؟ |
| إيقاع | المشاركة الدورية | لكل إصدار، ويفضل لكل pull request | بشكل مستمر، في كل commit |
| أعمى لـ | سلوك خاص بالذكاء الاصطناعي | كل شيء لا يمكن الوصول إليه من نقطة النهاية | سلوك النموذج نفسه أثناء التشغيل |
اقرأ السطر الأخير. إن نقطة ضعف كل تخصص هي موضوع تخصص آخر بأكمله، ولهذا السبب فإن اختيار تخصص واحد وتسميته أمن الذكاء الاصطناعي هو الفشل الشائع.
كيفية تقييم أدوات فريق الهجوم الأحمر التي تعمل بالذكاء الاصطناعي
إذا كنت ستختار واحداً، فهذه هي الأسئلة التي ستظل قائمة بعد العرض التوضيحي.
| معيار | السؤال الذي يجب طرحه | لماذا يهم |
|---|---|---|
| تغطية الوكيل | هل يختبر استدعاءات الأدوات والسلوك متعدد الخطوات، أم يختبر فقط المطالبات والاستجابة؟ | توفر عمليات التحقق على مستوى النموذج تغطية محدودة للعوامل والاسترجاع pipelines |
| عمق متعدد الدورات | هل يمكن أن يتطور الهجوم عبر المحادثة؟ | تفتقر مجموعات الدفعات ذات الدورة الواحدة إلى أنماط التصعيد التي تُجدي نفعاً في الممارسة العملية. |
| رسم خرائط الإطار | هل تتوافق النتائج مع معرّفات OWASP LLM Top 10 و MITRE ATLAS؟ | بدون معرّفات مشتركة، يصبح الاكتشاف مجرد حكاية لا يستطيع المدافع اتخاذ إجراء بشأنها. |
| CI fit | هل يعمل على pull requestأم أن أحدهم يحدد موعداً لذلك؟ | يتم تخطي الاختبارات التي تتطلب جدولة في دورة التطوير التي كانت تتطلبها. |
| الاحتفاظ بالانحدار | هل تصبح الهجمات المؤكدة حالات اختبار دائمة؟ | الاكتشاف هو النصف السهل. أما القيمة فتكمن في منع تكرار نفس الفشل |
| تكاليف التشغيل | من المسؤول عن صيانة نظام الهجوم؟ | قد يكلف مهندس متخصص في صيانة حزمة برمجية مفتوحة المصدر أكثر من تكلفة المنصة نفسها. |
المعيار الأول هو أين يكون الجيل الحالي أقل كثافة. تم بناء الماسحات الضوئية على مستوى النموذج عندما كان الهدف المهم هو روبوت محادثة، وتُعد التغطية الآلية هي الفجوة المعروفة في أدوات المصادر المفتوحة.
ما الذي يجب تشغيله جنبًا إلى جنب مع فرق الذكاء الاصطناعي الحمراء
إذا كانت اختبارات الفريق الأحمر تختبر السلوك من الخارج، فإن العمل التكميلي يبدأ داخل المستودع، حيث توجد التكوينات.
- ابدأ بالاكتشاف أولاً، لأنه لا يمكنك اختبار ما لم تجده. شركة زيجيني للأمن الذكي يكتشف باستمرار جميع أصول الذكاء الاصطناعي عبر مستودعاتك: النماذج، والأطر، ومجموعات البيانات، ونقاط نهاية الاستدلال، والوكلاء، وخوادم MCP، وملفات المهارات، والمطالبات، guardrailsوأدوات برمجة الذكاء الاصطناعي التي يستخدمها مطورو البرامج لديك فعليًا. ليس من خلال استطلاع رأي أو سجل مُبلغ عنه ذاتيًا، بل من خلال ما تُخلفه هذه الأدوات في الكود. ينتج عن ذلك جرد للذكاء الاصطناعي، وقائمة مكونات الذكاء الاصطناعي، ورسم بياني لكيفية ترابط الأجزاء، وهو الجزء الأهم، لأن المخاطر عادةً ما تكمن في البنية التحتية وليس في أي أصل منفرد.
- ثم الكشف حيث لا تستطيع فرق الهجوم الوصول. خطر حقن التعليمات البرمجية في كيفية بناء التعليمات البرمجية، مع تصنيف النتائج وفقًا لفئة OWASP LLM ومتجه الفريق الأحمر الذي تتوافق معه، مما يشير إلى الملف والسطر المحددين. بيانات اعتماد مزود الذكاء الاصطناعي موجودة في ملفات التعليمات البرمجية وتكوين الوكيل، وتغطي مزودي النماذج الرئيسيين، لأن مفتاح النموذج المسرب هو سر كأي سر آخر، وهو موجود حاليًا في ملف لا يراجعه أحد.
- وطابور واحد، وليس طابوراً رابعاً. تُصنّف النتائج ضمن نفس نموذج المخاطر ونفس الأولويات التي تُصنّف ضمنها التعليمات البرمجية والتبعيات و pipeline النتائج، بما فيها تلك المُستقاة من الماسحات الضوئية التي لا تستبدلها. تُنتج أدوات فريق الهجوم المستقلة التي تعمل بالذكاء الاصطناعي مخرجات ممتازة في منصتها الخاصة. المنصة المنفصلة تُشكل قائمة انتظار إضافية لا يُوليها أحد اهتمامًا.
تقسيم العمل واضح. يُثبت اختبار الذكاء الاصطناعي الهجومي كيفية تصرف النموذج تحت الهجوم. ويُثبت تحليل الأصول والتكوين مدى وصول الهجوم. لا يُغني أيٌّ منهما عن الآخر، وقد بدأ كل فريق تقريبًا بالأول.
أين تستقر الأطر والهيئات التنظيمية
انتقل اختبار الخصومة من كونه ممارسة جيدة إلى دليل متوقع، على الرغم من أن الصياغة مهمة أكثر مما يعترف به البائعون عادةً.
- نيست منظمة العفو الدولية RMF وملف تعريف الذكاء الاصطناعي التوليدي الخاص به يُشجع على إجراء اختبارات معادية كجزء من إدارة مخاطر الذكاء الاصطناعي. ولا يُعتبر اختبار الفريق الأحمر إجراءً إلزاميًا، وتندرج التهديدات مثل الحقن الفوري ضمن إرشادات المرونة.
- قانون الاتحاد الأوروبي للذكاء الاصطناعي يتوقع هذا المعيار تقييم النموذج، بما في ذلك اختبارات الخصومة للأنظمة عالية المخاطر كجزء من تخفيف المخاطر قبل طرحها في السوق. ولا يحدد أداةً أو مورداً أو شكلاً معيناً للتقرير.
- قائمة OWASP لأهم 10 مخاطر لتطبيقات ماجستير القانون يُوفّر هذا التقرير المفردات المشتركة. يُعتبر التقرير المُصنّف LLM01 قابلاً للتنفيذ من قِبل المُدافع. أما عبارة "قال النموذج شيئاً سيئاً" فلا تُعتبر كذلك.
- ميتري أطلس يوفر معرّفات تقنية ودراسات حالة موثقة، وهو ما يسمح لنتائج الفريق الأحمر ونموذج التهديد بالإشارة إلى الشيء نفسه.
القراءة العملية: أنت بحاجة إلى دليل على إجراء اختبارات معادية منظمة، وقائمة بالأنظمة التي شملتها، وسجل بالتغييرات التي طرأت عليها لاحقًا. لا يفي ناتج الفحص وحده بأي من هذه المتطلبات الثلاثة.
اختبر النصف الآخر
يُظهر لك تقرير فريق الاختبار الأحمر النظيف للذكاء الاصطناعي ما استطاع النموذج فعله، لكنه لا يُخبرك بما كان بإمكان العميل المجاور له الوصول إليه لو لم يفعل النموذج ذلك.
زيجيني يكتشف كل أصول الذكاء الاصطناعي في مستودعاتك، بما في ذلك الوكلاء وخوادم MCP وملفات المهارات التي لم يصرح بها أحد، ويجد المخاطر الكامنة في التكوين بدلاً من سلوك النموذج: كيفية إنشاء المطالبات، وما يُسمح للوكيل بلمسه، وما هي بيانات الاعتماد الموجودة في الملفات التي لم تتم مراجعتها كشفرة برمجية.
جدولة التجريبي للاطلاع على مخزونك الخاص بالذكاء الاصطناعي.
الأسئلة الشائعة
ما هي أدوات فريق الهجوم الأحمر التي تعمل بالذكاء الاصطناعي؟
أدوات تحاكي الهجمات المعادية على نماذج اللغة والتطبيقات المبنية عليها: حقن التعليمات البرمجية، واختراق الأنظمة، واستخراج البيانات، ومعالجة المخرجات غير الآمنة. تُرسل هذه الأدوات الهجمات إلى نقطة نهاية وتقيّم ما يتم استلامه.
هل يُعدّ اختبار الاختراق باستخدام الذكاء الاصطناعي هو نفسه اختبار الاختراق؟
لا. يستهدف اختبار الاختراق البرامج ذات النتائج الحتمية حيث ينتج عن نفس المدخلات نفس المخرجات. أما فرق الذكاء الاصطناعي فيستهدف الأنظمة الاحتمالية، لذا فهي تُجري العديد من المحاولات وتقيس معدلات النجاح بدلاً من تأكيد ثغرة واحدة.
هل تشمل أدوات فريق الهجوم الإلكتروني التي تعمل بالذكاء الاصطناعي وكلاء الذكاء الاصطناعي؟
جزئياً، وهذه هي نقطة ضعف الجيل الحالي. تتمتع الماسحات الضوئية على مستوى النموذج بتغطية محدودة للوكلاء، ولا يرى أي منها التكوين الذي يحدد وصول الوكيل إلى الأدوات أو هويته أو أذوناته.
ما هي أدوات الذكاء الاصطناعي التي يجب أن يبدأ بها الفريق؟
ابدأ بماسح ضوئي واحد واسع النطاق مفتوح المصدر للتغطية وأداة متكاملة مع التكامل المستمر للتراجع، ثم أضف تنسيقًا متعدد المراحل عندما تعتمد النتائج على سجل المحادثة أو سلوك استدعاء الأداة.
ما الذي لا يغطيه فريق اختبار الذكاء الاصطناعي؟
أي شيء لا يمكن الوصول إليه من نقطة نهاية النموذج: الأدوات التي يمكن للوكيل استخدامها، والهوية التي يعمل بها، وما يحتفظ به من بيانات في ذاكرته، وملفات تكوين المهارات والقواعد وMCP التي تحدد صلاحياته. هذه المعلومات موجودة في المستودع، وليس في المحادثة.
هل يفي اختبار الذكاء الاصطناعي بمتطلبات قانون الذكاء الاصطناعي في الاتحاد الأوروبي؟
لا توجد أداة واحدة تفعل ذلك. يتوقع القانون إجراء اختبارات معادية كجزء من نظام موثق لإدارة المخاطر لأنظمة الذكاء الاصطناعي عالية المخاطر، مما يعني وجود أدلة وجرد وعمليات، وليس مجرد تقرير مسح.







