“`html
نماذج التعلم الآلي تحمي الذكاءات الاصطناعية بشكل أفضل من هجمات حقن المطالبات
الذكاءات الاصطناعية الحديثة، وخاصة نماذج اللغة الكبيرة، أصبحت أكثر تعرضًا لهجمات حقن المطالبات. تسمح هذه الهجمات للمتسللين الخبيثين بتحريف استجابات النماذج لتجاوز الحماية والحصول على سلوكيات غير متوقعة من قبل مصمميها. يمكن أن يؤدي مثل هذا التلاعب إلى تسرب البيانات، أو سرقة الهوية، أو عواقب وخيمة أخرى، سواء من خلال حقن مباشر في الاستعلام أو من خلال استغلال مصادر خارجية مثل مواقع الويب أو الملفات.
لمواجهة هذا التهديد، تم تقييم طرق التعلم الآلي للكشف عن محاولات التلاعب هذه. تم مقارنة أربع نهج رئيسية: المصنفات التقليدية التي تستخدم تمثيلات متجهة للنصوص، ونماذج المحولات المعدلة للمهمة، والنماذج المتخصصة في كشف حقن المطالبات، وأخيرًا نماذج اللغة الكبيرة المستخدمة كمصنفات.
توفر المصنفات التقليدية، مثل غابات القرار أو شبكات العصب متعددة الطبقات، دقة جيدة مع الحاجة إلى موارد حاسوبية قليلة. فهي تحقق أداءً ملحوظًا، مع درجات تتجاوز في بعض الأحيان 96٪ لكشف المطالبات الخبيثة. بساطتها تجعلها مناسبة للبيئات التي تكون فيها الموارد محدودة.
تميزت نماذج المحولات المعدلة، مثل DistilBERT وRoBERTa وDeBERTa، بقدرتها على كشف الهجمات بدقة تصل إلى 99.6٪. هذه النماذج، الأكثر تعقيدًا، تحلل معنى النصوص بدقة وتحدد محاولات التلاعب بموثوقية عالية. عيبها الرئيسي يكمن في تكلفتها الحسابية المرتفعة، مما قد يحد من نشرها في الأنظمة التي تتطلب استجابات سريعة.
تظهر النماذج المتخصصة، المصممة خصيصًا لاكتشاف حقن المطالبات، نتائج متضاربة. على الرغم من أنها مُحَسَّنة لهذه المهمة، إلا أن معدل كشفها يبقى في كثير من الأحيان منخفضًا، مع درجات استدعاء قد تكون أقل من 25٪. هذا يعني أنها تسمح بمرور عدد كبير من الهجمات، مما يقلل من فائدتها العملية.
أخيرًا، يمكن لنماذج اللغة الكبيرة العامة، مثل gpt-5-nano، أن تُستخدم أيضًا لاكتشاف هذه الهجمات. مع دقة تبلغ 84٪ واستدعاء يبلغ 71٪، تقدم هذه النماذج توازنًا مثيرًا للاهتمام بين الأداء والتعدد الاستخدامات. تكمن قوتها في قدرتها على التكيف مع أنواع مختلفة من الاستعلامات دون الحاجة إلى تدريب محدد.
تكشف هذه التحليلات أن أيًا من الأساليب لا يسيطر على جميع الأساليب الأخرى في جميع السياقات. تناسب المصنفات التقليدية الأنظمة الخفيفة، بينما تميز نماذج المحولات المعدلة في الأماكن التي تكون فيها الدقة أولوية على السرعة. على الرغم من أن النماذج المتخصصة واعدة، إلا أنها لا تزال بحاجة إلى التقدم لمنافسة الأساليب الأخرى. أما نماذج اللغة الكبيرة، فهي تمثل حلًا مرنًا، لكن نشرها يعتمد على القيود التقنية والاحتياجات المحددة.
“`
Bases documentaires
Rapport de référence
DOI : https://doi.org/10.1007/s10207-026-01264-8
Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks
Revue : International Journal of Information Security
Éditeur : Springer Science and Business Media LLC
Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora