Модели машинного обучения лучше защищают искусственный интеллект от атак через инъекцию промптов

Модели машинного обучения лучше защищают искусственный интеллект от атак через инъекцию промптов

Современные искусственные интеллекты, в частности большие языковые модели, все чаще становятся мишенью для атак через инъекцию промптов. Эти атаки позволяют злоумышленникам манипулировать ответами моделей, чтобы обойти защиты и добиться непредвиденного поведения, не запланированного их создателями. Такая манипуляция может привести к утечке данных, краже личности или другим серьезным последствиям, будь то через прямую инъекцию в запрос или через использование внешних источников, таких как веб-сайты или файлы.

Чтобы противостоять этой угрозе, были оценены методы машинного обучения для обнаружения попыток манипуляции. Сравнивались четыре основных подхода: традиционные классификаторы, использующие векторные представления текстов, дообученные трансформерные модели, модели, специализированные на обнаружении инъекций промптов, и, наконец, большие языковые модели, используемые в качестве классификаторов.

Традиционные классификаторы, такие как случайные леса или многослойные нейронные сети, обеспечивают высокую точность при минимальных вычислительных затратах. Они демонстрируют замечательные результаты, иногда превышающие 96 % в обнаружении злоумышленных промптов. Их простота делает их подходящими для сред с ограниченными ресурсами.

Дообученные трансформерные модели, такие как DistilBERT, RoBERTa или DeBERTa, выделяются способностью обнаруживать атаки с точностью до 99,6 %. Эти более сложные модели тщательно анализируют смысл текстов и выявляют попытки манипуляции с высокой надежностью. Их основной недостаток — более высокие вычислительные затраты, что может ограничивать их внедрение в системах, требующих быстрых ответов.

Специализированные модели, разработанные специально для обнаружения инъекций промптов, показывают смешанные результаты. Хотя они оптимизированы для этой задачи, их уровень обнаружения часто остается низким, с показателями полноты иногда ниже 25 %. Это означает, что они пропускают значительное количество атак, что снижает их практическую полезность.

Наконец, универсальные большие языковые модели, такие как gpt-5-nano, также могут использоваться для обнаружения таких атак. С точностью 84 % и полнотой 71 % они предлагают интересный баланс между производительностью и универсальностью. Их сила заключается в способности адаптироваться к различным типам запросов без необходимости специального обучения.

Этот анализ показывает, что ни один метод не превосходит все остальные во всех контекстах. Традиционные классификаторы подходят для легковесных систем, тогда как дообученные трансформерные модели преуспевают там, где точность важнее скорости. Специализированные модели, хотя и многообещающие, должны еще совершенствоваться, чтобы конкурировать с другими подходами. Что касается больших языковых моделей, то они представляют гибкое решение, но их внедрение зависит от технических ограничений и специфических потребностей.


Bases documentaires

Rapport de référence

DOI : https://doi.org/10.1007/s10207-026-01264-8

Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks

Revue : International Journal of Information Security

Éditeur : Springer Science and Business Media LLC

Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora

Speed Reader

Ready
500