機械学習モデルはプロンプトインジェクション攻撃から人工知能をよりよく保護する

“`html

機械学習モデルはプロンプトインジェクション攻撃から人工知能をよりよく保護する

現代の人工知能、特に大規模言語モデルは、プロンプトインジェクション攻撃にますますさらされています。これらの攻撃により、悪意のある行為者がモデルの応答を操作して保護を回避し、設計者が意図しない動作を引き出すことが可能になります。このような操作は、データ漏洩、なりすまし、またはその他の深刻な結果を招く可能性があり、クエリへの直接的なインジェクションや、ウェブサイトやファイルなどの外部ソースの悪用を通じて行われます。

この脅威に対抗するため、機械学習の手法がこれらの操作の試みを検出するために評価されています。主に4つのアプローチが比較されました:テキストのベクトル表現を使用した従来の分類器、タスクに調整されたトランスフォーマーモデル、プロンプトインジェクション検出に特化したモデル、そして最後に分類器として使用される大規模言語モデルです。

ランダムフォレストや多層ニューラルネットワークなどの従来の分類器は、優れた精度を提供すると同時に、計算リソースをほとんど必要としません。これらは、悪意のあるプロンプトの検出において96%を超えるスコアを達成することもあり、そのシンプルさからリソースが限られた環境に適しています。

DistilBERT、RoBERTa、DeBERTaなどの調整されたトランスフォーマーモデルは、99.6%に近い精度で攻撃を検出できる能力で際立っています。これらのモデルはより複雑で、テキストの意味を詳細に分析し、操作の試みを高い信頼性で特定します。主な欠点は、計算コストが高いことで、これは高速な応答を必要とするシステムでの展開を制限する可能性があります。

プロンプトインジェクションを特定するために特別に設計された専門モデルは、結果がまちまちです。これらのモデルはこのタスクに最適化されていますが、検出率は依然として低く、リコールスコアが25%未満であることもあります。これは、多くの攻撃を見逃すことを意味し、実用的な有用性が低下します。

最後に、gpt-5-nanoのような汎用的な大規模言語モデルも、これらの攻撃を検出するために使用することができます。84%の精度と71%のリコールを備えており、パフォーマンスと汎用性のバランスが優れています。これらのモデルの強みは、特定のトレーニングを必要とせずに、さまざまなタイプのクエリに適応できる能力にあります。

この分析は、いずれの方法もすべての状況で他を圧倒するものはないことを明らかにしています。従来の分類器は軽量なシステムに適しており、調整されたトランスフォーマーモデルは、精度が速度よりも優先される場合に優れています。専門モデルは有望ですが、他のアプローチと競合するためにはまだ改善が必要です。大規模言語モデルに関しては、柔軟なソリューションを提供しますが、その展開は技術的な制約と特定のニーズによって決まります。

“`


Bases documentaires

Rapport de référence

DOI : https://doi.org/10.1007/s10207-026-01264-8

Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks

Revue : International Journal of Information Security

Éditeur : Springer Science and Business Media LLC

Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora

Speed Reader

Ready
500