機器學習模型更好地保護人工智慧免受提示注入攻擊

“`html

機器學習模型更好地保護人工智慧免受提示注入攻擊

現代人工智慧,尤其是大型語言模型,越來越容易遭受提示注入攻擊。這些攻擊允許惡意行為者操縱模型的回應,繞過保護機制,獲得設計者未預期的行為。這類操縱可能導致資料外洩、身分冒用或其他嚴重後果,無論是通過直接在查詢中注入,還是利用外部來源如網站或檔案。

為了應對這一威脅,已評估機器學習方法來偵測這些操縱嘗試。比較了四種主要方法:使用文字向量表示的傳統分類器、針對任務微調的轉換器模型、專門偵測提示注入的模型,以及作為分類器使用的大型語言模型。

傳統分類器,如隨機森林或多層神經網路,在計算資源需求低的情況下提供良好的精確度。它們在偵測惡意提示方面表現出色,有時分數超過 96%。其簡單性使它們適合資源受限的環境。

微調的轉換器模型,如 DistilBERT、RoBERTa 或 DeBERTa,以接近 99.6% 的精確度偵測攻擊而脫穎而出。這些更複雜的模型能細緻分析文字含義,並以高可靠性識別操縱嘗試。它們的主要缺點在於計算成本較高,可能限制其在需要快速回應的系統中的部署。

專門設計用於偵測提示注入的模型顯示出好壞參半的結果。儘管它們針對此任務進行了優化,但其偵測率通常較低,召回率分數有時低於 25%。這意味着它們會錯過大量攻擊,從而降低其實際用途。

最後,通用的大型語言模型,如 gpt-5-nano,也可用於偵測這些攻擊。它們的精確度為 84%,召回率為 71%,在效能和多功能性之間提供了良好的平衡。它們的優勢在於能夠適應不同類型的查詢,而無需特定的訓練。

這項分析顯示,沒有任何一種方法在所有情境下都優於其他方法。傳統分類器適合輕量級系統,而微調的轉換器模型在精確度優先於速度的場合表現優異。專門模型雖然前景光明,但仍需改進才能與其他方法競爭。至於大型語言模型,它們提供了一個靈活的解決方案,但其部署取決於技術限制和特定需求。

“`


Bases documentaires

Rapport de référence

DOI : https://doi.org/10.1007/s10207-026-01264-8

Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks

Revue : International Journal of Information Security

Éditeur : Springer Science and Business Media LLC

Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora

Speed Reader

Ready
500