机器学习模型更好地保护人工智能免受提示注入攻击
现代人工智能,特别是大型语言模型,越来越容易受到提示注入攻击。这些攻击允许恶意行为者操纵模型的响应,绕过保护机制,获取设计者未预期的行为。此类操纵可能导致数据泄露、身份冒用或其他严重后果,无论是通过直接在查询中注入,还是通过利用外部来源(如网站或文件)。
为了应对这一威胁,已评估了机器学习方法来检测这些操纵尝试。比较了四种主要方法:使用文本向量表示的传统分类器、针对任务微调的Transformer模型、专门检测提示注入的模型,以及作为分类器使用的大型语言模型。
传统分类器(如随机森林或多层神经网络)在计算资源需求较低的情况下提供了良好的精确度。它们在检测恶意提示方面表现出色,有时得分超过96%。其简单性使它们适用于资源受限的环境。
微调的Transformer模型(如DistilBERT、RoBERTa或DeBERTa)以接近99.6%的精确度脱颖而出,能够检测攻击。这些更复杂的模型能够深入分析文本含义,并以高可靠性识别操纵尝试。它们的主要缺点是计算成本较高,这可能限制它们在需要快速响应的系统中的部署。
专门设计用于检测提示注入的模型表现参差不齐。尽管它们针对这一任务进行了优化,但其检测率仍然较低,召回率有时低于25%。这意味着它们会遗漏大量攻击,从而降低其实际用途。
最后,通用的大型语言模型(如gpt-5-nano)也可用于检测这些攻击。它们的精确度为84%,召回率为71%,在性能和多功能性之间提供了一个有趣的平衡。它们的优势在于能够适应不同类型的查询,而无需特定的训练。
这项分析表明,没有一种方法在所有情况下都优于其他方法。传统分类器适合轻量级系统,而微调的Transformer模型在精确度优先于速度的场景中表现优异。专门模型尽管前景广阔,但仍需改进才能与其他方法竞争。至于大型语言模型,它们提供了灵活的解决方案,但其部署取决于技术限制和具体需求。
Bases documentaires
Rapport de référence
DOI : https://doi.org/10.1007/s10207-026-01264-8
Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks
Revue : International Journal of Information Security
Éditeur : Springer Science and Business Media LLC
Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora