Modelos de aprendizado de máquina protegem melhor as inteligências artificiais de ataques por injeção de prompts

Modelos de aprendizado de máquina protegem melhor as inteligências artificiais de ataques por injeção de prompts

As inteligências artificiais modernas, especialmente os grandes modelos de linguagem, estão cada vez mais expostas a ataques por injeção de prompts. Esses ataques permitem que atores mal-intencionados manipulem as respostas dos modelos para contornar as proteções e obter comportamentos não previstos por seus criadores. Essa manipulação pode resultar em vazamento de dados, usurpação de identidade ou outras consequências graves, seja por injeção direta na solicitação ou por meio da exploração de fontes externas, como sites ou arquivos.

Para combater essa ameaça, métodos de aprendizado de máquina foram avaliados a fim de detectar essas tentativas de manipulação. Quatro abordagens principais foram comparadas: classificadores tradicionais que utilizam representações vetoriais dos textos, modelos transformadores ajustados para a tarefa, modelos especializados na detecção de injeções de prompts e, por fim, grandes modelos de linguagem usados como classificadores.

Os classificadores tradicionais, como florestas aleatórias ou redes neurais multicamadas, oferecem boa precisão ao mesmo tempo em que exigem poucos recursos computacionais. Eles alcançam desempenho notável, com pontuações que às vezes ultrapassam 96% na detecção de prompts maliciosos. Sua simplicidade os torna adequados a ambientes onde os recursos são limitados.

Os modelos transformadores ajustados, como DistilBERT, RoBERTa ou DeBERTa, destacam-se pela capacidade de detectar ataques com precisão próxima a 99,6%. Esses modelos, mais complexos, analisam finamente o sentido dos textos e identificam as tentativas de manipulação com grande confiabilidade. Sua principal desvantagem reside no custo computacional mais elevado, o que pode limitar sua implantação em sistemas que exigem respostas rápidas.

Os modelos especializados, projetados especificamente para identificar injeções de prompts, apresentam resultados mistos. Embora sejam otimizados para essa tarefa, sua taxa de detecção muitas vezes permanece baixa, com pontuações de revocação às vezes inferiores a 25%. Isso significa que eles permitem que um número significativo de ataques passe, reduzindo assim sua utilidade prática.

Por fim, os grandes modelos de linguagem generalistas, como o gpt-5-nano, também podem ser usados para detectar esses ataques. Com uma precisão de 84% e uma revocação de 71%, eles oferecem um equilíbrio interessante entre desempenho e versatilidade. Sua força reside na capacidade de se adaptar a diferentes tipos de solicitações sem exigir treinamento específico.

Esta análise revela que nenhum método domina todos os outros em todos os contextos. Os classificadores tradicionais são adequados para sistemas leves, enquanto os modelos transformadores ajustados se destacam onde a precisão é prioridade em relação à velocidade. Os modelos especializados, embora promissores, ainda precisam evoluir para competir com as outras abordagens. Quanto aos grandes modelos de linguagem, eles representam uma solução flexível, mas sua implantação depende das restrições técnicas e das necessidades específicas.


Bases documentaires

Rapport de référence

DOI : https://doi.org/10.1007/s10207-026-01264-8

Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks

Revue : International Journal of Information Security

Éditeur : Springer Science and Business Media LLC

Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora

Speed Reader

Ready
500