Los modelos de aprendizaje automático protegen mejor a las inteligencias artificiales de los ataques por inyección de prompts

Los modelos de aprendizaje automático protegen mejor a las inteligencias artificiales de los ataques por inyección de prompts

Las inteligencias artificiales modernas, especialmente los grandes modelos de lenguaje, están cada vez más expuestas a ataques por inyección de prompts. Estos ataques permiten a actores malintencionados manipular las respuestas de los modelos para eludir las protecciones y obtener comportamientos no previstos por sus diseñadores. Una manipulación de este tipo puede provocar fugas de datos, suplantaciones de identidad u otras consecuencias graves, ya sea mediante una inyección directa en la solicitud o mediante la explotación de fuentes externas como sitios web o archivos.

Para contrarrestar esta amenaza, se han evaluado métodos de aprendizaje automático con el fin de detectar estos intentos de manipulación. Se han comparado cuatro enfoques principales: los clasificadores tradicionales que utilizan representaciones vectoriales de los textos, los modelos transformadores ajustados para la tarea, los modelos especializados en la detección de inyecciones de prompts y, por último, los grandes modelos de lenguaje utilizados como clasificadores.

Los clasificadores tradicionales, como los bosques aleatorios o las redes neuronales multicapa, ofrecen una buena precisión al tiempo que requieren pocos recursos informáticos. Alcanzan un rendimiento notable, con puntuaciones que a veces superan el 96 % en la detección de prompts maliciosos. Su simplicidad los hace adecuados para entornos donde los recursos son limitados.

Los modelos transformadores ajustados, como DistilBERT, RoBERTa o DeBERTa, destacan por su capacidad para detectar ataques con una precisión cercana al 99,6 %. Estos modelos, más complejos, analizan finamente el significado de los textos e identifican los intentos de manipulación con gran fiabilidad. Su principal inconveniente radica en su mayor costo computacional, lo que puede limitar su implementación en sistemas que requieren respuestas rápidas.

Los modelos especializados, diseñados específicamente para detectar inyecciones de prompts, muestran resultados dispares. Aunque están optimizados para esta tarea, su tasa de detección sigue siendo a menudo baja, con puntuaciones de recall a veces inferiores al 25 %. Esto significa que dejan pasar un número importante de ataques, reduciendo así su utilidad práctica.

Finalmente, los grandes modelos de lenguaje generalistas, como gpt-5-nano, también pueden servir para detectar estos ataques. Con una precisión del 84 % y un recall del 71 %, ofrecen un equilibrio interesante entre rendimiento y versatilidad. Su fuerza radica en su capacidad para adaptarse a diferentes tipos de solicitudes sin requerir un entrenamiento específico.

Este análisis revela que ningún método domina a todos los demás en todos los contextos. Los clasificadores tradicionales son adecuados para sistemas ligeros, mientras que los modelos transformadores ajustados destacan donde la precisión prima sobre la velocidad. Los modelos especializados, aunque prometedores, aún deben mejorar para competir con los demás enfoques. En cuanto a los grandes modelos de lenguaje, representan una solución flexible, pero su implementación depende de las restricciones técnicas y las necesidades específicas.


Bases documentaires

Rapport de référence

DOI : https://doi.org/10.1007/s10207-026-01264-8

Titre : Comparative evaluation of machine learning methods for protecting LLMs from prompt injection attacks

Revue : International Journal of Information Security

Éditeur : Springer Science and Business Media LLC

Auteurs : Nazarii Dzhaliuk; Dmytro Sabodashko; Volodymyr Khoma; Yuriy Khoma; Viktor Kolchenko; Michal Podpora

Speed Reader

Ready
500