Inyección indirecta de prompts en copilotos municipales para el procesamiento de documentos: Ataques, defensas y perjuicios
Una evaluación representativa de prueba de concepto en cuatro grandes modelos de lenguaje
DOI:
https://doi.org/10.62161/sauc.v12.6399Palabras clave:
inyección de prompts, grandes modelos de lenguaje, ciberseguridad de la IA, gestión de expedientes, contratación electrónica, gobierno electrónicoResumen
Las administraciones públicas están desplegando asistentes basados en grandes modelos de lenguaje (LLM) que procesan, resumen, clasifican y validan documentos ciudadanos. Estos copilotos están expuestos a la inyección indirecta de prompts: instrucciones ocultas en documentos manipulados que llegan al modelo como si fueran datos.
Desarrollamos un copiloto para procedimientos municipales de ayudas y evaluamos su robustez frente a seis objetivos de ataque, cinco vectores de entrega, cinco defensas y cuatro LLM, con 3.000 evaluaciones de ataques y 1.000 legítimas. Combinamos detección determinista con un evaluador LLM validado por humanos.
Las defensas reducen el éxito de los ataques, pero de forma desigual. Neutralizan en gran medida ataques imperativos, como el desvío de solicitudes, pero apenas afectan a la falsificación de resúmenes, revelando una brecha de procedencia: la incapacidad de determinar si un valor de salida procede de un campo autorizado o de contenido controlado por el atacante. Además, el éxito de los ataques y el daño potencial están desacoplados: el fraude de pagos y la extracción de reglas presentan el mayor potencial de daño pese a tasas de éxito intermedias. El riesgo se analiza en un modelo human-in-the-loop, donde el sesgo de automatización puede amplificar el daño.
Descargas
Estadísticas globales ℹ️
|
0
Visualizaciones
|
0
Descargas
|
|
0
Total
|
|
Citas
Agencia Española de Protección de Datos. (2025). Política general para el uso de IA generativa en procesos administrativos de la AEPD. https://www.aepd.es/recurso-multimedia/politica-general-interna-para-el-uso-de-ia-generativa-en-procesos
Alon-Barkat, S., & Busuioc, M. (2023). Human–AI interactions in public sector decision making: “Automation bias” and “selective adherence” to algorithmic advice. Journal of Public Administration Research and Theory, 33(1), 153–169. https://doi.org/10.1093/jopart/muac007
Autio, C., Schwartz, R., Dunietz, J., Jain, S., Stanley, M., Tabassi, E., Hall, P., & Roberts, K. (2024). Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (Number NIST AI 600-1). https://doi.org/10.6028/NIST.AI.600-1
Chen, S., Piet, J., Sitawarin, C., & Wagner, D. (2025). StruQ: Defending against prompt injection with structured queries. 34th USENIX Security Symposium (USENIX Security 25), 2383–2400.
Chiang, C.-H., & Lee, H. (2023). Can large language models be an alternative to human evaluations? Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics, Volume 1, 15607–15631. https://doi.org/10.18653/v1/2023.acl-long.870
Debenedetti, E., Zhang, J., Balunovic, M., Beurer-Kellner, L., Fischer, M., & Tramèr, F. (2024). AgentDojo: A dynamic environment to evaluate prompt injection attacks and defenses for LLM agents. Advances in Neural Information Processing Systems (NeurIPS), 37, Datasets and Benchmarks Track.
European Parliament. (2024). Regulation (EU) 2024/1689 of the European Parliament and of the Council (Artificial Intelligence Act) of 13 June 2024 laying down harmonised rules on artificial intelligence and amending Regulations (EC) No 300/2008, (EU) No 167/2013, (EU) No 168/2013, (EU) 2018/858, (EU) 2018/1139 and (EU) 2019/2144 and Directives 2014/90/EU, (EU) 2016/797 and (EU) 2020/1828. http://data.europa.eu/eli/reg/2024/1689/oj
Gao, T., Yen, H., Yu, J., & Chen, D. (2023). Enabling large language models to generate text with citations. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 6465–6488. https://doi.org/10.18653/v1/2023.emnlp-main.398
Goddard, K., Roudsari, A., & Wyatt, J. C. (2012). Automation bias: A systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association, 19(1), 121–127. https://doi.org/10.1136/amiajnl-2011-000089
Govern de les Illes Balears. (2026). El Govern destina 5,4 millones de euros a incorporar la inteligencia artificial a toda la Administración para ganar agilidad y eficiencia. https://www.caib.es/pidip2front/jsp/es/ficha-convocatoria/el-govern-destina-54-millones-de-euros-a-incorporar-la-inteligencia-artificial-a-toda-la-administracion-para-ganar-agilidad-y-eficiencia
Greshake, K., Abdelnabi, S., Mishra, S., Endres, C., Holz, T., & Fritz, M. (2023). Not what you’ve signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection. https://arxiv.org/abs/2302.12173
Hines, K., Lopez, G., Hall, M., Zarfati, F., Zunger, Y., & Kiciman, E. (2024). Defending against indirect prompt injection attacks with spotlighting. Proceedings of the Conference on Applied Machine Learning in Information Security (CAMLIS 2024), CEUR Workshop Proceedings, 3920, 48–62.
Liu, Y., Jia, Y., Geng, R., Jia, J., & Gong, N. Z. (2024). Formalizing and benchmarking prompt injection attacks and defenses. 33rd USENIX Security Symposium (USENIX Security 24), 1831–1847. https://www.usenix.org/conference/usenixsecurity24/presentation/liu-yupei
Lyell, D., & Coiera, E. (2017). Automation bias and verification complexity: A systematic review. Journal of the American Medical Informatics Association, 24(2), 423–431. https://doi.org/10.1093/jamia/ocw105
Madan, R., & Ashok, M. (2023). AI adoption and diffusion in public administration: A systematic literature review and future research agenda. Government Information Quarterly, 40(1), 101774. https://doi.org/10.1016/j.giq.2022.101774
OWASP Foundation. (2026). OWASP Top 10 for LLM Applications 2026 (Version 2026). https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/
Red.es. (2024). El sistema de IA en Kit Consulting permite reducir los plazos de comprobación de documentos hasta un 70%. https://www.red.es/es/actualidad/noticias/kit-consulting-incorporacion-ia-justificacion-ayudas
Ruschemeier, H., & Hondrich, L. J. (2024). Automation bias in public administration—An interdisciplinary perspective from law and psychology. Government Information Quarterly, 41(3), 101953. https://doi.org/10.1016/j.giq.2024.101953
Yi, J., Xie, Y., Zhu, B., Kiciman, E., Sun, G., Xie, X., & Wu, F. (2025). Benchmarking and defending against indirect prompt injection attacks on large language models. Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD ’25), 1809–1820. https://doi.org/10.1145/3690624.3709179
Zhan, Q., Fang, R., Panchal, H. S., & Kang, D. (2025). Adaptive attacks break defenses against indirect prompt injection attacks on LLM agents. Findings of the Association for Computational Linguistics: NAACL 2025, 7116–7132. https://doi.org/10.18653/v1/2025.findings-naacl.395
Zhan, Q., Liang, Z., Ying, Z., & Kang, D. (2024). InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents. Proceedings of the Annual Meeting of the Association for Computational Linguistics, 10471–10506. https://doi.org/10.18653/v1/2024.findings-acl.624
Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., & Stoica, I. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, 36, 46595–46623.
Descargas
Publicado
Cómo citar
Número
Sección
Licencia
Derechos de autor 2026 Los autores/as conservan los derechos de autor y ceden a la revista el derecho de la primera publicación y el derecho de edición

Esta obra está bajo una licencia internacional Creative Commons Atribución-SinDerivadas 4.0.
Los autores/as que publiquen en esta revista aceptan las siguientes condiciones:
- Los autores/as conservan los derechos de autor.
- Los autores/as ceden a la revista el derecho de la primera publicación. La revista también posee los derechos de edición.
- Todos los contenidos publicados se regulan mediante una Licencia Atribución/Reconocimiento-SinDerivados 4.0 Internacional. Acceda a la versión informativa y texto legal de la licencia. En virtud de ello, se permite a terceros utilizar lo publicado siempre que mencionen la autoría del trabajo y a la primera publicación en esta revista. Si transforma el material, no podrá distribuir el trabajo modificado.
- Los autores/as pueden realizar otros acuerdos contractuales independientes y adicionales para la distribución no exclusiva de la versión del artículo publicado en esta revista (p. ej., incluirlo en un repositorio institucional o publicarlo en un libro) siempre que indiquen claramente que el trabajo se publicó por primera vez en esta revista.
- Se permite y recomienda a los autores/as a publicar su trabajo en Internet (por ejemplo en páginas institucionales o personales), una vez publicado en la revista y citando a la misma ya que puede conducir a intercambios productivos y a una mayor y más rápida difusión del trabajo publicado (vea The Effect of Open Access).







