Inyección indirecta de prompts en copilotos municipales para el procesamiento de documentos: Ataques, defensas y perjuicios

Una evaluación representativa de prueba de concepto en cuatro grandes modelos de lenguaje

Autores/as

  • Jorge Cisneros-González Advanced Artificial Intelligence Group (A2IG), Escuela Politécnica Superior, Universidad Francisco de Vitoria, Pozuelo de Alarcón, 28223 Madrid, Spain https://orcid.org/0009-0003-7859-5622
  • José Antonio Ondiviela García Citizen-Centric Intelligent Cities Research Institute, Universidad Francisco de Vitoria, Madrid, Spain https://orcid.org/0000-0001-6732-8754
  • Javier Sánchez-Soriano Advanced Artificial Intelligence Group (A2IG), Escuela Politécnica Superior, Universidad Francisco de Vitoria, Pozuelo de Alarcón, 28223 Madrid, Spain

DOI:

https://doi.org/10.62161/sauc.v12.6399

Palabras clave:

inyección de prompts, grandes modelos de lenguaje, ciberseguridad de la IA, gestión de expedientes, contratación electrónica, gobierno electrónico

Resumen

Las administraciones públicas están desplegando asistentes basados en grandes modelos de lenguaje (LLM) que procesan, resumen, clasifican y validan documentos ciudadanos. Estos copilotos están expuestos a la inyección indirecta de prompts: instrucciones ocultas en documentos manipulados que llegan al modelo como si fueran datos.

Desarrollamos un copiloto para procedimientos municipales de ayudas y evaluamos su robustez frente a seis objetivos de ataque, cinco vectores de entrega, cinco defensas y cuatro LLM, con 3.000 evaluaciones de ataques y 1.000 legítimas. Combinamos detección determinista con un evaluador LLM validado por humanos.

Las defensas reducen el éxito de los ataques, pero de forma desigual. Neutralizan en gran medida ataques imperativos, como el desvío de solicitudes, pero apenas afectan a la falsificación de resúmenes, revelando una brecha de procedencia: la incapacidad de determinar si un valor de salida procede de un campo autorizado o de contenido controlado por el atacante. Además, el éxito de los ataques y el daño potencial están desacoplados: el fraude de pagos y la extracción de reglas presentan el mayor potencial de daño pese a tasas de éxito intermedias. El riesgo se analiza en un modelo human-in-the-loop, donde el sesgo de automatización puede amplificar el daño.

Descargas

Los datos de descargas todavía no están disponibles.

Estadísticas globales ℹ️

Totales acumulados desde su publicación
0
Visualizaciones
0
Descargas
0
Total

Citas

Agencia Española de Protección de Datos. (2025). Política general para el uso de IA generativa en procesos administrativos de la AEPD. https://www.aepd.es/recurso-multimedia/politica-general-interna-para-el-uso-de-ia-generativa-en-procesos

Alon-Barkat, S., & Busuioc, M. (2023). Human–AI interactions in public sector decision making: “Automation bias” and “selective adherence” to algorithmic advice. Journal of Public Administration Research and Theory, 33(1), 153–169. https://doi.org/10.1093/jopart/muac007

Autio, C., Schwartz, R., Dunietz, J., Jain, S., Stanley, M., Tabassi, E., Hall, P., & Roberts, K. (2024). Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile (Number NIST AI 600-1). https://doi.org/10.6028/NIST.AI.600-1

Chen, S., Piet, J., Sitawarin, C., & Wagner, D. (2025). StruQ: Defending against prompt injection with structured queries. 34th USENIX Security Symposium (USENIX Security 25), 2383–2400.

Chiang, C.-H., & Lee, H. (2023). Can large language models be an alternative to human evaluations? Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics, Volume 1, 15607–15631. https://doi.org/10.18653/v1/2023.acl-long.870

Debenedetti, E., Zhang, J., Balunovic, M., Beurer-Kellner, L., Fischer, M., & Tramèr, F. (2024). AgentDojo: A dynamic environment to evaluate prompt injection attacks and defenses for LLM agents. Advances in Neural Information Processing Systems (NeurIPS), 37, Datasets and Benchmarks Track.

European Parliament. (2024). Regulation (EU) 2024/1689 of the European Parliament and of the Council (Artificial Intelligence Act) of 13 June 2024 laying down harmonised rules on artificial intelligence and amending Regulations (EC) No 300/2008, (EU) No 167/2013, (EU) No 168/2013, (EU) 2018/858, (EU) 2018/1139 and (EU) 2019/2144 and Directives 2014/90/EU, (EU) 2016/797 and (EU) 2020/1828. http://data.europa.eu/eli/reg/2024/1689/oj

Gao, T., Yen, H., Yu, J., & Chen, D. (2023). Enabling large language models to generate text with citations. Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 6465–6488. https://doi.org/10.18653/v1/2023.emnlp-main.398

Goddard, K., Roudsari, A., & Wyatt, J. C. (2012). Automation bias: A systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association, 19(1), 121–127. https://doi.org/10.1136/amiajnl-2011-000089

Govern de les Illes Balears. (2026). El Govern destina 5,4 millones de euros a incorporar la inteligencia artificial a toda la Administración para ganar agilidad y eficiencia. https://www.caib.es/pidip2front/jsp/es/ficha-convocatoria/el-govern-destina-54-millones-de-euros-a-incorporar-la-inteligencia-artificial-a-toda-la-administracion-para-ganar-agilidad-y-eficiencia

Greshake, K., Abdelnabi, S., Mishra, S., Endres, C., Holz, T., & Fritz, M. (2023). Not what you’ve signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection. https://arxiv.org/abs/2302.12173

Hines, K., Lopez, G., Hall, M., Zarfati, F., Zunger, Y., & Kiciman, E. (2024). Defending against indirect prompt injection attacks with spotlighting. Proceedings of the Conference on Applied Machine Learning in Information Security (CAMLIS 2024), CEUR Workshop Proceedings, 3920, 48–62.

Liu, Y., Jia, Y., Geng, R., Jia, J., & Gong, N. Z. (2024). Formalizing and benchmarking prompt injection attacks and defenses. 33rd USENIX Security Symposium (USENIX Security 24), 1831–1847. https://www.usenix.org/conference/usenixsecurity24/presentation/liu-yupei

Lyell, D., & Coiera, E. (2017). Automation bias and verification complexity: A systematic review. Journal of the American Medical Informatics Association, 24(2), 423–431. https://doi.org/10.1093/jamia/ocw105

Madan, R., & Ashok, M. (2023). AI adoption and diffusion in public administration: A systematic literature review and future research agenda. Government Information Quarterly, 40(1), 101774. https://doi.org/10.1016/j.giq.2022.101774

OWASP Foundation. (2026). OWASP Top 10 for LLM Applications 2026 (Version 2026). https://genai.owasp.org/resource/owasp-genai-llm-top-10-2026/

Red.es. (2024). El sistema de IA en Kit Consulting permite reducir los plazos de comprobación de documentos hasta un 70%. https://www.red.es/es/actualidad/noticias/kit-consulting-incorporacion-ia-justificacion-ayudas

Ruschemeier, H., & Hondrich, L. J. (2024). Automation bias in public administration—An interdisciplinary perspective from law and psychology. Government Information Quarterly, 41(3), 101953. https://doi.org/10.1016/j.giq.2024.101953

Yi, J., Xie, Y., Zhu, B., Kiciman, E., Sun, G., Xie, X., & Wu, F. (2025). Benchmarking and defending against indirect prompt injection attacks on large language models. Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD ’25), 1809–1820. https://doi.org/10.1145/3690624.3709179

Zhan, Q., Fang, R., Panchal, H. S., & Kang, D. (2025). Adaptive attacks break defenses against indirect prompt injection attacks on LLM agents. Findings of the Association for Computational Linguistics: NAACL 2025, 7116–7132. https://doi.org/10.18653/v1/2025.findings-naacl.395

Zhan, Q., Liang, Z., Ying, Z., & Kang, D. (2024). InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Large Language Model Agents. Proceedings of the Annual Meeting of the Association for Computational Linguistics, 10471–10506. https://doi.org/10.18653/v1/2024.findings-acl.624

Zheng, L., Chiang, W.-L., Sheng, Y., Zhuang, S., Wu, Z., Zhuang, Y., Lin, Z., Li, Z., Li, D., Xing, E. P., Zhang, H., Gonzalez, J. E., & Stoica, I. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. Advances in Neural Information Processing Systems, 36, 46595–46623.

Descargas

Publicado

2026-09-05

Cómo citar

Cisneros-González, J., Ondiviela García, J. A., & Sánchez-Soriano, J. (2026). Inyección indirecta de prompts en copilotos municipales para el procesamiento de documentos: Ataques, defensas y perjuicios: Una evaluación representativa de prueba de concepto en cuatro grandes modelos de lenguaje. Street Art & Urban Creativity, 12(5), 449–463. https://doi.org/10.62161/sauc.v12.6399

Número

Sección

Artículos de investigación