Cuando el agente lee el mundo, el mundo puede escribir en el agente

La quincena del 15 al 30 de agosto de 2026 ha dejado una cosecha densa de preprints centrados en un mismo nudo: los sistemas de IA que actúan, no solo responden. Los agentes LLM ya no se limitan a generar texto; leen correos, navegan páginas, ejecutan código, llaman a herramientas y guardan memoria entre sesiones. Cada una de esas capacidades abre una superficie que los doce trabajos de esta edición exploran con detalle quirúrgico.

El patrón que emerge no es nuevo en ciberseguridad, pero sí lo es en este contexto: la confianza implícita. Los sistemas RAG confían en lo que recuperan. Los agentes con memoria confían en lo que almacenaron. Los guardianes de acciones confían en el nombre del objeto que leen. Esa confianza, en todos los casos, se convierte en palanca de ataque. Y los defensores que solo protegen un punto de la cadena, la planificación, la ejecución o la recuperación, dejan flancos abiertos en el resto.

Lo que sigue es un recorrido técnico por las doce contribuciones, con el análisis de riesgo que cada una merece.

Panorama de un vistazo

TecnicaQue haceMadurez del riesgoFuenteFecha
MMJailBenchBenchmark factorizado para aislar qué factor visual o textual causa jailbreak en MLLMsDemostrado en laboratorioWang et al.2026-08-26
InjecMEMInyección de memoria en agentes LLM con una sola interacciónApoyado en vectores ya conocidosTian et al.2026-08-24
SecOPDDefensa por destilación on-policy con señal a nivel de token contra prompt injectionDemostrado en laboratorioPeng et al.2026-08-21
Trustworthy RAGAgente evaluador con índice de confianza para detectar envenenamiento en RAGDemostrado en laboratorioGiri et al.2026-08-21
RedEvoAgentAgente de red-teaming que destila trayectorias de ataque en habilidades reutilizablesDemostrado en laboratorioZhang et al.2026-08-27
SPAArquitectura plan-first con control de flujo de información para agentes persistentesDemostrado en laboratorioGirrens y Wang2026-08-27
The Framing GapReencuadre de inyección indirecta que lleva a GPT-4o del 0% al 100% de exfiltraciónApoyado en vectores ya conocidosRahman y Kim2026-08-27
CautiousBenchBenchmark de sobre-rechazo en guardianes de agentes por efecto del nombre del objetoDemostrado en laboratorioZhang et al.2026-08-27
SkillShieldDefensa por habilidades de seguridad inyectadas en el prompt de sistema de agentes de códigoDemostrado en laboratorioWu et al.2026-08-26
EvoMalAuto-envenenamiento propagante en agentes de código con bibliotecas de habilidades compartidasApoyado en vectores ya conocidosWu et al.2026-08-26
Survey RAGRevisión unificada de ataques y defensas en todo el pipeline RAGTeórico a futuro (marco de referencia)Tran et al.2026-08-25
RAGSentinelDefensa geométrica certificable sin entrenamiento para filtrar documentos envenenados en RAGDemostrado en laboratorioQuan et al.2026-08-25

MMJailBench: aislar qué factor visual rompe la alineación

Cuando un modelo multimodal falla ante un jailbreak, la pregunta obvia es: ¿qué lo causó? ¿La imagen, el texto, la forma en que se planteó la petición, o el dominio de daño? Los benchmarks existentes mezclan todos esos factores en una sola instancia, lo que hace imposible responder esa pregunta con precisión. Según el trabajo de Wang, Jingsong Wang, Huang, Li, Li y Zhu, MMJailBench resuelve ese problema con un diseño factorizado: varía y combina de forma controlada la intención dañina, el encuadre del prompt, la semántica visual y el soporte de la instrucción, permitiendo atribuir la vulnerabilidad a cada factor por separado.

Los autores evalúan 16 modelos, tanto de código abierto como propietarios, y reportan perfiles de vulnerabilidad altamente heterogéneos y dependientes del modelo. El encuadre del prompt emerge como la fuente de variación dominante. La semántica visual relevante para la tarea aumenta sistemáticamente la susceptibilidad al jailbreak, y las señales de tipo autoritario producen vulnerabilidades especialmente pronunciadas. En cambio, las instrucciones renderizadas visualmente, es decir, texto incrustado en imágenes, no aumentan de forma consistente la susceptibilidad respecto a las instrucciones textuales directas. Los autores también identifican patrones asociados a vulnerabilidades en representaciones internas y en interacciones entre modalidades de un modelo de código abierto representativo.

Desde la lectura del editor, este trabajo encaja con claridad en LLM01 (Prompt Injection) del OWASP Top 10 for LLM Applications, extendido al dominio multimodal, y toca también LLM04 (Data and Model Poisoning) cuando la semántica visual actúa como vector de manipulación. La heterogeneidad de perfiles entre modelos es la señal más relevante para el defensor: no existe un perfil de riesgo universal para los MLLMs, lo que hace que las auditorías genéricas sean insuficientes. El benchmark incluye configuraciones ligeras y múltiples opciones de juez para facilitar auditorías reproducibles y escalables.

MMJailBench, Wang et al., 2026-08-26

InjecMEM: una sola interacción para envenenar la memoria de un agente

La memoria persistente en agentes LLM, ese subsistema que permite que el modelo recuerde preferencias y contexto entre sesiones, se está convirtiendo en infraestructura por defecto. Tian, Zhang, Sha, Wang, Liu, Huang, Yang y Huang se preguntan si esa memoria introduce nuevas vulnerabilidades, y la respuesta que proponen es InjecMEM, un paradigma de ataque de inyección en memoria que requiere una sola interacción sin acceso de lectura ni escritura directa al almacén.

El mecanismo se apoya en cómo funcionan los sistemas de memoria: recuperan registros relevantes y los pasan al generador. InjecMEM construye la inyección con dos componentes. El primero es un ancla agnóstica al recuperador, con señales temáticas de alta recuperación para que el registro se asocie consistentemente con el tema objetivo. El segundo es un comando adversarial corto, optimizado mediante búsqueda coordinada por gradiente, que permanece efectivo bajo contextos fusionados inciertos, posiciones variables y prompts largos. Los autores reportan que el ataque logra recuperación condicionada al tema y generación dirigida de forma fiable, permanece efectivo bajo deriva de memoria, y no afecta a consultas no relacionadas con el objetivo.

Para el editor, este vector se alinea directamente con la táctica AML.T0051 (LLM Prompt Injection) de MITRE ATLAS, pero con una dimensión nueva: la persistencia. El ataque no necesita estar presente en cada interacción; basta con haber contaminado la memoria una vez. Eso lo convierte en un vector especialmente difícil de detectar con monitores de sesión convencionales. La transferencia entre modelos backbone, que los autores también estudian, añade preocupación sobre la portabilidad del ataque.

InjecMEM, Tian et al., 2026-08-24

SecOPD: señal a nivel de token para defender contra inyecciones adaptativas

La inyección de prompt ocupa el primer puesto en la lista de amenazas a agentes de IA. Peng, Lian, Wagner y Chen parten de un diagnóstico concreto: los métodos de fine-tuning defensivo existentes, basados en señales de retroalimentación a nivel de secuencia como DPO o GRPO, tratan toda la salida por igual, lo que impide que el modelo aprenda qué tokens específicos son inseguros. Esa granularidad insuficiente explica, según los autores, por qué los modelos defendidos con esas técnicas siguen sufriendo tasas de éxito de ataque cercanas al 100% frente a inyecciones adaptativas.

SecOPD, Secure On-Policy Distillation, propone señal a nivel de token: el LLM recibe una muestra inyectada, produce una secuencia, y cada token se puntúa con el modelo de inicialización dado el input limpio correspondiente. Los autores reportan que su modelo Qwen3.6-27B defendido alcanza un 9,0% de tasa de éxito de ataque frente a las inyecciones adaptativas PISmith de última generación, frente al 94,0% del anterior estado del arte, Meta-SecAlign. En llamadas a herramientas agénticas, SecOPD logra un 4,7% frente al 5,5% de Meta-SecAlign. El código y el modelo están disponibles públicamente.

El editor señala que la mejora es sustancial y el encuadre técnico es sólido, pero conviene recordar que estas cifras provienen de entornos de evaluación controlados. Los autores atribuyen los resultados a benchmarks específicos, y la transferencia a despliegues reales con distribuciones de ataque más ruidosas y diversas requerirá validación adicional. Dicho esto, la dirección de granularidad de señal es convincente y abre una línea de trabajo relevante para quienes entrenan modelos propios.

SecOPD, Peng et al., 2026-08-21

Trustworthy RAG: un agente evaluador con índice de confianza para el pipeline RAG

Los sistemas RAG (Retrieval-Augmented Generation, generación aumentada por recuperación) anclan las respuestas de un LLM en documentos externos. El problema, según Giri, Hasan, Rasku, Waseem y Abrahamsson, es que esos sistemas suelen confiar en todo lo que recuperan. Alta relevancia semántica no garantiza veracidad factual. Los adversarios explotan esa brecha mediante envenenamiento de conocimiento: insertan documentos maliciosos para provocar desinformación dirigida.

El trabajo propone un agente evaluador como middleware que combina verificación factual por inferencia de lenguaje natural, un detector de cinco señales con agregación ponderada por relevancia, y un índice de confianza definido como T = 0,4F + 0,35C + 0,25(1-P) con un amortiguador no lineal para contextos de alta contaminación. Sobre TruthfulQA con Llama 3.3 70B, los autores reportan un 91% de precisión general y un 100% de precisión en detección de inyección de instrucciones, con un 100% de recall en ese mismo tipo de ataque. Sin embargo, las ediciones en sitio como intercambios de entidades resultan difíciles de detectar. El ROC-AUC del índice de confianza oscila entre 0,73 y 0,81 en tres LLMs distintos. Los autores también señalan que un resultado más débil en FEVER indica que la generalización entre datasets requiere calibración específica por dominio.

Desde la perspectiva del editor, el 100% de recall en inyección de instrucciones es una cifra que merece contexto: proviene de un entorno de laboratorio con ataques conocidos y bien delimitados. Los ataques sutiles de debilitamiento semántico, que los propios autores reconocen como difíciles, son probablemente los más frecuentes en un adversario sofisticado. El trabajo encaja con LLM04 (Data and Model Poisoning) de OWASP y con la táctica AML.T0054 (LLM Jailbreak) de MITRE ATLAS en su variante de envenenamiento de corpus. La calibración por umbral por modelo que los autores proponen es una medida práctica y realista.

Trustworthy RAG, Giri et al., 2026-08-21

RedEvoAgent: red-teaming automático con habilidades de ataque que evolucionan

El red-teaming automático de agentes LLM tiene un problema estructural: los métodos con ataques fijos se quedan obsoletos, y los atacantes agénticos más recientes que coordinan múltiples herramientas pueden reutilizar experiencias engañosas por sesgos de recuperación y atribución de crédito poco clara. Zhang, Liu, Chen, Mo, Chen y Li proponen RedEvoAgent, un agente de red-teaming de caja negra que destila trayectorias de ataque entre casos en habilidades de ataque concisas y legibles por humanos.

Las habilidades evolucionan de forma adaptativa mediante perfilado de efectividad de herramientas y atribución de crédito por herramienta para las actualizaciones, más un mecanismo de trinquete de validación que retiene solo las actualizaciones que mejoran el rendimiento de validación. Los autores reportan que RedEvoAgent supera a los baselines fijos y agénticos en múltiples benchmarks, modelos objetivo y entornos de ejecución, mejora la eficiencia de herramientas y transfiere entre modelos atacantes y entornos de ejecución objetivo.

Para el editor, RedEvoAgent es relevante no como amenaza directa sino como herramienta de auditoría. La capacidad de transferencia entre entornos es el dato más valioso: sugiere que las habilidades de ataque destiladas no son artefactos del benchmark sino patrones más generales. Encuadra bien con la táctica AML.T0043 (Craft Adversarial Data) de MITRE ATLAS. Quien gestiona la seguridad de un agente en producción debería considerar si tiene acceso a herramientas de red-teaming con capacidad evolutiva similar, o si sus auditorías se basan en ataques estáticos que el sistema ya ha aprendido a rechazar.

RedEvoAgent, Zhang et al., 2026-08-27

SPA: arquitectura plan-first con control de flujo de información para agentes persistentes

Los agentes LLM persistentes, los que mantienen estado entre consultas y operan sobre páginas web, documentos, herramientas y estados de sesión, enfrentan una amenaza más amplia que los agentes de una sola interacción. Girrens y Wang identifican tres vectores específicos: datos controlados por el atacante que alteran el flujo de control, que entran en argumentos de herramientas sensibles, o que comprometen consultas posteriores.

SPA, Securing Persistent LLM Agents Across Queries, propone una arquitectura plan-first: el planificador se invoca una vez por consulta para generar un plan ejecutable completo en un lenguaje de dominio específico declarativo. Luego aplica control de flujo de información de doble retícula para rastrear confidencialidad e integridad en flujos de datos explícitos y dependencias de control. Los resultados de ejecución se almacenan como artefactos etiquetados; en planificaciones posteriores solo se expone metadatos semánticos, no los payloads sin procesar. Los autores reportan que bajo el ataque tool_knowledge, SPA con control de flujo de información reduce el éxito del ataque a cero en AgentDojo y a 0,2% en AgentDojo-MQ, su extensión multi-consulta. Los autores también señalan un compromiso importante entre seguridad y utilidad introducido por la aplicación estricta de integridad.

El editor valora especialmente la honestidad de ese último punto. Llevar la tasa de éxito de ataque a cero tiene un coste en utilidad que el trabajo cuantifica, y eso es exactamente el tipo de información que necesita un arquitecto de sistemas para tomar decisiones informadas. El enfoque encaja con AML.T0051 de MITRE ATLAS y con LLM01 de OWASP en su variante de inyección indirecta persistente. La separación entre planificador y ejecutor, con artefactos etiquetados como interfaz, es una idea de diseño exportable a otros contextos.

SPA, Girrens y Wang, 2026-08-27

The Framing Gap: reencuadrar la inyección lleva a GPT-4o del 0% al 100%

Este trabajo de Rahman y Kim es, probablemente, el más inmediatamente preocupante de la quincena. El punto de partida es un agente LLM que usa herramientas y lee contenido web controlado por el atacante mientras mantiene un secreto. La inyección indirecta de prompt, el intento de que el agente exfiltre ese secreto, es rechazada sistemáticamente por seis modelos cuando se presenta de forma directa: GPT-4o la rechaza al 0%. Pero reencuadrar la misma fuga como una firma de integridad obligatoria, un campo de configuración, o un host de confianza de aspecto similar lleva a GPT-4o del 0% al 100%.

Los autores caracterizan el coste del ataque en tres niveles. Parafrasear un mecanismo conocido es trivial: 96% de éxito con tres formulaciones. Intercambiar el campo dentro de una plantilla efectiva conocida es barato: hasta un 60%. Pero crear una página nueva alrededor de un mecanismo completamente nuevo es difícil: 0 de 130 intentos. El activo reutilizable es la plantilla, no el mecanismo. Una ablación muestra que el mecanismo es confusión instrucción/dato, no alineación derrotada: eliminar la política de confidencialidad deja los ataques base al 0% y mueve el reencuadre solo del 31,9% al 38,1%. Los autores también reportan que una defensa de fine-tuning publicada, SecAlign de CCS 2025, no cierra la brecha en un agente con herramientas (32,5%), ni lo hace la separación de canales (38,8%). Un guardián normalizador de salida pierde ante una codificación no vista, ROT13, con un 100% de éxito del ataque. Lo que cierra la brecha es una lista de destinos permitidos (0% cuando los destinos están cerrados) o una separación planificador/lector que aísla capacidades (0%).

El editor encuadra esto directamente en LLM01 (Prompt Injection) de OWASP y en AML.T0051 de MITRE ATLAS. La cifra del 100% proviene de un laboratorio sintético controlado con secretos canario y herramientas simuladas, y los autores son explícitos al respecto. Pero la dirección del resultado es clara: las defensas basadas en que el modelo reconozca el ataque son frágiles. Las defensas estructurales, listas de destinos, separación de capacidades, son las que aguantan.

The Framing Gap, Rahman y Kim, 2026-08-27

CautiousBench: cuando el nombre del objeto hace que el guardián rechace acciones legítimas

Los guardianes de agentes, los componentes que aprueban o rechazan cada acción antes de que el LLM la ejecute, tienen un problema simétrico al del jailbreak: el sobre-rechazo. Rechazar una acción legítima bloquea el despliegue. Zhang, Xie y Chen argumentan que evaluar el sobre-rechazo es difícil porque en el límite una acción autorizada se parece a una no autorizada, y la etiqueta seguro/inseguro depende de la política de autorización, no de la acción en sí.

El trabajo construye CautiousBench, el primer benchmark que hace del sobre-rechazo el objeto de estudio para guardianes de agentes. Cada muestra y su etiqueta se codiseñan con una política de autorización explícita, y una compuerta en tiempo de construcción rederiva cada ejemplo para certificar que la etiqueta es consecuencia mecánica de la política. El benchmark produce 756 pares decidibles benigno/gemelo, cada uno bajo tres tipos de nombre de objeto (2.268 pares medidos), y 40 pares indecidibles reportados por separado. Midiendo seis guardianes de cinco diseños, los autores reportan un efecto de superstición de nombre: cada guardián sobre-rechaza una acción autorizada más a menudo cuando el nombre del objeto tiene aspecto amenazante que cuando tiene aspecto benigno. Como solo varía el nombre del objeto en esos experimentos de contraste, los autores atribuyen la desviación al nombre: los guardianes leen la etiqueta superficial, no el contexto de autorización.

Para el editor, este resultado tiene implicaciones prácticas inmediatas. Un guardián que falla por el nombre del objeto es un guardián que puede ser manipulado en ambas direcciones: para bloquear acciones legítimas o, potencialmente, para dejar pasar acciones maliciosas con nombres de aspecto inocuo. El trabajo no explora esa segunda dirección, pero la simetría es evidente. Encuadra con LLM01 de OWASP y con la necesidad de políticas de autorización explícitas y verificables, no inferidas del texto.

CautiousBench, Zhang et al., 2026-08-27

SkillShield: habilidades de seguridad en el prompt de sistema para agentes de código

Un agente de código edita ficheros y ejecuta comandos de shell con los privilegios del desarrollador. Las peticiones maliciosas se traducen directamente en acciones dañinas o en malware funcional. Wu, Zhao, Li, Li, Shi, Adams y Ni identifican las limitaciones complementarias de las defensas existentes: la alineación a nivel de pesos no está disponible para quienes solo tienen acceso a la API, mientras que los filtros de entrada y los monitores de frontera de ejecución requieren componentes auxiliares de clasificación.

SkillShield propone una defensa en el prompt de sistema: sintetiza habilidades de seguridad offline a partir de ataques conocidos o fallos registrados del agente, las inyecta en el prompt de sistema al inicio de la sesión, y las mantiene activas durante todo el bucle de uso de herramientas. Los autores examinan tres alcances de provisión con presupuesto fijo: todas las clases (una habilidad para todas las amenazas), por paquete (una habilidad por subconjunto relacionado), y por clase (una habilidad por clase conocida, usada como referencia de límite superior). Ninguno requiere clasificación de peticiones en tiempo de ejecución. En seis LLMs sobre RedCode, los autores reportan que la habilidad por defecto de todas las clases reduce la severidad de generación de malware de 3,37 a 0,58 y logra un 43,6% de tasa de éxito de ataque de ejecución, comparable al 42,7% de Llama Guard 3 sin su clasificador separado de 8B. Los ajustes por paquete y por clase reducen esa tasa a 36,2% y 14,5% respectivamente. En 731 descripciones de tareas benignas, SkillShield produce una tasa media de rechazo por seguridad del 0,14%.

El editor señala que la comparabilidad con Llama Guard 3 sin clasificador auxiliar es el argumento más práctico del trabajo: ofrece una defensa accesible para quienes no pueden modificar pesos ni añadir componentes de inferencia adicionales. Las cifras de tasa de éxito de ataque provienen de entornos de benchmark controlados, y la robustez frente a jailbreaks adaptativos no vistos en entrenamiento, que los autores también reportan, es un dato positivo pero que requerirá confirmación en condiciones más adversariales. Encuadra con LLM01 y LLM04 de OWASP.

SkillShield, Wu et al., 2026-08-26

EvoMal: un gusano que se propaga a través de la biblioteca de habilidades del agente

Los agentes de código auto-evolutivos escriben sus propias herramientas imitando habilidades recuperadas de bibliotecas compartidas. Wu, Shi, Li, Zhao, Li, Adams, Hassan y Ni identifican una vulnerabilidad en ese bucle: durante la autoría, una habilidad maliciosa recuperada puede convertirse en plantilla para una nueva habilidad que preserva el payload. Los autores llaman a esto auto-envenenamiento.

EvoMal explota esa vulnerabilidad amplificando el auto-envenenamiento mediante un banner, un conjunto de elementos estructurales de aspecto benigno que induce al agente imitador a reproducir el código encerrado. El atacante planta habilidades maliciosas en la biblioteca sin invocarlas. El agente entonces autoriza y ejecuta nuevas habilidades que llevan el código dañino. Cada copia autorizada puede reentrar en la biblioteca y ser imitada de nuevo, formando un gusano auto-propagante que persiste después de que las habilidades plantadas se eliminen. Los autores definen la tasa de auto-envenenamiento del agente (ASPR) como la fracción de tareas que añaden una nueva habilidad maliciosa a la biblioteca. En seis modelos sobre 153 tareas de SWE-bench Verified relevantes para herramientas, reportan un ASPR de entre 20,3% y 41,8%, con bibliotecas envenenadas que contienen entre 4,9 y 9,0 veces más habilidades maliciosas que las plantadas. La vulnerabilidad también aparece sin banner: DeepSeek-V4-Pro alcanza un 11,1% de ASPR con el payload solo. Adaptar las descripciones de habilidades plantadas a una familia de tareas eleva el ASPR al 86,7%. Tras eliminar las habilidades plantadas, Qwen3 retiene un ASPR de ronda 5 del 68% porque las copias autorías por el agente permanecen. Los autores proponen un counter-prompt que reduce el ASPR de EvoMal a un máximo del 6,7% sin pérdida significativa de completitud de tareas.

El editor considera EvoMal uno de los vectores más novedosos de esta quincena. La persistencia post-eliminación es el elemento más preocupante: las defensas que se centran en nombres, código y firmas de habilidades enviadas por el atacante no detectan las copias generadas por el propio agente. Encuadra con AML.T0054 de MITRE ATLAS y con LLM04 (Data and Model Poisoning) de OWASP. El ASPR del 86,7% con descripciones adaptadas proviene de condiciones de laboratorio optimizadas, y el propio counter-prompt propuesto es una medida de prompt, no de arquitectura, lo que limita su robustez frente a variantes adaptativas.

EvoMal, Wu et al., 2026-08-26

Survey RAG: mapa unificado de ataques y defensas en el pipeline completo

Tran, Dang, Nguyen, Tran, Nguyen, Chau, Le, Long, Zhang, Wang, Nguyen, Le y Wang presentan una revisión sistemática del estado de la seguridad en sistemas RAG. El argumento de partida es que los surveys existentes tienen cobertura limitada de objetivos del atacante, modelos de amenaza y defensas específicas por etapa a lo largo del pipeline completo.

El trabajo formaliza modelos de amenaza sobre el corpus, el recuperador y el generador, y organiza los ataques en tres objetivos principales: precisión, privacidad y equidad. Las defensas se revisan desde una perspectiva consciente del pipeline, cubriendo las etapas de recuperación, reranking, generación y trazabilidad. Los autores también resumen benchmarks de robustez y métodos de explicabilidad para evaluar y explicar la robustez RAG con mayor profundidad.

Para el editor, el valor de este trabajo es cartográfico: ofrece el marco conceptual que permite situar los otros trabajos de RAG de esta quincena, Trustworthy RAG y RAGSentinel, en su contexto más amplio. La taxonomía de tres objetivos, precisión, privacidad y equidad, es útil para priorizar defensas según el perfil de riesgo de cada despliegue. La cobertura de ataques de privacidad y equidad, que los otros trabajos de esta edición no abordan, recuerda que el envenenamiento de corpus no solo busca desinformación sino también fuga de datos o discriminación sistemática.

Survey RAG, Tran et al., 2026-08-25

RAGSentinel: filtrado geométrico certificable de documentos envenenados

Las defensas post-recuperación existentes para RAG se apoyan en seguimiento de instrucciones, conocimiento paramétrico o consistencia textual. Quan, Gao, Xia, Fang y Liu argumentan que todas esas propiedades pueden ser imitadas u optimizadas por atacantes adaptativos. RAGSentinel propone un enfoque diferente: sin entrenamiento, sin etiquetas, para sistemas RAG de caja negra.

El sistema usa un codificador sustituto para medir los desplazamientos en el espacio de representaciones ocultas inducidos por cada documento recuperado, condicionados a la consulta. Elimina las direcciones temáticas compartidas y filtra los documentos envenenados como valores atípicos geométricos respecto a un consenso de mayoría robusto. Los autores demuestran que, bajo una suposición de mayoría honesta y una condición de separación a nivel de representación, RAGSentinel recupera exactamente un contexto de mayoría libre de veneno. En experimentos sobre tres datasets de preguntas y respuestas, tres familias de LLMs y múltiples ataques de envenenamiento, los autores reportan tasas de éxito de ataque consistentemente bajas preservando precisión competitiva, y efectividad frente a ataques adaptativos con conocimiento completo del pipeline.

El editor valora el enfoque geométrico por su independencia del tipo de ataque: no necesita conocer la firma del veneno para detectarlo, solo que se desvía del consenso de mayoría. La condición de mayoría honesta es el supuesto crítico: si el atacante controla más de la mitad de los documentos recuperados, la garantía se rompe. Eso hace que el tamaño del conjunto de recuperación y la diversidad de fuentes sean parámetros de seguridad, no solo de calidad. Encuadra con LLM04 de OWASP y con AML.T0054 de MITRE ATLAS.

RAGSentinel, Quan et al., 2026-08-25

Qué defender

La quincena dibuja un ecosistema de amenazas que ya no se puede tratar componente a componente. Los agentes LLM tienen memoria, llaman a herramientas, leen el mundo exterior, generan código y comparten bibliotecas de habilidades. Cada uno de esos canales es una superficie de ataque, y los trabajos de esta edición demuestran que proteger uno solo deja los demás expuestos. SPA lo dice explícitamente: las defensas que protegen solo la planificación o solo la ejecución individual no bastan para agentes persistentes. The Framing Gap lo confirma desde el lado del ataque: SecAlign, una defensa de fine-tuning publicada, no cierra la brecha en un agente con herramientas.

El efecto de superstición de nombre documentado en CautiousBench añade una dimensión incómoda: los guardianes que se supone que protegen el sistema pueden ser manipulados por la superficie textual de los objetos que evalúan, sin que el atacante necesite alterar la lógica de la acción. Y EvoMal introduce un vector de persistencia que las defensas actuales, centradas en habilidades enviadas por el atacante, no cubren: las copias generadas por el propio agente.

Triaje de inminencia: los vectores más urgentes son los que se apoyan en capacidades ya desplegadas. InjecMEM y EvoMal atacan subsistemas, memoria persistente y bibliotecas de habilidades compartidas, que ya existen en productos. The Framing Gap demuestra que el reencuadre de inyección indirecta es barato y efectivo contra modelos actuales en entornos de laboratorio controlados, lo que lo sitúa como el vector de atención inmediata para cualquier agente que lea contenido externo. El envenenamiento de corpus en RAG, cubierto por Trustworthy RAG, el survey y RAGSentinel, es un vector conocido con defensas en maduración, pero sin garantías robustas fuera de condiciones de mayoría honesta. MMJailBench, RedEvoAgent y CautiousBench son contribuciones de evaluación y auditoría, más que amenazas directas, aunque informan sobre dónde buscar. SecOPD y SkillShield son defensas prometedoras pero aún en fase de laboratorio.

Qué hacer mañana: para quien opera agentes en producción, la prioridad es estructural. Primero, implementar listas de destinos permitidos para cualquier herramienta de exfiltración o llamada de red saliente, y separar el componente planificador del componente lector de contenido externo, las dos medidas que The Framing Gap identifica como las únicas que cierran la brecha de forma robusta. Segundo, auditar las bibliotecas de habilidades compartidas de los agentes de código con un modelo de amenaza que incluya habilidades generadas por el propio agente, no solo las enviadas externamente. Tercero, calibrar los umbrales de los guardianes de acciones con políticas de autorización explícitas y verificables, no inferidas del texto del objeto. Cuarto, en sistemas RAG, diversificar las fuentes de recuperación y vigilar el tamaño del conjunto recuperado como parámetro de seguridad. Y quinto, aplicar Human-in-the-Loop estricto para cualquier ejecución de código o llamada a herramientas con acceso a recursos persistentes, mientras las defensas automáticas maduran.

Metodología y fuentes

Esta edición se basa exclusivamente en los abstracts de doce preprints publicados en arXiv entre el 21 y el 27 de agosto de 2026, todos de dominio público bajo licencia CC0 o equivalente de acceso abierto. Los datos, cifras y afirmaciones se atribuyen siempre a los autores de cada trabajo y no se alteran. Ningún resultado se presenta como probado o definitivo: son preprints sin revisión por pares. El análisis de encuadre en marcos OWASP y MITRE ATLAS, la valoración de madurez de riesgo y las recomendaciones defensivas son criterio editorial de La AutopsIA y no afirmaciones de los papers. Curado por La AutopsIA.

Cierre

La línea que separa un agente útil de un agente comprometido es, en varios de estos trabajos, tan delgada como el nombre de un objeto, la formulación de una firma de integridad, o una habilidad de aspecto benigno en una biblioteca compartida. Eso no es una metáfora: es el resultado medido en laboratorio, y el laboratorio suele ser más amable que la producción.


La AutopsIA del Riesgo | Ciberseguridad e Inteligencia Artificial. Serie quincenal de La AutopsIA. Reúne y analiza la investigación reciente en seguridad de la inteligencia artificial: recopila trabajos de fuentes abiertas, los explica en claro y los sitúa en el mapa de amenazas, sin alterar ni un dato. Curado por La AutopsIA.