En dos palabras

Esta serie analiza la investigación reciente en seguridad de la inteligencia artificial para quienes protegen sistemas reales. La edición de esta quincena gira en torno a una idea: cuando un modelo de lenguaje puede invocar herramientas, navegar por la web o coordinar otros agentes, la superficie de ataque crece de formas que los controles tradicionales no cubren. Si tu organización despliega o evalúa agentes con acceso a herramientas externas, lo que sigue te concierne directamente.

Contexto

Los agentes basados en modelos de lenguaje han dejado de ser prototipos de laboratorio. Se integran en pipelines de desarrollo, en sistemas de diagnóstico médico, en navegadores que ejecutan acciones bajo sesión autenticada del usuario. Esa integración arrastra un problema estructural: el modelo recibe texto de fuentes externas, y ese texto puede contener instrucciones maliciosas. La inyección de prompt indirecta, el envenenamiento de memoria y la manipulación de herramientas no son vectores hipotéticos; son el hilo conductor de la mayoría de los trabajos que llegan esta quincena.

Lo que hace interesante este periodo es la variedad de ángulos. Algunos equipos atacan, otros defienden, y unos pocos construyen infraestructura para que la comunidad pueda entrenar y evaluar agentes ofensivos y defensivos de forma sistemática. El resultado es un mapa bastante completo de dónde están los flancos abiertos en 2026.

La ciberseguridad e inteligencia artificial confluyen aquí en un punto concreto: la confianza implícita. Los modelos confían en el texto que reciben porque así están diseñados. Romper esa confianza de forma controlada, o contenerla con arquitecturas que no dependan del juicio del propio modelo, es el problema central de esta quincena.

Panorama de un vistazo

TecnicaQue haceMadurez del riesgoFuenteFecha
Defensas universales para agentes con herramientasFiltra herramientas sospechosas y restaura el conjunto original antes de planificarDemostrado en laboratorioLi y Wang, 20262026-09-14
Fusión espectral y clustering para backdoors en imágenes médicasCombina dos detectores de backdoor en una puntuación única por muestraDemostrado en laboratorioTamang, 20262026-09-13
ActGuard: auditoría de acciones antes de ejecutarCompara la acción candidata con una expectativa local para detectar desviaciones inducidas por inyecciónDemostrado en laboratorioWang et al., 20262026-09-14
Verifiable Action Card (VAC)Reconstruye la información de aprobación desde la acción real y la muestra fuera de bandaDemostrado en laboratorioIrshad et al., 20262026-09-16
Ataques de fragmentación cross-channel en MCPDistribuye la inyección entre canales para que ninguno la detecte por separadoApoyado en vectores ya conocidosEdiga y Chattopadhyay, 20262026-09-16
Propagación de confianza en pipelines multi-agenteEstudia cómo un agente comprometido escala privilegios hacia el ejecutorApoyado en vectores ya conocidosSafin et al., 20262026-09-15
SEMA-GUARD: detección de vulnerabilidades en ensambladorUsa redes neuronales de grafos con información semántica para detectar fallos en código compiladoDemostrado en laboratorioDursunoglu y Sulkalar, 20262026-09-15
InceptionRAG: envenenamiento RAG por inducción lógicaFragmenta el payload en pasajes dormidos que activan razonamiento multi-saltoApoyado en vectores ya conocidosZhang et al., 20262026-09-15
MAL Simulator: simulación de operaciones ciberEntrena agentes ofensivos y defensivos sobre grafos de ataque basados en lenguaje formalDemostrado en laboratorioNyberg et al., 20262026-09-15
Bugs Framework (BF) frente a CWEEvalúa si BF es mejor objetivo de clasificación automática de vulnerabilidades que CWETeórico a futuroHoque et al., 20262026-09-14
Pruebas adversariales de agentes de reparación automática de códigoMide cuántas veces un agente APR produce código inseguro ante descripciones de issues manipuladasApoyado en vectores ya conocidosTrad et al., 20262026-09-14
Construcción automática de grafos de ataque para pentesting agénticoTraduce salida de escáneres a predicados Datalog y genera caminos de ataque simbólicosDemostrado en laboratorioStevanovic y Wachter, 20262026-09-14

Defensas universales para agentes LLM con herramientas

Cuando un agente LLM puede invocar herramientas externas, el atacante tiene dos palancas: manipular el prompt que recibe el modelo o manipular las propias herramientas disponibles. Li y Wang proponen un marco que ataca ambas palancas a la vez. El trabajo introduce dos defensas basadas en herramientas: Attacker Tool Filtering, que aplica detección de anomalías (concretamente Isolation Forest) para identificar y eliminar herramientas sospechosas antes de que el agente planifique, y Normal Tool Recalling, un método de caja blanca que restaura el conjunto de herramientas original del agente antes de cada ciclo de planificación. Sobre esas dos capas añaden defensas de prompt: razonamiento en cadena (Chain-of-Thought), autorreflexión y paráfrasis de la tarea para dificultar que una inyección se propague.

Los autores evalúan el sistema sobre cuatro modelos de código abierto (Gemma2-9B, Qwen2-7B, LLaMA3-8B y LLaMA3.1-8B) y tres propietarios (GPT-3.5, GPT-4 y GPT-5), cubriendo cuatro tipos de ataque: inyección directa de prompt, inyección indirecta, envenenamiento de memoria y backdoors. Según el trabajo, los métodos reducen significativamente la tasa de éxito del ataque (Attack Success Rate, ASR), llegando a 0% de ASR en muchos escenarios, sin degradar la tasa de éxito en la tarea original.

Desde la lectura del editor, la arquitectura encaja con claridad en LLM07 (System Prompt Leakage) y LLM04 (Data and Model Poisoning) del OWASP Top 10 for LLM Applications, y con la táctica AML.T0054 de MITRE ATLAS (LLM Prompt Injection). El enfoque modular, capas independientes que se pueden activar o desactivar, es una ventaja operativa real: permite ajustar el nivel de restricción sin rediseñar el agente. Dicho esto, el editor recuerda que un 0% de ASR en muchos escenarios es una cifra de laboratorio controlado. Los benchmarks de ataque suelen ser más uniformes que el ruido de un despliegue real, donde las herramientas cambian, los prompts son menos predecibles y los atacantes adaptan sus payloads. El resultado es prometedor, pero la distancia entre laboratorio y producción sigue siendo relevante.

Li y Wang, 2026. Universal Defenses for Tool-Integrated LLM Agents Against Adversarial Attacks

Fusión espectral y clustering para detectar backdoors en imágenes médicas

El envenenamiento en tiempo de entrenamiento (data poisoning) es una amenaza reconocida en el sector sanitario. Tamang parte de esa premisa y combina dos técnicas de detección de backdoor que habitualmente se evalúan por separado: el análisis de firmas espectrales (que busca anomalías en el espacio de representaciones del modelo) y el clustering de activaciones (que agrupa las activaciones internas para separar muestras limpias de envenenadas). La propuesta es una regla de fusión a nivel de puntuación que combina ambas señales en una puntuación única por muestra y una estadística de acuerdo a nivel de modelo.

El trabajo evalúa el pipeline en un benchmark público de imágenes médicas y en CIFAR-10, con cuatro tasas de envenenamiento (0%, 1%, 5% y 10%) y cinco semillas por condición. Según los autores, el detector fusionado alcanza AUROC mayor o igual a 0.99 en todas las tasas de envenenamiento distintas de cero en el benchmark médico. El resultado en CIFAR-10 es más revelador: al 10% de envenenamiento, la tasa de verdaderos positivos del clustering de activaciones cae a 0.000 y el AUROC espectral se degrada a casi azar (0.545), a pesar de que la tasa de éxito del ataque confirma que el backdoor estaba completamente instalado. La fusión hereda ese fallo conjunto.

Este punto merece atención. El editor lo encuadra en LLM04 (Data and Model Poisoning) de OWASP y en AML.T0020 de MITRE ATLAS (Poison Training Data). La paradoja que expone el trabajo es importante para quien diseña defensas: dos detectores que funcionan bien por separado en condiciones moderadas pueden fallar simultáneamente cuando el ataque es más intenso, y su combinación no resuelve el problema. El AUROC de 0.99 en el benchmark médico es un resultado llamativo, pero proviene de un entorno sintético con tasas de envenenamiento controladas. En un hospital real, con datos heterogéneos y pipelines de entrenamiento menos supervisados, esa cifra no se puede asumir directamente.

Tamang, 2026. Fusing Spectral Signatures and Activation Clustering for Backdoor Detection in Healthcare Imaging Models

ActGuard: auditar la acción antes de ejecutarla

La inyección indirecta de prompt (IPI) ocurre cuando el contenido que devuelve una herramienta externa contiene instrucciones maliciosas que el agente interpreta como legítimas. Las defensas habituales, filtrado de contenido, planes pregenerados, restricciones de permisos, tienen un problema común: o son demasiado restrictivas y rompen tareas legítimas, o son demasiado permisivas y dejan pasar ataques sofisticados.

Wang y sus coautores proponen ActGuard, un marco de auditoría previa a la ejecución. La idea central es no juzgar si el contenido externo es sospechoso en abstracto, sino comparar la acción que el agente está a punto de ejecutar con lo que sería razonable esperar en ese punto de la tarea. Para ello, ActGuard predice qué herramientas debería usar la siguiente acción y construye un prior local sin restringir la trayectoria de ejecución. Antes de ejecutar, compara la acción candidata con ese prior mediante análisis contrastivo a nivel de herramienta y localización de evidencia a nivel de parámetro. Un verificador examina la evidencia localizada, enmascara solo los fragmentos confirmados como maliciosos y regenera la acción desde el contexto saneado.

Según los autores, ActGuard reduce las tasas de éxito del ataque a un nivel comparable al estado del arte en defensas, manteniendo la utilidad de la tarea cerca del escenario sin ataque. Desde la perspectiva del editor, el diseño encaja con LLM01 (Prompt Injection) de OWASP y con AML.T0054 de MITRE ATLAS. Lo más interesante arquitectónicamente es la separación entre detección y corrección: en lugar de bloquear o permitir la acción completa, el sistema intenta recuperar la intención legítima enmascarando solo lo malicioso. Eso reduce la pérdida de utilidad, que es el talón de Aquiles de los filtros agresivos. La pregunta que el abstract no responde es cómo se comporta el verificador cuando el contenido malicioso está entrelazado con información legítima necesaria para la tarea, un escenario que los atacantes sofisticados explorarán.

Wang et al., 2026. ActGuard: Pre-execution Action Auditing against Indirect Prompt Injection in LLM Agents

Verifiable Action Card: aprobación humana que no se puede falsificar

Los navegadores agénticos ejecutan acciones sensibles bajo la sesión autenticada del usuario. Si el propio diálogo de confirmación puede ser manipulado por contenido de la página o por el modelo, la aprobación humana deja de ser una garantía. Irshad y sus coautores identifican este problema con precisión: los mecanismos de Human-in-the-Loop (HITL) convencionales son insuficientes cuando el prompt de aprobación puede estar influenciado por contenido no confiable.

La propuesta es la Verifiable Action Card (VAC), una defensa arquitectónica que reconstruye la información de aprobación directamente desde la acción pendiente real en el navegador, sin pasar por el texto generado por el modelo ni por el contenido de la página. Esa información se muestra fuera de banda en el chrome del navegador (la interfaz de confianza del propio navegador, no el contenido de la página) y la aprobación queda vinculada a la acción exacta que se verificará en el momento de ejecutarla. El sistema combina cercado de procedencia, un descriptor de acción de verdad-base, confirmación por defecto denegada, y vinculación de ejecución.

Los autores evalúan VAC en un benchmark de 24 escenarios que cubre ataques de confused-deputy, falsificación de diálogos (Lies-in-the-Loop), inyección indirecta, sustitución adaptativa de acciones, evasión de procedencia y tareas legítimas. Según el trabajo, sin VAC la tasa de éxito del ataque oscila entre el 68% y el 100% según el modelo. Con VAC, la tasa de éxito del ataque cae a 0% en todos los modelos evaluados, con un 78% de tasa de completado de tareas legítimas y un 0% de tasa de bloqueo falso.

El editor encuadra esto en LLM01 (Prompt Injection) de OWASP y en AML.T0054 de MITRE ATLAS. La aportación conceptual es clara: mover la fuente de verdad de la aprobación fuera del canal que el atacante puede contaminar. Es un principio de diseño que va más allá de los LLM y conecta con la separación de canales de confianza en criptografía. La cifra de 0% de ASR en todos los modelos es llamativa y el editor la contextualiza: el benchmark tiene 24 escenarios, un conjunto controlado. Los ataques adaptativos en producción, donde el atacante conoce la arquitectura de VAC, no están evaluados en este trabajo.

Irshad et al., 2026. The Verifiable Action Card: Trustworthy Human-in-the-Loop Control for Secure Autonomous Agents

Confianza implícita y fragmentación cross-channel en MCP

El Model Context Protocol (MCP) permite a los LLM invocar herramientas externas. Cada interacción con una herramienta expone al modelo a texto controlado por el atacante a través de múltiples canales: descripciones de herramientas, resultados de herramientas, mensajes de muestreo. Todos comparten una única ventana de contexto sin separación de privilegios. Ediga y Chattopadhyay presentan un marco para medir el perfil de confianza de un LLM arbitrario y, a partir de esa medición, diseñar ataques de fragmentación cross-channel.

La idea del ataque es distribuir el payload malicioso entre dos o tres canales de forma que ninguno por separado contenga una inyección completa. El modelo, al procesar el contexto completo, ensambla los fragmentos y ejecuta la exfiltración de credenciales. Los autores evalúan sus ataques sobre 12 modelos de frontera, tres clientes en producción y seis payloads, con más de 15.000 pruebas en total. Según el trabajo, modelos que resisten completamente la inyección por un solo canal (0% de cumplimiento) exfiltran datos sensibles hasta en el 100% de los casos bajo fragmentación de dos canales. Los ejemplos que citan incluyen GPT-4o, Llama 70B, Composer 2 y Haiku 4.5. Los autores también demuestran explotación alineada con el valor declarado de la herramienta y una anulación del prompt de sistema mediante la implementación MCP de VS Code.

Este trabajo es, desde la lectura del editor, uno de los más relevantes de la quincena para quien opera sistemas en producción. Encaja directamente con LLM01 (Prompt Injection) de OWASP y con AML.T0054 de MITRE ATLAS, pero añade una dimensión nueva: la fragmentación entre canales como técnica de evasión. Los autores evalúan siete herramientas de seguridad MCP de terceros y tres defensas basadas en prompt. Según el trabajo, todas las herramientas fallaron en detectar payloads fragmentados, y las defensas de prompt resultaron específicas del modelo, no universales. El 100% de exfiltración en modelos que resistían inyección simple es una cifra de laboratorio, pero el vector es real y los canales MCP existen en despliegues actuales.

Ediga y Chattopadhyay, 2026. Measuring and Exploiting Implicit Trust in LLM Tool-Calling Pipelines

Propagación de confianza y contención estructural en pipelines multi-agente

Cuando varios agentes LLM colaboran en una tarea, los de menor privilegio pueden influir sobre los de mayor privilegio. Safin y sus coautores estudian este problema en un pipeline de cuatro agentes construido con LangGraph: Supervisor, Researcher, Validator y Executor. Los ataques evaluados son envenenamiento de memoria compartida e inyección indirecta de prompt mediante una aprobación falsificada incrustada en un documento recuperado.

El trabajo introduce la métrica Judgment Bypass Rate (JBR), que mide el compromiso en el agente atacado en lugar de en la acción final, lo que permite separar cuándo el Validator ha sido engañado de cuándo eso se traduce en una acción insegura. Según los autores, el envenenamiento de memoria alcanza la ejecución en todos los ensayos sin defensa. Con autorización habilitada mediante tokens firmados vinculados a la tarea y un oráculo de política verificado de forma independiente, el JBR se mantiene en 100% (el Validator sigue comprometido) pero la tasa de acciones inseguras cae a 0%. Un agente Observer reduce la tasa de falsos positivos en detección de secuestro de agente del 49% al 7% sin debilitar la seguridad a nivel de ejecución.

El editor encuadra esto en AML.T0010 de MITRE ATLAS (ML Supply Chain Compromise) y en LLM04 (Data and Model Poisoning) de OWASP. La distinción entre JBR y tasa de acciones inseguras es conceptualmente importante: muestra que un agente puede estar comprometido en su juicio y aun así no causar daño si la arquitectura contiene la ejecución. La lección práctica es que no se puede depender del juicio del LLM como última línea de defensa. La autorización estructural, externa al modelo, es lo que contiene el daño en este experimento.

Safin et al., 2026. Trust propagation and structural containment in Multi-agent LLM pipelines

SEMA-GUARD: vulnerabilidades en código ensamblador con grafos semánticos

Cuando no hay código fuente disponible, como ocurre en análisis de malware, firmware o sistemas embebidos, detectar vulnerabilidades en el binario compilado es un problema diferente. Los métodos actuales dependen de regularidades sintácticas o representaciones de alto nivel que son sensibles a cambios en el compilador. Dursunoglu y Sulkalar presentan SEMA-GUARD, un marco que combina análisis semántico con redes neuronales de grafos (GNN) para identificar fallos en código ensamblador.

El enfoque enriquece los grafos de flujo de control con información sobre la ejecución a bajo nivel: manipulaciones de pila, accesos a memoria y flujo de datos. La evaluación usa el Juliet Test Suite, traduciendo el código fuente a ensamblador y dividiéndolo en fragmentos a nivel de función. Según los autores, SEMA-GUARD alcanza una precisión del 85.1% y un F1 de 0.801, superando métodos que solo usan datos estadísticos o estructurales.

Desde la perspectiva del editor, este trabajo no toca directamente los LLM como vector de ataque, pero es relevante para la cadena de suministro de software y para los equipos que analizan binarios de terceros. El Juliet Test Suite es un benchmark sintético bien conocido, y el editor señala que los resultados en código real, con ofuscación, empaquetado o compiladores menos comunes, pueden diferir de los obtenidos en ese entorno controlado. La integración de información semántica en GNN es una dirección de investigación activa, y el trabajo aporta evidencia de que añadir contexto de ejecución mejora la detección frente a representaciones puramente estructurales.

Dursunoglu y Sulkalar, 2026. SEMA-GUARD: Semantic and Graph-Based Vulnerability Detection in Assembly Code

InceptionRAG: envenenamiento RAG por inducción lógica encadenada

Los sistemas de generación aumentada por recuperación (RAG) mejoran los LLM con conocimiento externo, pero esa conexión al corpus externo es también una superficie de ataque. Los ataques de envenenamiento de corpus existentes inyectan un payload malicioso completo en un único documento. Las defensas actuales han aprendido a detectar esa firma. Zhang y sus coautores presentan InceptionRAG, que subvierte ese paradigma.

En lugar de un documento con payload explícito, InceptionRAG fragmenta el payload en una cadena de pasajes dormidos. Cada pasaje parece inofensivo por separado y elude las defensas actuales. Cuando el sistema RAG recupera varios de esos pasajes juntos, el LLM los combina mediante razonamiento multi-salto y auto-deduce la desinformación objetivo. Para entornos de caja negra, los autores proponen ZOSO (zeroth-order suffix optimization), que automatiza la generación de sufijos autoritativos sin acceso a los gradientes del modelo.

Según los autores, InceptionRAG alcanza una tasa de éxito del ataque superior al 80% incluso bajo restricciones adversariales rigurosas, y muestra capacidad de evasión superior frente a defensas diseñadas para inyecciones en documento único. El trabajo también propone HODOR, una defensa basada en aislamiento de documentos que desacopla las dependencias lógicas adversariales. Los autores señalan una paradoja: cuanto más potente es el razonamiento del LLM, más vulnerable es a ataques que explotan ese razonamiento.

El editor encuadra InceptionRAG en LLM04 (Data and Model Poisoning) de OWASP y en AML.T0020 de MITRE ATLAS. El vector es especialmente preocupante porque ataca la fortaleza del sistema: la capacidad de razonamiento multi-salto que hace útiles a los LLM modernos. El 80% de tasa de éxito proviene de evaluaciones sobre tres datasets y tres LLMs en condiciones de laboratorio, pero el mecanismo de fragmentación es conceptualmente sólido y los escáneres de documentos únicos no lo detectan por diseño.

Zhang et al., 2026. InceptionRAG: Stealthy Poisoning Attack Against Retrieval-Augmented Generation

MAL Simulator: entrenamiento de agentes ciber sobre grafos de ataque formales

Nyberg y sus coautores presentan el MAL Simulator, un simulador de operaciones ciber construido sobre el Meta Attack Language (MAL). La idea es proporcionar un entorno donde entrenar agentes automáticos tanto ofensivos como defensivos, adaptable a diferentes dominios sin modificar el código fuente, porque la lógica del dominio se expresa en el lenguaje de modelado.

El trabajo incluye dos casos de estudio: un agente atacante y un agente defensor, ambos entrenados con aprendizaje por refuerzo (RL). Los modelos de red se basan en datos recogidos de una red emulada en el cyber range CRATE. Según los autores, el agente atacante entrenado alcanza los objetivos designados con mayor eficiencia que los métodos de búsqueda comparados, y el agente defensor induce costes menores que un agente heurístico naive bajo condiciones de alerta ruidosa. Al enfrentar el atacante RL contra el defensor RL, el rendimiento del defensor cae significativamente, lo que los autores interpretan como evidencia de la importancia de entrenar ambos roles en conjunto.

Desde la lectura del editor, este trabajo es infraestructura más que ataque o defensa directa. Su valor está en proporcionar un entorno reproducible para evaluar estrategias de respuesta automatizada. La caída del defensor ante el atacante RL es un resultado esperado en teoría de juegos, pero verlo cuantificado en un entorno formal es útil para quienes diseñan políticas de respuesta automática. El simulador es público, lo que facilita su adopción por la comunidad.

Nyberg et al., 2026. The MAL Simulator: Cyber Operations Simulation based on Attack & Defense Graphs

Bugs Framework frente a CWE: ¿un mejor objetivo para clasificación automática?

La clasificación de vulnerabilidades por causa raíz es la base de muchas actividades de seguridad. El Common Weakness Enumeration (CWE) es el estándar de facto, pero tiene un problema estructural: sus entradas se solapan, lo que hace que la misma vulnerabilidad pueda mapearse a múltiples debilidades. Eso complica el análisis de causa raíz y el triaje automatizado.

Hoque y sus coautores evalúan el Bugs Framework (BF), introducido en el NIST SP 800-231, como alternativa o complemento al CWE. BF organiza las vulnerabilidades en triples (causa, operación, consecuencia) encadenados, de forma que una vulnerabilidad lleva su causa raíz y su punto de impacto juntos en lugar de una etiqueta terminal única. El trabajo evalúa BF mediante un estudio inter-evaluador con dos expertos que mapean 13 CVEs de forma independiente, y mediante pruebas automatizadas con LLM bajo diferentes presupuestos computacionales. Según los autores, los anotadores muestran acuerdo fuerte en los ejes de causa y operación, y acuerdo moderado en el eje de atributo. Los resultados apoyan la afirmación de que BF es un marco más estructurado y amigable para la automatización que CWE, aunque el trabajo identifica lagunas específicas, como orientación insuficiente sobre atributos.

El editor sitúa este trabajo en el plano de la madurez de la infraestructura de seguridad más que en el de la amenaza inmediata. La clasificación automática de vulnerabilidades es un componente crítico de los pipelines de gestión de parches y de los sistemas de triaje. Si BF permite clasificaciones más reproducibles y automatizables, el impacto práctico es relevante, pero el trabajo es honesto sobre sus limitaciones: 13 CVEs es un corpus pequeño para sacar conclusiones definitivas.

Hoque et al., 2026. Evaluating the NIST Bugs Framework Against CWE as a Successor for Automated Vulnerability Classification

Agentes de reparación automática de código bajo ataque adversarial

Los agentes LLM para reparación automática de programas (APR, Automated Program Repair) prometen corregir bugs sin intervención humana. Trad y sus coautores se preguntan si se puede confiar en esos agentes cuando el atacante controla la descripción del issue que desencadena la reparación.

El trabajo construye SWEADV, un benchmark de 750 descripciones de issues adversariales derivadas de 150 tareas de reparación del SWE-bench Verified. Para cada tarea crean cinco variantes adversariales, una por tipo de ataque: ejecución de comandos, deserialización, path traversal, denegación de servicio y hashing débil. Evalúan agentes APR basados en GPT-5-Mini, MiniMax-M2.5 y DeepSeek-R. Según los autores, las descripciones adversariales inducen comportamiento malicioso con reparación exitosa en el 51.7% de los casos de media. Los mecanismos de detección tampoco salen bien parados: la detección previa a la reparación con LLM-as-judge alcanza solo un 62.3% de precisión media, y la detección posterior con análisis estático y LLM-as-judge logra un 39.4% y un 55.4% respectivamente.

El editor encuadra esto en LLM04 (Data and Model Poisoning) de OWASP y en AML.T0054 de MITRE ATLAS. El escenario es concreto y preocupante: un desarrollador crea un issue aparentemente legítimo, el agente APR lo procesa y produce un parche funcionalmente correcto pero con una vulnerabilidad introducida deliberadamente. Ni el análisis estático ni el LLM-as-judge detectan el problema con fiabilidad. El 51.7% de tasa de éxito es una media sobre tres modelos y cinco tipos de ataque en un benchmark controlado, pero el vector existe en cualquier pipeline de CI/CD que use agentes APR sin revisión humana del parche.

Trad et al., 2026. Adversarial Testing of Automated Program Repair Agents for Security Vulnerabilities

Construcción automática de grafos de ataque para pentesting agéntico

Los agentes LLM para pentesting carecen de razonamiento auditable: sus decisiones no dejan un rastro explícito de por qué eligieron un camino de ataque sobre otro. Stevanovic y Wachter proponen combinar la salida de escáneres convencionales con inferencia simbólica para generar grafos de ataque estructurados y auditables.

El pipeline traduce los hallazgos de Trivy, Semgrep y Nmap a predicados Datalog compatibles con MulVAL, y usa un proceso asistido por LLM para construir reglas Datalog específicas del dominio que conectan la evidencia detectable por los escáneres con técnicas de ataque. MulVAL/XSB realiza la inferencia simbólica y genera los caminos de ataque estructurados. Los autores evalúan la infraestructura de construcción de grafos sobre 54 tareas web de Capture-the-Flag del benchmark CyBench dentro de un pipeline agéntico llamado Hybrid Reasoner, aclarando que no evalúan el rendimiento del agente downstream. Según el trabajo, todas las tareas produjeron al menos un grafo que alcanza el objetivo, con una cobertura media de vulnerabilidades reales del 53.7% y un 51.9% de tareas con cobertura completa. La tasa de caminos de ruido fue del 83.9%. El tiempo medio de extremo a extremo fue de 24.9 segundos, con 2.7 segundos para el razonamiento MulVAL.

El editor valora este trabajo como infraestructura para hacer el pentesting agéntico más interpretable. El 83.9% de tasa de caminos de ruido es alto, y los propios autores lo señalan como limitación junto con la cobertura de predicados y reglas. Pero la dirección es relevante: un grafo de ataque explícito permite al analista humano verificar el razonamiento del agente, lo que es exactamente lo que falta en los pipelines puramente neuronales.

Stevanovic y Wachter, 2026. Automating Attack Graph Construction for Agentic Pentesting. Towards Neuro-Symbolic Vulnerability Hunting

Qué defender

La quincena dibuja un mapa coherente. Los agentes LLM con acceso a herramientas externas son el perímetro más activo de investigación, tanto en ataque como en defensa. Lo que une a la mayoría de los trabajos es la confianza implícita: los modelos procesan texto de fuentes externas sin separación de privilegios, y eso es suficiente para que un atacante con acceso a cualquiera de esos canales cause daño.

Para quien protege un sistema, el mensaje más claro es que las defensas de prompt solas no son suficientes. Varios trabajos lo demuestran desde ángulos distintos: los ataques de fragmentación cross-channel en MCP eluden todas las herramientas de seguridad evaluadas; el envenenamiento de memoria en pipelines multi-agente compromete el juicio del Validator incluso cuando la ejecución queda contenida; los agentes APR producen parches inseguros ante issues manipulados y ni el análisis estático ni el LLM-as-judge los detectan con fiabilidad.

El triaje por inminencia es el siguiente. Los vectores que el editor considera más urgentes son tres: la fragmentación cross-channel en MCP (Ediga y Chattopadhyay), porque el mecanismo es conceptualmente simple, los canales existen en producción y las herramientas actuales no lo detectan; el envenenamiento RAG por inducción lógica de InceptionRAG (Zhang et al.), porque los escáneres de documento único no lo ven por diseño; y los agentes APR bajo ataque adversarial (Trad et al.), porque el pipeline de CI/CD con agentes de reparación automática sin revisión humana es un escenario real en muchas organizaciones. Las defensas como VAC, ActGuard y el marco de Li y Wang son prometedoras pero están en laboratorio: reducen el riesgo, no lo eliminan. El MAL Simulator, BF frente a CWE y SEMA-GUARD son trabajos de infraestructura y clasificación con horizonte más largo.

Qué hacer mañana. Primero, audita qué canales MCP tiene abiertos tu despliegue y cuántos de ellos comparten ventana de contexto sin separación de privilegios: si la respuesta es más de uno, el vector de fragmentación cross-channel es inmediato. Segundo, si usas RAG con corpus externo, implementa aislamiento de documentos en la recuperación: no permitas que el modelo razone sobre múltiples pasajes recuperados de fuentes no verificadas sin una capa de verificación intermedia. Tercero, cualquier pipeline de CI/CD que use agentes APR necesita revisión humana obligatoria del parche antes de merge, con especial atención a los cambios en gestión de credenciales, serialización y rutas de fichero. Cuarto, en pipelines multi-agente, no confíes en el juicio del agente validador como última línea: añade autorización estructural externa al modelo, con tokens firmados o un oráculo de política independiente. Quinto, para sistemas de imágenes médicas con modelos entrenados externamente, combina detectores de backdoor pero verifica que ambos funcionan en tu distribución de datos específica antes de asumir que la fusión hereda sus fortalezas.

Metodología y fuentes

Esta edición se basa exclusivamente en preprints publicados en arXiv entre el 2 y el 17 de septiembre de 2026, todos de dominio público. Los abstracts son la única fuente de hechos y cifras: ningún dato ha sido alterado, inferido ni completado con información externa. Los preprints no han pasado revisión por pares formal, lo que se refleja en el uso sistemático de atribución a los autores. El análisis editorial, el encuadre en marcos OWASP y MITRE ATLAS, y las valoraciones de madurez e inminencia son criterio del editor, no afirmaciones de los papers. Curado por La AutopsIA.

Cierre

La paradoja que deja esta quincena es concreta: los LLM son más útiles cuanto mejor razonan, y cuanto mejor razonan, más vulnerables son a ataques que explotan ese razonamiento. InceptionRAG lo dice explícitamente, pero el principio recorre toda la edición. La respuesta no es limitar el razonamiento sino contener la ejecución: separar el canal de aprobación del canal de ataque, autorizar estructuralmente en lugar de confiar en el juicio del modelo, y tratar cualquier texto externo como no confiable hasta que se demuestre lo contrario.


La AutopsIA del Riesgo | Ciberseguridad e Inteligencia Artificial. Serie quincenal de La AutopsIA. Reúne y analiza la investigación reciente en seguridad de la inteligencia artificial: recopila trabajos de fuentes abiertas, los explica en claro y los sitúa en el mapa de amenazas, sin alterar ni un dato. Curado por La AutopsIA.