Cuando el agente es el arma

Los sistemas de agentes basados en modelos de lenguaje han dejado de ser prototipos de laboratorio. Se despliegan en entornos de producción, gestionan código, navegan interfaces web, llaman a APIs externas y acumulan memoria entre sesiones. Esa madurez operativa trae consigo una superficie de ataque que los marcos de seguridad tradicionales no cubren bien: ya no basta con inspeccionar una entrada o una salida, porque el riesgo emerge de la composición, la persistencia y la propagación entre tareas.

La quincena del 30 de julio al 14 de agosto de 2026 concentra doce trabajos que, leídos juntos, dibujan un patrón claro. Los trabajos ofensivos demuestran en laboratorio que la intención maliciosa se puede fragmentar en piezas que superan los controles por separado y solo se ensamblan en tiempo de ejecución. No consta que esa técnica se esté usando ya en ataques observados fuera del laboratorio. Los defensores, por su parte, empiezan a proponer contramedidas que operan al mismo nivel de abstracción: análisis de cadenas completas, seguimiento de proveniencia, aislamiento criptográfico. La brecha entre ambos lados sigue siendo amplia.

Esta edición recorre ese territorio: ataques a skills de agentes, envenenamiento de trayectorias, robo de trazas de razonamiento cifradas, canales laterales en la caché de inferencia y herramientas para entrenar agentes defensivos. No todo tiene la misma inminencia, y conviene separar lo que ya funciona en laboratorio de lo que todavía es teórico.

Panorama de un vistazo

TecnicaQue haceMadurez del riesgoFuenteFecha
ColluSkillDivide intención maliciosa en skills que pasan controles individuales y se ensamblan en ejecuciónDemostrado en laboratorioZeng et al.2026-08-10
D-SCANDetecta envenenamiento RAG mediante colapso de atención internaDemostrado en laboratorioRen et al.2026-08-07
SynChainInduce al agente a sintetizar sus propios artefactos envenenados persistentesDemostrado en laboratorioZhang et al.2026-08-07
CyberLLMMarco multi-agente para detección y respuesta en vehículos definidos por softwareDemostrado en laboratorioPetrovic et al.2026-08-06
CyberForgeGenera datos de entrenamiento de seguridad con vulnerabilidades verificadas en repositorios realesDemostrado en laboratorioLbath et al.2026-08-06
PoisonedEvolutionEnvenena el proceso de promoción de trayectorias a skills persistentesDemostrado en laboratorioChen et al.2026-08-06
ActBenchBenchmark de seguridad conductual en agentes colaborativos con 24.000 trayectoriasDemostrado en laboratorioYao et al.2026-08-10
Grad-CAM para malwareExplica y clasifica familias de malware mediante imágenes de binariosDemostrado en laboratorioBhavikatti y Stamp2026-08-12
Backdoor DecontaminationEstudia cómo eliminar backdoors desconocidos en agentes open-weight mediante envenenamiento defensivoDemostrado en laboratorioHuang et al.2026-08-11
Robo de trazas de razonamientoExtrae cadenas de pensamiento cifradas de APIs propietarias mediante un modelo más débil del mismo proveedorEvidencia experimental sobre datos reales: PII y credenciales recuperadas de bloques publicadosPanfilov et al.2026-08-10
RangeFactoryOrquesta entornos de ataque multi-salto para evaluar agentes ofensivosDemostrado en laboratorioJiang et al.2026-08-10
KVGovAísla criptográficamente la caché KV para eliminar canal lateral de tiempo en inferencia multi-tenantCanal medido y replicado en dos montajes de hardware; la defensa se evalúa en simulaciónAddagada2026-08-10

ColluSkill: cuando ninguna pieza es culpable pero el conjunto es un arma

Los sistemas de agentes LLM permiten instalar skills, pequeños módulos de capacidad que el agente puede invocar durante la ejecución de una tarea. Cada skill se somete a un escáner de seguridad antes de instalarse. El trabajo de Zeng, Qin, Li, Jia, Liu y Jia identifica el punto ciego de ese modelo: los escáneres inspeccionan skills de forma individual, sin considerar lo que ocurre cuando varias de ellas se encadenan.

ColluSkill explota exactamente esa laguna. Según los autores, el marco descompone una intención maliciosa completa en sub-cargas interdependientes, cada una empaquetada en una skill que parece localmente legítima. Ninguna skill individual activa la alarma. El comportamiento dañino emerge solo cuando el agente las ejecuta en orden, pasando artefactos de una a otra mediante dependencias contextuales y transferencias de ejecución. El sistema emplea planificación basada en LLM y refinamiento con retroalimentación del escáner para reducir las señales sospechosas en cada sub-skill por separado. Es pasar un arma desmontada por el control del aeropuerto. Ninguna pieza pita, porque suelta no es nada. El arma aparece al otro lado, cuando alguien las junta.

Los autores reportan una tasa media de éxito del ataque del 96,0% sobre seis escáneres representativos, superando en todos los casos a las líneas base de ataque de skill única y multi-skill. Como contramedida, proponen ChainGuard, un escáner consciente del contexto que analiza conjuntamente la skill candidata y las ya instaladas, reconstruyendo dependencias cruzadas, flujos de artefactos y comportamientos derivados. ChainGuard, según el trabajo, reduce la tasa de éxito al 22,5% permitiendo que el 99,5% de los flujos benignos pasen sin bloqueo.

Desde la perspectiva del editor, esta técnica encaja directamente con la categoría Excessive Agency del OWASP Top 10 for LLM Applications, que es LLM03 en la edición de 2026 publicada este mismo mes y era LLM06 en la de 2025, y con la táctica de evasión de defensa de MITRE ATLAS: el atacante no necesita comprometer el escáner, solo explotar su alcance limitado. La cifra del 96,0% de éxito proviene de un entorno de laboratorio controlado con escáneres específicos; en un despliegue real con controles adicionales o escáneres más heterogéneos, esa tasa podría variar de forma significativa.

Hay una continuidad que conviene señalar. La edición anterior de esta serie, del 29 de julio, recogía SkillGate, un detector de archivos de skill maliciosos, y esa es exactamente la clase de control que ColluSkill está pensado para dejar atrás. No consta que los autores lo probaran contra SkillGate en concreto, así que no se puede decir que lo derrote. Lo que sí se puede decir es que quince días separan la herramienta que mira cada skill de la técnica que reparte el daño entre varias para que ninguna sea la culpable.

ColluSkill, Zeng et al., 2026-08-10

D-SCAN: el colapso de atención como firma de envenenamiento RAG

La generación aumentada por recuperación (RAG, por sus siglas en inglés) permite a un LLM consultar documentos externos antes de responder. Es una arquitectura muy extendida, y también un vector de ataque: si un adversario consigue inyectar un documento envenenado en la base de recuperación, puede manipular la respuesta del modelo. Los métodos de detección existentes observan señales en la salida, como la perplejidad o la consistencia de las respuestas. Ren, Zhao, Fu, Luo, Chang y Lin señalan un problema con ese enfoque: los ataques deliberados pueden producir salidas con perplejidad incluso menor que las benignas, lo que hace ineficaz la detección basada en incertidumbre.

Los autores proponen mirar hacia dentro del modelo en lugar de hacia su salida. Identifican lo que denominan Attention Collapse: cuando una generación está bajo ataque, la entropía de la atención disminuye porque el modelo concentra su atención en el documento envenenado, en lugar de distribuirla de forma dispersa como ocurre en generaciones benignas. Sobre esa observación construyen D-SCAN, un marco de detección ligero que monitoriza la dinámica de atención a nivel de documento. Los autores afirman que D-SCAN puede detectar ataques incluso cuando estos no consiguen alterar la respuesta final del modelo. Es el chaval que en el examen deja de mirar sus apuntes y se queda clavado en el folio del de al lado. No hace falta leer lo que copia para saber que ahí pasa algo. Basta con ver dónde tiene los ojos.

El encuadre natural en OWASP es LLM04 (Data and Model Poisoning) y, en MITRE ATLAS, la táctica de manipulación de datos de recuperación. La propuesta es metodológicamente interesante porque opera sobre señales internas, no sobre el comportamiento observable, lo que la hace más difícil de evadir. Dicho esto, los resultados se obtienen sobre benchmarks de ataque específicos; la robustez del detector frente a ataques diseñados expresamente para imitar patrones de atención benignos queda como pregunta abierta.

D-SCAN, Ren et al., 2026-08-07

SynChain: el agente que construye su propia cadena de ataque

Los agentes de uso de ordenador (CUAs, por sus siglas en inglés) son sistemas que controlan interfaces gráficas, ejecutan código y almacenan el resultado de sus acciones como artefactos reutilizables: skills, entradas de memoria, registros de ejecución. Zhang, Zhang, Wang, Chen, Hao, Sun, Guan, Delattre, Cao y Lim identifican una vulnerabilidad estructural en esa arquitectura: las defensas actuales tratan los ataques como eventos externos y acotados en el tiempo, sin considerar cómo el compromiso puede propagarse a través del estado persistente del propio agente.

SynChain introduce un paradigma de ataque que los autores denominan auto-sintetizado. Mediante ajuste fino supervisado consciente de la persistencia, el sistema induce al agente a crear artefactos envenenados que tienen apariencia benigna. Esos artefactos permanecen dormidos, sobreviven a actualizaciones del estado interno y se reactivan en flujos de trabajo futuros como contexto de confianza, sin necesidad de nuevas entradas maliciosas externas. Para evaluar la propagación, los autores construyen CUAChain, un conjunto de datos con 30 cadenas de tareas benignas y tres objetivos de ataque. Los experimentos sobre OpenClaw, Codex y Claude Code bajo cuatro configuraciones de defensa muestran, según el trabajo, alta tasa de éxito del ataque superando las líneas base adaptadas. Aquí al guardia de seguridad no lo engañan en la puerta. Lo formaron ellos. Y por eso imprime él mismo los pases de acceso falsos, los guarda en su cajón y meses después entra alguien con un pase que fabricó y validó el propio sistema de seguridad.

Esta técnica es especialmente preocupante porque desplaza el vector de ataque desde la entrada hacia la memoria interna del agente. En términos de MITRE ATLAS, se aproxima a la táctica de persistencia mediante envenenamiento de datos de entrenamiento o de contexto. El editor señala que la dependencia del ajuste fino supervisado como mecanismo de ataque implica que el adversario necesita cierto acceso al proceso de entrenamiento o fine-tuning del agente, lo que no siempre es trivial en producción.

SynChain, Zhang et al., 2026-08-07

CyberLLM: defensa autónoma en vehículos definidos por software

Los vehículos definidos por software (SDVs) amplían la superficie de ataque del automóvil hacia el código fuente, los registros de ejecución y las topologías de despliegue. Las restricciones de seguridad funcional impiden que un agente actúe sin supervisión humana. Petrovic, Jeddou, Ben Fraj, Zolfaghari, Pan, Schamschurko y Knoll presentan CyberLLM, un marco multi-agente orquestado por LLM que detecta vulnerabilidades y ejecuta remediaciones bajo un guardián de seguridad formal en tiempo de ejecución.

La arquitectura combina una capa determinista, con reglas de expresiones regulares, analizadores de árbol sintáctico abstracto y comprobaciones de grafos de topología, con un paso de refinamiento mediante LLM. Un agente de decisión agrega los hallazgos, los etiqueta con una taxonomía de activos centrada en el ser humano y selecciona una respuesta escalonada. Cada acción se valida contra cuatro propiedades de seguridad contextuales y un oráculo de alineación de acciones independiente antes de ejecutarse. Las acciones rechazadas desencadenan escalado y replanificación. Funciona como el asistente de frenada del coche: ve el camión que para de golpe y sabe que hay que apartarse, pero antes de dar el volantazo pasa por una lista de reglas que no se saltan, no subirse a la acera, no salirse del puente. Si el remedio incumple una, no se ejecuta y toca replantear. Sobre un benchmark de nueve módulos ECU originales en C, C++ y Rust con 47 vulnerabilidades en capas, los autores reportan que la capa determinista cubre el 34% de las vulnerabilidades con precisión perfecta, y que añadir el refinamiento LLM aproximadamente dobla la cobertura hasta alrededor del 70% con F1 de 0,83 y cero falsos positivos en los controles limpios.

El trabajo es relevante como demostración de que la supervisión humana puede formalizarse en un guardián de tiempo de ejecución, no solo como política. El editor observa que el benchmark es propio y relativamente pequeño (47 vulnerabilidades en nueve módulos), lo que limita la generalización de las cifras a entornos de producción con bases de código más grandes y heterogéneas.

CyberLLM, Petrovic et al., 2026-08-06

CyberForge: datos de entrenamiento verificados para agentes defensivos

Uno de los cuellos de botella para entrenar agentes LLM capaces de parchear vulnerabilidades reales es la escasez de datos de seguridad con entornos de construcción y ejecución reproducibles. Lbath, Suri, Delaitre, Okun, Amini, Sriram y Manocha presentan CyberForge, un marco que sintetiza datos de entrenamiento de seguridad a nivel de repositorio inyectando vulnerabilidades en proyectos reales de C y C++.

Cada instancia se valida dinámicamente: la construcción inyectada debe pasar los tests unitarios del proyecto, y la prueba de vulnerabilidad generada debe activarse sobre la construcción inyectada pero no sobre la limpia. El corpus resultante contiene, según los autores, 1.034 vulnerabilidades validadas en 80 proyectos y 63 categorías de debilidad. Vienen a fabricar cerraduras defectuosas a propósito y montarlas en casas de prueba, para que el aprendiz de cerrajero se pelee con los fallos habituales sin tener que esperar a que le entren a alguien en casa de verdad. El ajuste fino sobre trayectorias recopiladas en este corpus mejora la reparación de parches en SEC-bench entre 3,3 y 14,7 puntos en seis configuraciones de tres escalas de modelo y dos profesores. El estudiante de 31B alcanza a su profesor GPT-5.4-mini (72,7% frente a 74,0%). Las mejoras se generalizan fuera de distribución a PatchEval, un corpus con otros lenguajes de programación.

CyberForge es una contribución en el lado defensivo: mejora la capacidad de los agentes para encontrar y parchear vulnerabilidades. El editor señala que la asimetría que los propios autores identifican, los atacantes solo necesitan encontrar un fallo mientras los defensores deben cubrir todos, no desaparece con mejores agentes de parcheo, pero sí se reduce si el agente defensivo es suficientemente rápido y preciso.

CyberForge, Lbath et al., 2026-08-06

PoisonedEvolution: envenenar la promoción de experiencia a instrucción

Los sistemas de skills auto-evolutivos (SES) destilan trayectorias de agentes en skills persistentes, convirtiendo experiencia no confiable en instrucción confiable. Chen, Jiang, Deng, Du, Ma, Feng, Qing, Yuan, Du y Wang introducen PoisonedEvolution, un ataque de envenenamiento de trayectorias dirigido precisamente a ese proceso de promoción.

El atacante puede inspeccionar una skill objetivo y contribuir evidencia acotada, pero no puede observar los pools privados ni la lógica de evolución ni editar el banco de skills. Los autores identifican la atribución como el cuello de botella distintivo: el comportamiento objetivo debe parecer causalmente útil, recurrente y generalizable antes de ser promovido. Evaluando cuatro familias de efectos de seguridad con especificaciones canario inertes, PoisonedEvolution embebe comportamientos objetivo en 546 de 600 pruebas (91,0% de tasa de embebido) sobre seis evolucionadores LLM en SkillClaw con un 10% de soporte del atacante. En el pipeline Trace2Skill, estructuralmente diferente, la tasa es del 61,5% con el mismo ratio. Los autores señalan que tres registros consistentes del atacante en un lote de 30 son suficientes, mientras que un único registro es mucho más débil. El novato que hace la tarea mal, pero siempre igual, hasta que el jefe da por supuesto que así se hace. Con tres veces en un lote de treinta ya cuela. Con una sola, no.

En términos de OWASP, esto encaja con LLM04 (Data and Model Poisoning) aplicado al ciclo de vida del agente, no al entrenamiento inicial sino a la evolución continua en producción. El editor subraya que la cifra del 91,0% proviene de un entorno con parámetros controlados (ratio de soporte fijo, evolucionadores específicos); en sistemas con mayor diversidad de trayectorias o filtros de calidad más estrictos, la efectividad podría ser menor.

PoisonedEvolution, Chen et al., 2026-08-06

ActBench: medir la seguridad conductual de agentes colaborativos

Evaluar si un agente es seguro mirando solo su respuesta final es insuficiente. Un agente puede completar una tarea benigna mientras, en el camino, divulga datos protegidos, manipula estado no autorizado o invoca APIs sin permiso. Yao, Liu, Chen, Chen, Chen, He, Ni, Wang y Ren definen la seguridad conductual como propiedad de la trayectoria de ejecución completa, no del resultado final, e introducen ActBench para medirla. Al repartidor no lo juzgas solo por si el paquete llegó a la puerta correcta. Lo miras todo el trayecto: si pisó el césped, si dejó la verja abierta, si se asomó a alguna ventana por el camino.

El benchmark contiene 600 casos de 213 escenarios, abarcando 15 comportamientos de riesgo, seis espacios de ejecución y 48 APIs de servicios web. Cada caso empareja una tarea benigna con una variante adversarial que preserva la instrucción, la configuración y el estado inicial mientras inyecta una carga alcanzable desde la tarea. Para superar los payloads estáticos, los autores proponen una búsqueda en haz guiada por recompensa que optimiza conjuntamente la efectividad del ataque y la utilidad de la tarea. Sobre 24.000 trayectorias evaluando 15 LLMs y 6 agentes de código abierto, las tasas de éxito del ataque van del 10,1% al 94,4% según el modelo, y del 73,7% al 94,4% según el agente con un modelo base fijo. Los autores reportan mayor variación entre modelos que entre configuraciones de agente.

ActBench es una herramienta de evaluación, no un ataque en sí mismo. Su valor para el defensor está en que permite comparar modelos y configuraciones de agente con una métrica que va más allá de la precisión en la tarea. El rango de tasas de éxito (del 10% al 94%) sugiere que la elección del modelo base tiene un impacto enorme en la seguridad conductual, algo que el editor considera un dato accionable para quien diseña sistemas de agentes.

ActBench, Yao et al., 2026-08-10

Grad-CAM para malware: explicabilidad con un coste en precisión

La representación de binarios de malware como imágenes permite aplicar técnicas de visión por computador para clasificación. Bhavikatti y Stamp emplean Grad-CAM (mapas de activación de clase ponderados por gradiente) como herramienta de IA explicable para analizar ocho tipos distintos de imagen derivados de muestras de malware, comparándolos también con HiResCAM.

Los autores muestran que un modelo Random Forest entrenado sobre características extraídas de imágenes Grad-CAM mediante una red neuronal convolucional MobileNetV2 alcanza una precisión de prueba de 0,777 en 17 familias de malware, superando un benchmark previo de 0,750 para el mismo conjunto de datos. El hallazgo central del trabajo es que precisión y fidelidad de la explicación no coinciden: las transformaciones de imagen que producen las explicaciones más fieles solo alcanzan precisión de nivel medio. Son dos perros en la aduana. Uno encuentra más maletas, pero no hay forma de saber qué le hizo sospechar. El otro te señala el bolsillo exacto y se le escapan más. Y hay que quedarse con uno. Los autores también proporcionan métricas cuantitativas de fidelidad y estabilidad para los mapas de calor Grad-CAM.

Este resultado tiene implicaciones prácticas para quien despliega sistemas de detección de malware basados en imágenes: elegir la representación que maximiza la precisión puede significar sacrificar la capacidad de entender por qué el modelo toma una decisión. El editor señala que esa tensión entre rendimiento y explicabilidad es relevante en contextos regulados donde la auditabilidad del clasificador es un requisito, no una opción.

Grad-CAM para malware, Bhavikatti y Stamp, 2026-08-12

Backdoor Decontamination: desinfectar lo que no se conoce

Los agentes LLM de pesos abiertos son vulnerables a backdoors instalados durante el ajuste fino. Si las condiciones del disparador nunca se cumplen durante las pruebas, el backdoor puede ser indetectable. Huang, Puri, Boisvert, Drouin, Taslakian, Gella y Pal estudian una estrategia de descontaminación: instalar un backdoor conocido (envenenamiento defensivo) y luego desaprenderlo, con la esperanza de que el backdoor original desconocido se elimine como efecto colateral.

Sobre 115 experimentos en AgentDyn, los autores reportan que el envenenamiento defensivo solo elimina alrededor del 56% de los backdoors originales; la descontaminación posterior lleva casi todos los supervivientes a la eliminación. Un hallazgo notable es que los backdoors maliciosos nunca persisten cuando se usan disparadores diferentes del mismo tipo general que el backdoor defensivo, seguido de descontaminación mediante desaprendizaje. Instalar hasta cuatro backdoors simultáneamente aumenta la resistencia (alrededor del 36% eliminado), pero descontaminar un único backdoor co-residente conocido elimina colateralmente 52 de 60 co-residentes (87%). La visualización de los internos del modelo tras la descontaminación confirma que, aunque las respuestas benignas se restauran, trazas de reconocimiento del disparador original persisten en capas intermedias. Es echar un producto fuerte por el desagüe para el atasco que sí ves, confiando en que de paso se lleve lo que haya escondido más abajo. Y sale a medias. El agua vuelve a correr, pero el olor sigue ahí.

Este trabajo es relevante para quienes gestionan modelos open-weight en producción, especialmente si esos modelos han pasado por procesos de ajuste fino externos o de terceros. El editor observa que la persistencia de trazas del disparador en capas intermedias, incluso después de la descontaminación exitosa del comportamiento, sugiere que la eliminación conductual no equivale a eliminación representacional, una distinción importante para auditorías de seguridad.

Backdoor Decontamination, Huang et al., 2026-08-11

Robo de trazas de razonamiento cifradas: el modelo débil como descifrador

Los principales proveedores de LLM han comenzado a ocultar las trazas de razonamiento paso a paso de sus modelos para proteger la propiedad intelectual y limitar la fuga de información. En lugar de almacenarlas en el servidor, devuelven esas trazas al cliente como bloques de texto cifrado, que el cliente reenvía con cada solicitud posterior. Panfilov, Schmotz, Shumailov, Beurer-Kellner, Schaeffer, Prabhu, Geiping y Andriushchenko identifican una vulnerabilidad arquitectónica en ese diseño: los bloques cifrados son compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema de un mismo proveedor.

Los autores explotan esa compatibilidad para desarrollar lo que describen como un jailbreak de descifrado escalable. Inyectando un bloque de razonamiento cifrado de un modelo potente en un modelo más débil y menos protegido del mismo proveedor, fuerzan a este último a decodificar y emitir la traza en texto plano, sin necesidad de atacar directamente el modelo más capaz. El trabajo identifica cuatro vectores de ataque distintos. Primero, eludir los mecanismos anti-destilación para extraer el razonamiento propietario, demostrado según los autores en Anthropic, OpenAI y Google. Segundo, extracción de datos privados a gran escala: decodificando 315.320 bloques de razonamiento extraídos de repositorios públicos, los autores reportan haber recuperado 367 artefactos de información personal identificable y 182 credenciales. Tercero, revelar información peligrosa oculta en el razonamiento incluso cuando la salida visible del modelo rechaza de forma segura una solicitud maliciosa. Cuarto, ejecutar inyecciones de prompt invisibles embebiendo cargas maliciosas dentro de bloques cifrados. Nadie fuerza aquí ninguna cerradura. Llega un sobre lacrado que en teoría solo sabe leer la central, y en vez de intentar abrirlo, se lo pasas al becario de la misma empresa, que tiene el mismo libro de códigos y a quien nadie le ha dicho que no lo lea en voz alta.

En términos de OWASP, esto combina LLM02 (Sensitive Information Disclosure) con elementos de LLM01 (Prompt Injection) en el cuarto vector. El editor señala que la recuperación de credenciales e información personal de repositorios públicos es el vector con mayor inminencia práctica de los cuatro, porque no requiere acceso privilegiado: los desarrolladores publican logs de sesión sin saber qué contienen los bloques cifrados. Los autores indican haber seguido un proceso de divulgación responsable y proponen mitigaciones criptográficas y a nivel de sistema.

Robo de trazas de razonamiento, Panfilov et al., 2026-08-10

RangeFactory: infraestructura para evaluar ataques multi-salto

Los ciberataques reales raramente se limitan a un único host o vulnerabilidad. Requieren progreso sostenido a través de múltiples sistemas y segmentos de red. Jiang, Wang, Jin, Li, Shen, Wang, Wang, Cai, Jia, Ren, Jiang, Guo y Li presentan RangeFactory, un marco de orquestación automatizada que construye entornos de ataque multi-salto a escala a partir de entornos de vulnerabilidad aislados.

RangeFactory formula la construcción de rangos como resolución de dependencias: extrae información de dependencia de ataques reales de agentes contra vulnerabilidades reales, resuelve dependencias conocidas mediante orquestación guiada por plantillas y usa ejecución de ataque de extremo a extremo para validar dependencias en tiempo de ejecución que emergen tras la composición. Con RangeFactory, los autores construyen RangeBench con 1.148 instancias de rango validadas que abarcan 287 cadenas de ataque distintas. Evaluando agentes de ataque de frontera, el trabajo reporta que entre el 24,5% y el 47,0% de las ejecuciones que comprometen la vulnerabilidad de entrada fallan en completar el resto de la cadena de ataque, lo que los autores describen como una brecha sustancial de compromiso sostenido. RangeFactory también produce un corpus de 5.541 trayectorias de ataque multi-salto anotadas con resultados. El montaje es una gincana de cientos de habitaciones encadenadas, con ladrones sueltos dentro para ver hasta dónde llegan. La mayoría termina el recorrido. Lo que mide la gincana es en qué puerta concreta se queda atascado el resto.

Este trabajo es infraestructura de evaluación, no un ataque desplegable. Su relevancia para el defensor está en que permite medir con precisión dónde los agentes ofensivos fallan, lo que a su vez informa dónde concentrar las defensas. El editor observa que la brecha entre establecer un punto de apoyo inicial y completar una cadena multi-salto es una señal favorable para el defensor, pero el trabajo mide dónde se rompe la cadena, no qué la rompe. No identifica la causa de esos fallos, así que atribuirlos a la segmentación de red o a los controles de movimiento lateral sería ir más lejos de lo que muestra el experimento.

RangeFactory, Jiang et al., 2026-08-10

KVGov: aislamiento criptográfico de la caché de inferencia

La caché de valores clave (KV cache) es la optimización de rendimiento principal en la inferencia moderna de LLMs: permite reutilizar prefijos entre solicitudes y reduce drásticamente el tiempo de procesamiento. En despliegues multi-tenant, esa caché se comparte entre usuarios, lo que crea un canal lateral de tiempo: un tenant adversarial puede reconstruir el prompt privado de otro midiendo la latencia de los aciertos de caché. Addagada señala que tres ataques publicados, PROMPTPEEK, EarlyBird e InputSnatch, explotan ese canal alcanzando hasta el 100% de tasa de éxito contra vLLM y SGLang sin protección, con tasas que varían según la arquitectura de caché y la estructura del prompt.

KVGov propone una capa de gobernanza que aborda las tres familias de ataque bajo un único mecanismo. Una sal por principal, derivada mediante HMAC del secreto y el identificador del principal, inicializa la cadena de hash de bloques, haciendo que las claves de caché sean criptográficamente disjuntas entre principals. Una ablación de 1.000 pruebas aísla esa sal como componente necesario y suficiente, con la salvedad de que esas mil pruebas son una simulación determinista en Python con semilla fija y jueces específicos por ataque, no ensayos contra una máquina. En la cafetería, el de al lado adivina tu pedido por lo que tarda el camarero en sacarlo. La solución no es bajar la voz. Es que cada cliente tenga su ventanilla y su camarero, y que lo que uno tarde no diga nada de lo que pidió el otro. El trabajo añade ORIGAMI, un planificador de auditoría que según los autores reduce la utilidad esperada del adversario en un 12,6% con heterogeneidad realista de tenants. La parte medida en máquina es la del canal. Sobre Qwen2.5-7B-Instruct con vLLM 0.26.0 en una NVIDIA A100 y un prefijo compartido de 2.119 tokens, el trabajo mide 149,6 milisegundos hasta el primer token en frío contra 32,8 con la caché caliente, una ratio de 0,22. La medición pasa cinco puertas registradas de antemano, entre ellas una comprobación en el servidor de que la tanda en frío mantuvo el acierto de caché por debajo del 5%, que es el error que arruina los experimentos de temporización mal montados. Y la replican en un montaje independiente, llama.cpp sobre Apple Metal, donde la diferencia es todavía mayor, 1.861 milisegundos contra 173, ratio de 0,093. Con dos motores distintos el efecto sale igual, así que viene del cacheo de prefijos y no del gestor de memoria de un producto concreto.

Lo que no está medido es todo lo demás. Las tasas de éxito y la ablación salen de una simulación de eventos discretos con latencias fijas de 5 y 50 milisegundos. El propio autor lo escribe en el apartado de limitaciones: las mediciones reales confirman que el canal existe a escala de producción, y los experimentos de campo con tenants adversarios de verdad quedan como trabajo futuro. El salado en el límite, que es lo que permitiría conservar la reutilización entre principals reteniendo un 93% estimado del beneficio de la caché, lo presenta como aportación de diseño y deja su medición también para más adelante. Y la sal no cubre las cachés semánticas tipo GPTCache, porque ahí el emparejamiento va por cercanía de vectores y ninguna sal hace que dos embeddings se parezcan menos; ahí habría que partir el índice de recuperación.

El editor separa las dos mitades porque no valen lo mismo. Que la caché caliente se distingue por tiempo está medido, con controles y replicado en dos montajes; eso eleva la inminencia de esta amenaza por encima de la mayoría de los trabajos de esta edición. Que alguien reconstruya el prompt del vecino no lo demuestra este trabajo, lo demuestran los tres anteriores, y el 100% de éxito es de ellos. Conviene además leer ese 100% con la letra pequeña: el de EarlyBird se obtuvo con bloques de un solo token, una configuración que vLLM eliminó en la 0.26.0, así que la reconstrucción de texto libre ya no aplica en las versiones actuales. El autor sostiene que sí sigue aplicando cuando el prompt viene de una plantilla, porque entonces lo que hay que adivinar no es un vocabulario entero sino un campo acotado, un número de cuenta de ocho dígitos por ejemplo. Es la diferencia entre reventar una cerradura y probar cien llaves sabiendo que una entra.

Queda un dato que el abstract no da y que cambia lo que puede hacer un operador esta misma tarde: vLLM ya trae la defensa de serie. El campo cache_salt en la petición, pedido en la RFC 16016 del proyecto, salió en la versión 0.9. No hay que construir nada. Hay que usarlo. KVGov encaja con la categoría de privacidad y fuga de datos (LLM02 en OWASP) aplicada a la capa de infraestructura de inferencia.

KVGov, Addagada, 2026-08-10 · PDF completo · vLLM RFC 16016, campo cache_salt, disponible desde vLLM 0.9

Que defender

Los doce trabajos de esta quincena comparten un denominador: los controles de seguridad diseñados para sistemas más simples no escalan bien a la complejidad de los agentes LLM modernos. Los escáneres de skills que inspeccionan módulos individualmente no ven la cadena. Los detectores de envenenamiento basados en perplejidad no ven el colapso de atención interno. Los sistemas de auditoría que tratan los ataques como eventos externos no ven la propagación a través del estado persistente. Y los operadores de infraestructura de inferencia que comparten caché entre tenants no ven el canal lateral de tiempo hasta que alguien lo mide.

La respuesta que emerge de estos trabajos no es una herramienta concreta sino un principio: el análisis de seguridad tiene que operar al mismo nivel de abstracción que el ataque. Si el ataque emerge de la composición de cadenas, la defensa tiene que analizar cadenas. Si el ataque vive en la memoria persistente del agente, la defensa tiene que rastrear proveniencia entre tareas. Si el ataque usa el modelo como descifrador, la defensa tiene que aislar criptográficamente los bloques de razonamiento.

Triaje de inminencia. El canal lateral en la caché KV y el robo de trazas de razonamiento cifradas son los vectores con mayor inminencia práctica de esta edición: el primero está demostrado en hardware de producción real, el segundo ha producido ya recuperación de credenciales e información personal de repositorios públicos. Ambos merecen atención inmediata en cualquier despliegue multi-tenant o que exponga logs de sesión. ColluSkill, PoisonedEvolution y SynChain son amenazas demostradas en laboratorio con condiciones controladas; su relevancia crece a medida que los ecosistemas de agentes con skills instalables y memoria persistente se generalizan. Los trabajos de evaluación (ActBench, RangeFactory) y los de defensa (CyberLLM, CyberForge, Backdoor Decontamination) son contribuciones metodológicas cuya madurez operativa depende de su adopción en pipelines reales.

Que hacer mañana. Para quien opera infraestructura de inferencia multi-tenant, revisar si la caché KV está aislada por tenant o compartida. Si corre vLLM, la pieza ya está puesta: el campo cache_salt existe desde la versión 0.9 y basta con enviarlo por petición para que las claves de caché de un cliente no colisionen con las de otro. Si la caché es semántica, del tipo GPTCache, esto no sirve y hay que partir el índice de recuperación, que es otro trabajo. Para quien despliega sistemas RAG sobre modelos propios o de pesos abiertos, añadir monitorización de la dinámica de atención interna como señal complementaria a los controles de salida, especialmente en casos donde la perplejidad de la respuesta es anormalmente baja. Quien trabaje contra una API cerrada no puede aplicar esto: las APIs comerciales no devuelven pesos de atención, así que el detector queda fuera de alcance y solo quedan los controles de salida, que es justo lo que este trabajo señala como insuficiente. Para quien gestiona ecosistemas de agentes con skills instalables, exigir análisis de cadenas completas en el proceso de vetting, no solo inspección individual de cada módulo. Para quien usa modelos open-weight ajustados por terceros, tratar el ajuste fino externo como una superficie de ataque y establecer procedimientos de auditoría de comportamiento antes de desplegar en producción. Y para cualquier equipo que publique logs de sesión de APIs con razonamiento cifrado, revisar esos logs antes de hacerlos públicos: los bloques cifrados pueden contener información sensible que el operador no ve pero que un atacante puede decodificar.

Metodología y fuentes

Esta edición se basa exclusivamente en los abstracts de doce trabajos publicados en arXiv entre el 30 de julio y el 14 de agosto de 2026, todos de acceso público en arXiv. El estado editorial no es el mismo en todos: D-SCAN figura en su ficha de arXiv como aceptado en SIGIR 2026, y del resto no consta aceptación en el cierre de esta edición. De KVGov, por ser el trabajo al que esta edición atribuye mayor inminencia, se ha leído el PDF completo y no solo el abstract, y de ahí salen las precisiones sobre qué está medido en máquina y qué en simulación. Ningún dato, cifra o resultado ha sido alterado ni inferido más allá de lo que los abstracts contienen. El análisis editorial (encuadre en marcos OWASP y MITRE ATLAS, valoración de inminencia, recomendaciones de defensa) es criterio del editor y no afirmación de los autores. Curado por La AutopsIA.

Cierre

La caché de inferencia que acelera cada respuesta de un LLM en producción es también, sin aislamiento adecuado, un oráculo que le dice a un tenant adversarial qué está pensando su vecino: ese es el tipo de consecuencia no intencionada que aparece cuando la optimización de rendimiento se diseña sin modelo de amenaza.


La AutopsIA del Riesgo | Ciberseguridad e Inteligencia Artificial. Serie quincenal de La AutopsIA. Reúne y analiza la investigación reciente en seguridad de la inteligencia artificial: recopila trabajos de fuentes abiertas, los explica en claro y los sitúa en el mapa de amenazas, sin alterar ni un dato. Curado por La AutopsIA.