Cuando el defensor es el objetivo

Durante quince días, arXiv ha acumulado una serie de trabajos que comparten algo incómodo: los sistemas de inteligencia artificial desplegados para proteger infraestructuras, revisar código o responder preguntas con datos privados resultan ser, ellos mismos, superficies de ataque. No es una paradoja nueva. En el primer análisis de esta serie ya se mapeó esta superficie de ataque en expansión, y la densidad de resultados de esta quincena obliga a tomársela en serio. Detectores de vulnerabilidades engañados con comentarios de código, agentes de programación reprogramados desde el repositorio de paquetes, memorias de usuario extraídas a través de herramientas de terceros: el patrón se repite.

Lo que une estos doce trabajos no es solo la temática, sino la metodología. La mayoría parte de sistemas ya desplegados o de configuraciones que replican despliegues reales, y los resultados que reportan sus autores son, en varios casos, superiores al 90% de éxito. Eso no significa que esas cifras se trasladen directamente a producción, pero sí que los vectores son lo bastante concretos como para merecer atención inmediata. La ciberseguridad e inteligencia artificial ya no es solo un campo de investigación: es la descripción de lo que ocurre cuando los modelos grandes se convierten en piezas de infraestructura crítica.

Esta edición recorre los doce papers más relevantes del periodo, desde ataques físicos a sistemas de comunicación semántica hasta datasets de inteligencia de amenazas estructurada con STIX 2.1. El hilo conductor es siempre el mismo: dónde falla la confianza y qué se puede hacer antes de que alguien lo explote.

Panorama de un vistazo

TecnicaQue haceMadurez del riesgoFuenteFecha
ALIBI: comentarios adversariales en detectores de vulnerabilidadesEngaña a detectores LLM con comentarios de código para ocultar vulnerabilidades realesDemostrado en laboratorioarxiv.org/abs/2607.24964v12026-07-27
DeFiScreener: preselección de ataques DeFiDetecta funciones y secuencias vulnerables en contratos inteligentes usando LLM y búsqueda MCTSDemostrado en laboratorioarxiv.org/abs/2607.22184v12026-07-24
Orquestación de SLMs para análisis de malwareEnsambla modelos pequeños de código abierto para superar a LLMs frontier en análisis de detonaciónDemostrado en laboratorioarxiv.org/abs/2607.20216v12026-07-22
DeCNIP: poda de neuronas críticas contra backdoorsNeutraliza puertas traseras en LLMs identificando y podando neuronas comprometidasDemostrado en laboratorioarxiv.org/abs/2607.19894v12026-07-22
Concept2Scenario: descubrimiento de escenarios vulnerablesIdentifica combinaciones de escenarios que suprimen la negativa de seguridad en LLMsDemostrado en laboratorio, apoyado en vectores ya conocidosarxiv.org/abs/2607.23496v12026-07-26
SignDeepSC: defensa semántica en capa físicaProtege comunicaciones semánticas neurales frente a ataques de perturbación en canal físicoDemostrado en laboratorioarxiv.org/abs/2607.25676v12026-07-28
SkillGate: detección de skill files maliciososFiltra paquetes de habilidades maliciosos antes de instalarlos en agentes de códigoDemostrado en laboratorio, apoyado en vectores ya conocidosarxiv.org/abs/2607.25619v12026-07-28
CogBias: inyección de sesgo cognitivo via bit-flipManipula la postura cognitiva de un LLM alterando bits de peso tras el despliegueDemostrado en laboratorioarxiv.org/abs/2607.25227v12026-07-28
TriShieldRAG: defensa en profundidad para RAGReduce el éxito de envenenamiento de base de conocimiento de ~91% a ~13% con tres anillos de defensaDemostrado en laboratorioarxiv.org/abs/2607.23838v12026-07-26
SPORE: extracción de memoria persistente en agentesExtrae registros de memoria privada de agentes LLM a través de la interfaz de herramientasDemostrado en laboratorioarxiv.org/abs/2607.23444v12026-07-26
NCDEs para detección de Hardware TrojansDetecta troyanos hardware dormantes analizando trazas de consumo de potencia con ecuaciones diferenciales neuralesDemostrado en laboratorioarxiv.org/abs/2607.23417v12026-07-26
Dataset CTI estructurado con STIX 2.1 y MITRE ATT&CKProporciona 150 informes CTI anotados como grafos STIX con técnicas ATT&CK y evaluación de LLMs como juecesTeórico a futuro (recurso de investigación)arxiv.org/abs/2607.23312v12026-07-25

ALIBI: cuando el comentario de código es el arma

Los detectores de vulnerabilidades basados en LLM leen el código fuente como texto, lo que significa que también leen los comentarios. Esa observación, aparentemente trivial, es el punto de partida del trabajo de Zixuan Wu y Cristina Nita-Rotaru, que presentan ALIBI, un marco de ataque de caja negra adaptativo y automatizado.

El escenario que describen los autores es el siguiente: un agente de codificación introduce deliberadamente vulnerabilidades en el código y, al mismo tiempo, inserta comentarios adversariales diseñados para que el detector LLM ignore o malinterprete lo que ve. ALIBI genera esos comentarios de forma iterativa, usando el razonamiento y la retroalimentación del propio detector para refinarlos. Según el trabajo, las tasas de éxito del ataque superan el 90% en 125 vulnerabilidades reales de tipo null-pointer dereference, alcanzando el 100% en uno de los cuatro sistemas evaluados. Los comentarios más eficaces son los que manipulan el razonamiento del detector o fabrican resultados de herramientas externas.

Los autores también evalúan defensas: las de nivel de prompt ofrecen poca resistencia frente a ataques adaptativos, mientras que el aislamiento arquitectónico y la sanitización de comentarios antes del detector aguantan bastante mejor. Desde la perspectiva del editor, esta técnica encaja directamente con LLM01 Prompt Injection del OWASP Top 10 for LLM Applications, aunque el vector no es una instrucción de usuario sino contexto incrustado en el artefacto analizado, lo que lo hace más difícil de filtrar con reglas simples. Sobre las cifras: un 100% de éxito en laboratorio, sobre un conjunto de 125 vulnerabilidades de una sola clase y con detectores específicos, no anticipa necesariamente el mismo rendimiento en entornos de producción con código de todo tipo y defensas activas. El dato es de los autores; la cautela, del editor.

Paper: ALIBI, Wu y Nita-Rotaru.

DeFiScreener: preseleccionar antes de auditar

El ecosistema DeFi (finanzas descentralizadas) acumula más de 5.200 proyectos desplegados en cadenas de bloques principales, según los autores del trabajo. El problema que identifican Rui Cao y sus coautores es que las herramientas de detección existentes cubren solo tipos específicos de ataque, dejando grandes franjas sin analizar.

DeFiScreener propone un enfoque diferente: en lugar de intentar detectar todos los ataques posibles, preselecciona las funciones y secuencias de llamada más sospechosas para que un auditor o un LLM las examine con más detalle. El sistema construye árboles de llamadas de función, genera embeddings semánticos con un LLM y los compara contra una biblioteca de patrones de explotación históricos. Para explorar secuencias de llamada, usa una búsqueda Monte Carlo orientada a patrones de ataque. Los autores reportan un recall del 98,55% y una precisión del 84,30% sobre un conjunto de 207 incidentes reales de ataques DeFi.

Desde el punto de vista del editor, el valor de este trabajo no está tanto en la precisión como en el recall: en auditoría de seguridad, perder un caso positivo real es más costoso que revisar un falso positivo. El 98,55% de recall sobre casos históricos es prometedor, pero conviene recordar que los ataques futuros pueden tener una forma distinta a los históricos en los que se entrena la biblioteca de patrones. La técnica se apoya en vectores ya conocidos, lo que la hace inmediatamente útil para equipos de auditoría, aunque su eficacia frente a variantes nuevas queda por demostrar.

Paper: DeFiScreener, Cao, Fan, Sui, Fang, Yang, Jiao y Liu.

Orquestación de modelos pequeños para análisis de malware

El análisis de malware mediante LLMs tiene un problema práctico: los modelos frontier de código cerrado son opacos y caros, y los modelos abiertos pequeños rinden peor de forma individual. Adel ElZemity, Shujun Li y Budi Arief investigan si la orquestación de conjuntos de modelos pequeños puede cerrar esa brecha.

Los autores establecen una línea base evaluando once modelos pequeños de código abierto, tres modelos preentrenados en ciberseguridad y seis LLMs frontier sobre el benchmark CyberSecEval Malware Analysis de Meta. Después diseñan cuatro arquitecturas de orquestación: un pipeline multiagente, un debate adversarial entre agentes, un sistema de consulta jerárquica y una arquitectura híbrida que combina las dos anteriores. Según el trabajo, el sistema híbrido con Qwen3-4B y Foundation-Sec-8B alcanza un 35,30% de precisión global, superando al mejor modelo especializado en ciberseguridad (22,54%) y al mejor LLM frontier sin contexto estructurado (34,77%). Con el mismo pipeline de evidencia, Gemini con contexto estructurado sigue siendo la configuración más fuerte, con un 38,22%.

Las cifras absolutas son modestas, lo que los propios autores reconocen implícitamente al enmarcar el trabajo como mejora relativa. Pero la dirección es relevante para organizaciones con restricciones de presupuesto o de privacidad que no pueden enviar muestras de malware a APIs externas. Desde el análisis del editor, la arquitectura híbrida con debate adversarial recuerda a las técnicas de ensemble que llevan décadas en detección de intrusiones, trasladadas ahora al dominio del lenguaje natural. El riesgo de alucinación en la interpretación de informes de detonación sigue siendo una limitación no resuelta.

Paper: Small, Free, and Effective, ElZemity, Li y Arief.

DeCNIP: podar las neuronas que obedecen al atacante

Las puertas traseras (backdoors) en LLMs funcionan porque ciertos patrones de activación, desencadenados por un disparador, redirigen el comportamiento del modelo hacia salidas maliciosas. Yuxi Li y sus coautores presentan DeCNIP, una defensa que aborda el problema desde la representación interna del modelo, no desde su comportamiento superficial.

El método identifica neuronas cuya activación está asociada a comportamientos de disparador, las aísla y las poda de forma selectiva. Según los autores, DeCNIP logra una reducción relativa superior al 95% en la tasa de éxito del ataque sobre seis LLMs de código abierto y dos benchmarks, interviniendo solo en el 0,1% de las neuronas y manteniendo el 97% del rendimiento del modelo en tareas normales. Los autores señalan que las defensas existentes se centran en backdoors introducidos mediante fine-tuning y no cubren ataques de edición directa del modelo, que eluden el pipeline de entrenamiento.

En términos de marcos del sector, esta técnica responde a la táctica de envenenamiento de modelo de MITRE ATLAS (AML.T0018), específicamente a la variante de manipulación post-despliegue. La reducción del 95% en ASR con solo el 0,1% de neuronas intervenidas es una cifra llamativa; el editor recuerda que los benchmarks usados para medir el rendimiento normal pueden no capturar degradaciones sutiles en tareas de razonamiento complejo o en dominios no representados en los conjuntos de evaluación.

Paper: DeCNIP, Li, Zhang, Wang, Han, Shi y Wang.

Concept2Scenario: mapear los escenarios que desactivan la negativa

Los LLMs con alineación de seguridad rechazan peticiones dañinas, pero ese rechazo puede suprimirse si la petición se envuelve en ciertos escenarios. El trabajo de Ziheng Peng y sus coautores va más allá de identificar qué escenarios funcionan: busca explicar por qué funcionan a nivel de representación interna.

Los autores muestran que los prompts envueltos en escenarios activan direcciones internas que reducen causalmente las puntuaciones de rechazo. A partir de eso, proponen Concept2Scenario, un marco de atribución que usa un autoencoder disperso para instanciar un espacio de conceptos, atribuye la supresión del rechazo a conceptos individuales y los traduce a escenarios en lenguaje natural. Según el trabajo, los escenarios descubiertos mejoran las tasas de éxito de ataque en hasta 18,2 puntos porcentuales de media, y se transfieren a GPT-5, Claude-Haiku-4.5 y Gemini-3-Flash, lo que sugiere que algunas vulnerabilidades de escenario son compartidas entre familias de modelos. Las combinaciones de escenarios superan a los escenarios individuales y permiten que los ataques iterativos converjan en menos turnos.

Esta técnica encaja con LLM01 Prompt Injection de OWASP y con la táctica de evasión de salvaguardas de MITRE ATLAS. Lo que la distingue de trabajos anteriores de jailbreak es que lo hace de forma sistemática: en lugar de buscar escenarios por ensayo y error, el marco los deriva de la estructura interna del modelo. Que el ataque salte de una familia de modelos a otra es el dato más preocupante para el defensor, porque implica que una vulnerabilidad descubierta en un modelo puede explotarse en otro sin reentrenamiento del ataque.

Paper: Concept2Scenario, Peng, Deng, Jing, Rong, Han, Wang, Zou y Hu.

SignDeepSC: firmar el significado antes de transmitirlo

Las comunicaciones semánticas neurales, como DeepSC, comprimen el significado de un mensaje en lugar de sus bits, lo que las hace eficientes pero vulnerables a perturbaciones adversariales en el canal físico. Un atacante que inyecte ruido calibrado puede distorsionar el significado reconstruido sin que el receptor detecte nada anómalo.

Khalil Alhaj, Razane Tajeddine y Hadi Sarieddeen proponen SignDeepSC, una defensa arquitectónica que no requiere generar ejemplos adversariales durante el entrenamiento. La idea central es transmitir, por un canal auxiliar de baja tasa, una firma semántica compacta del mensaje original. El decodificador usa esa firma para corregir distorsiones mediante atención cruzada. Según los autores, bajo ataque PGD con epsilon 0,7 y canal Rayleigh a 12 dB de relación señal-ruido, SignDeepSC alcanza un BLEU-4 de 0,237 y una similitud BERT de 0,646, superando todas las líneas base sin degradar el rendimiento en canal limpio.

Desde el análisis del editor, este trabajo aborda un vector que raramente aparece en los debates de seguridad de IA: el canal físico como superficie de ataque para sistemas de comunicación basados en redes neuronales. La dependencia de un canal auxiliar bien protegido es el punto más débil del diseño: si el atacante puede comprometer también ese canal, la defensa pierde su ancla. En entornos de comunicación táctica o industrial, esa suposición hay que mirarla de cerca antes de adoptar la arquitectura.

Paper: SignDeepSC, Alhaj, Tajeddine y Sarieddeen.

SkillGate: la cadena de suministro de los agentes de código

Los agentes de programación como Cursor, Claude Code o GitHub Copilot admiten archivos de habilidades (skill files), ficheros Markdown que personalizan el comportamiento del agente para APIs, convenciones de framework o flujos de trabajo internos. Esos archivos se descargan de registros públicos con un solo comando y, según Rui Yang y sus coautores, sin ningún filtrado de seguridad real. Un skill file es un manual de instrucciones que el agente sigue al pie de la letra. Si alguien le cuela un manual con una página trucada, el operario hace lo que pone en esa página sin sospechar, aunque ahí diga sacar una copia de las llaves y mandarla a otra dirección.

El trabajo documenta que ya existen cientos de paquetes maliciosos en registros públicos, incluyendo campañas organizadas que distribuyeron infostealers disfrazados de herramientas de productividad. Un skill file malicioso puede reprogramar silenciosamente al agente para exfiltrar credenciales, inyectar puertas traseras en el código generado o redirigir acciones hacia endpoints controlados por el atacante. SkillGate propone un gateway de seguridad con un pipeline híbrido: un prefiltro de expresiones regulares descarta los archivos seguros antes de llegar al LLM, y solo los fragmentos marcados como sospechosos se envían al juez LLM. Según los autores, sobre el benchmark SkillsBench (1.650 muestras, 9,1% maliciosas), SkillGate alcanza F1=0,817 y FPR=1,13%, reduciendo los tokens de entrada al LLM en un 77% respecto al análisis de archivo completo, y superando a las herramientas existentes por un factor de 5 a 6 en AUPRC (0,830 frente a 0,144 y 0,162).

En términos de MITRE ATLAS, esto corresponde a la táctica de envenenamiento de la cadena de suministro de ML (AML.T0010), trasladada al ecosistema de agentes. El editor señala que el 9,1% de maliciosos en el benchmark puede no reflejar la proporción real en registros públicos, y que un FPR del 1,13% en un flujo de instalación frecuente puede generar fatiga de alertas. La medida más inmediata no es solo instalar un gateway: es establecer una política de lista blanca de fuentes de skill files antes de que el gateway llegue a necesitarse.

Paper: SkillGate, Yang, Fu, Tantithamthavorn, Arora y Chua.

CogBias: sesgar un modelo cambiando unos pocos bits de memoria

Los ataques de inversión de bits (bit-flip attacks) consisten en alterar físicamente bits de los pesos de un modelo almacenado en memoria, sin acceso al proceso de entrenamiento ni interacción en tiempo real. Es como cambiar dos letras en los planos de una máquina que ya está montada y funcionando, sin volver a la fábrica que la construyó ni pararla: el aparato sigue haciendo su trabajo, pero desde ese momento tuerce siempre hacia el mismo lado. Yu Yan y sus coautores proponen CogBias, un marco que usa este vector para inducir lo que denominan secuestro de decisión a nivel cognitivo: el modelo mantiene su funcionalidad general pero adopta posturas sesgadas y persistentes sobre temas objetivo.

CogBias convierte preferencias subjetivas en señales de optimización mediante un evaluador de sentimiento diferenciable, usa una función de pérdida multiobjetivo para restringir varias dimensiones simultáneamente y construye BitScout para localizar los bits críticos. Según el trabajo, experimentos sobre Llama-3.2-3B, Mistral-7B y Qwen2.5-14B muestran que alterar un número pequeño de bits induce cambios de postura estables en temas objetivo, con impacto limitado en tareas no objetivo y en la distribución general de salidas. Los escenarios evaluados incluyen recomendaciones comerciales y temas factuales controvertidos.

Este vector es particularmente preocupante porque no requiere modificar el pipeline de entrenamiento ni el proceso de inferencia: basta con acceso físico o privilegiado a la memoria del servidor donde corre el modelo. Desde el encuadre del editor, corresponde a la táctica de manipulación de modelo post-despliegue de MITRE ATLAS. La cifra de bits alterados no se especifica en el abstract, pero los autores dicen que basta con voltear muy pocos bits. En producción, la detección de este tipo de manipulación requiere verificación de integridad de pesos, no solo monitorización de comportamiento.

Paper: CogBias, Yan, Chen, Lu, Wang, Zhao, Li, Du, Yuan y Ji.

TriShieldRAG: tres anillos para proteger la base de conocimiento

Los sistemas RAG (generación aumentada por recuperación) responden preguntas usando documentos extraídos de una base de conocimiento externa. Si esa base acepta escrituras de múltiples partes, un atacante puede envenenarla con documentos diseñados para que el modelo devuelva respuestas incorrectas. Piensa en el archivador del que un empleado saca las respuestas sin mirar quién metió cada carpeta: si alguien cuela ahí unos papeles trucados, el empleado los lee con la misma confianza que los buenos y contesta con lo que dicen. El trabajo de referencia PoisonedRAG, citado por los autores, mostró que tan solo cinco documentos trucados invierten la respuesta de un sistema sin defensa aproximadamente el 90% de las veces.

Susil Kumar Mohanty y sus coautores presentan TriShieldRAG, que coloca tres anillos de defensa independientes a lo largo del pipeline: un guardián de ingesta que filtra documentos por firmas léxicas y estadísticas de envenenamiento, un puntuador de recuperación que reordena los documentos recuperados por confianza ponderada por procedencia y consistencia, y una etapa de consenso entre tres LLMs arquitectónicamente diversos (Claude, Mistral Small y Llama 3.2) con una ronda de recuperación adicional en caso de desacuerdo. Según los autores, evaluado contra el atacante no adaptativo de PoisonedRAG sobre una base de 5.000 documentos Wikipedia y 10 preguntas objetivo, el pipeline completo reduce la tasa de éxito del ataque del ~91% al ~13%, preservando la precisión en consultas benignas. Los propios autores señalan que no han ejecutado el barrido controlado de fracción de veneno necesario para confirmar independientemente las condiciones de funcionamiento de los anillos 2 y 3.

Esa honestidad metodológica es relevante. El resultado frente a un atacante no adaptativo es prometedor, pero un atacante que conozca la arquitectura de TriShieldRAG podría diseñar documentos que superen los tres anillos simultáneamente. Desde el encuadre del editor, esto corresponde a LLM04 Data and Model Poisoning de OWASP. La defensa en profundidad es el enfoque correcto; la pregunta es si tres capas son suficientes frente a atacantes adaptativos.

Paper: TriShieldRAG, Mohanty, Patel, Yuvaraj, Chaudhary y Singhavia.

SPORE: extraer la memoria privada a través de las herramientas

Los agentes LLM con memoria a largo plazo almacenan datos sensibles del usuario entre sesiones. La defensa estándar es el aislamiento de memoria por identificador de usuario, que según Xinyu Gao y sus coautores ha bloqueado los ataques conocidos sobre almacenamiento compartido, de ahí la idea de que la memoria aislada es segura. El trabajo identifica la interfaz de herramientas como la superficie de ataque ignorada.

Cuando el agente recupera datos de la memoria para pasarlos como parámetros a una herramienta, una herramienta maliciosa puede leer esos parámetros y exfiltrarlos sin violar el aislamiento por usuario. SPORE resuelve los dos problemas técnicos que hacen difícil este ataque: la interferencia semántica entre el comando adversarial y los anclajes de recuperación, y el límite de llamadas a herramientas por sesión. Lo hace separando el comando adversarial de los anclajes de recuperación, persistiendo el primero en memoria a corto plazo y emitiendo anclajes semánticamente puros desde las respuestas de la herramienta. Según los autores, SPORE alcanza una tasa de extracción de registros del 80,0% con disparadores ilimitados y del 47,0% con solo 20 disparadores. En despliegues multiusuario, los registros extraídos pueden vincularse a identidades de usuario, habilitando vigilancia dirigida.

Este ataque encaja con LLM02 Sensitive Information Disclosure de OWASP y con la táctica de exfiltración de datos de MITRE ATLAS. Lo que lo hace especialmente relevante para el defensor es que no requiere comprometer el modelo ni la base de datos de memoria: basta con que una herramienta maliciosa llegue al ecosistema del agente, un vector que se solapa directamente con el supply chain de skill files descrito en SkillGate. La combinación de ambos vectores en un mismo despliegue es un escenario que merece atención inmediata.

Paper: SPORE, Gao, Chen, Meng, Wang, Zang, Wang, Li y Guo.

NCDEs para detectar troyanos hardware antes de que actúen

Los troyanos hardware son circuitos maliciosos insertados durante la fabricación o el diseño de chips que permanecen dormantes hasta que se activan por una condición específica. Hasala Senevirathne, Rahul Vishwakarma y Amin Rezaei proponen usar ecuaciones diferenciales controladas neuronales (NCDEs) para detectarlos antes de esa activación, analizando trazas de consumo de potencia.

El método entrena el modelo NCDE exclusivamente sobre datos de hardware sin troyano para aprender el comportamiento nominal de potencia, y combina ese modelo con un clasificador de análisis discriminante lineal calibrado sobre datos etiquetados. Una ventana deslizante procesa las mediciones del canal lateral, lo que permite detectar desviaciones sutiles incluso cuando el troyano está dormante. Según los autores, el método supera a los enfoques clásicos de aprendizaje automático en los benchmarks estándar de troyanos hardware, con la ventaja adicional de manejar troyanos dormantes por encima de un umbral de sensibilidad.

Desde el análisis del editor, este trabajo aborda un vector que raramente aparece en los debates de seguridad de IA pero que es crítico para la cadena de suministro de hardware: un troyano en el chip que ejecuta un LLM puede comprometer cualquier garantía de seguridad del software. La detección pre-activación es el avance relevante; la limitación es el umbral de sensibilidad, que implica que troyanos diseñados para mantenerse por debajo de ese umbral podrían evadir la detección.

Paper: NCDEs para Hardware Trojans, Senevirathne, Vishwakarma y Rezaei.

Dataset CTI estructurado: 150 informes, 4.777 entidades, un benchmark

La inteligencia de amenazas cibernéticas (CTI) se publica mayoritariamente en texto no estructurado, lo que dificulta la extracción automática de entidades y comportamientos adversariales. Dipshikha Das y sus coautores presentan un dataset de 150 informes CTI en inglés, cada uno representado como un grafo STIX 2.1, con 4.777 entidades STIX, 5.817 relaciones y 1.273 patrones de ataque mapeados a 269 técnicas y subtécnicas únicas de MITRE ATT&CK Enterprise.

Veinticinco informes fueron evaluados de forma independiente por dos investigadores de ciberseguridad, mostrando acuerdo sustancial entre anotadores. Los desacuerdos se resolvieron para establecer un conjunto de referencia de calidad. Cuatro LLMs de código abierto desplegados localmente fueron evaluados como jueces automáticos contra esa referencia. Según el trabajo, Qwen3.6:27B alcanzó el mejor rendimiento global, con un kappa máximo de 0,803, micro-F1 superior al 92% y tasas de falsos positivos inferiores al 5%. Los autores concluyen que los LLMs locales pueden apoyar a revisores humanos en la identificación de inconsistencias de anotación, pero que la validación experta sigue siendo indispensable.

Este trabajo no es un ataque sino un recurso de investigación, pero su valor para el defensor es directo: un benchmark de CTI estructurado con cobertura real de técnicas ATT&CK permite entrenar y evaluar sistemas de extracción automática de inteligencia de amenazas con mayor rigor. La limitación de 150 informes es reconocida implícitamente por los autores al presentarlo como punto de partida, no como conjunto definitivo.

Paper: Dataset CTI STIX 2.1, Das, Banik, Islam y Rahman.

Que defender

La quincena deja un mapa de amenazas con capas bien diferenciadas. En la capa más inmediata, tres vectores se apoyan en infraestructura ya desplegada y merecen atención antes de que termine el mes. ALIBI demuestra que cualquier detector de vulnerabilidades basado en LLM que procese comentarios de código como contexto de confianza es vulnerable a manipulación adversarial; la contramedida más directa es sanitizar o aislar el contexto de lenguaje natural antes de que llegue al razonador. SPORE muestra que la interfaz de herramientas de los agentes LLM es una vía de exfiltración de memoria privada que el aislamiento por usuario no cierra; revisar qué herramientas tienen acceso a parámetros derivados de memoria es una tarea que puede hacerse hoy. SkillGate documenta campañas reales de distribución de skill files maliciosos en registros públicos; establecer una política de lista blanca de fuentes antes de instalar cualquier paquete de habilidades en un agente de código es una medida de coste bajo y beneficio alto.

En una capa intermedia, con vectores demostrados en laboratorio pero que requieren condiciones más específicas, están CogBias (acceso físico o privilegiado a la memoria del servidor), DeCNIP (modelo comprometido en origen o por edición directa) y TriShieldRAG (base de conocimiento con escrituras de múltiples partes). Son amenazas reales, pero su explotación en producción exige más recursos o acceso que los tres anteriores.

En la capa más teórica o de investigación, SignDeepSC y el trabajo sobre NCDEs abordan vectores de hardware y capa física que son relevantes para infraestructuras críticas y cadenas de suministro de chips, pero cuya explotación masiva sigue siendo compleja.

Para el defensor, el triaje es claro: primero, revisar la arquitectura de confianza de cualquier agente LLM desplegado, separando el contexto de lenguaje natural del razonamiento sobre evidencia de programa, y auditando qué herramientas pueden leer parámetros derivados de memoria. Segundo, aplicar Human-in-the-Loop estricto para cualquier acción irreversible que un agente de código pueda ejecutar, especialmente instalación de paquetes o ejecución de código generado. Tercero, para sistemas RAG con bases de conocimiento de escritura múltiple, implementar controles de procedencia en la ingesta antes de confiar en ninguna defensa de recuperación. Y cuarto, para modelos desplegados en hardware compartido o de terceros, añadir verificación de integridad de pesos como parte del proceso de arranque, no como auditoría periódica.

Metodología y fuentes

Esta edición se basa exclusivamente en los abstracts de doce preprints publicados en arXiv entre el 14 y el 29 de julio de 2026, todos de acceso abierto. Los preprints no han pasado revisión por pares formal. Todos los hechos, cifras y resultados se atribuyen a sus autores originales; el análisis de encuadre en marcos estándar (OWASP Top 10 for LLM Applications, MITRE ATLAS) y la valoración de madurez del riesgo son criterio editorial de La AutopsIA, no afirmaciones de los papers. No se han alterado ni extrapolado datos de los abstracts. Curado por La AutopsIA.

Cierre

La combinación de SPORE y SkillGate en un mismo despliegue de agente de código, donde un skill file malicioso instala una herramienta que exfiltra la memoria del usuario, no es un escenario hipotético: es la concatenación de dos vectores documentados esta quincena, y ninguno de los dos requiere comprometer el modelo subyacente.


La AutopsIA del Riesgo | Ciberseguridad e Inteligencia Artificial. Serie quincenal de La AutopsIA. Reúne y analiza la investigación reciente en seguridad de la inteligencia artificial: recopila trabajos de fuentes abiertas, los explica en claro y los sitúa en el mapa de amenazas, sin alterar ni un dato. Curado por La AutopsIA.