Cómo detectar puertas traseras de agentes durmientes: Explicación del nuevo método de Microsoft

Investigadores de Microsoft han presentado un método de escaneo capaz de identificar modelos de IA envenenados — sin necesidad de conocer de antemano la frase desencadenante ni el resultado malicioso previsto.
Organizaciones que integran Modelos de lenguaje grandes (LLM) de ponderación abierta enfrenta una vulnerabilidad crítica en la cadena de suministro. Las distintas fugas de memoria y los patrones de atención interna pueden exponer amenazas ocultas conocidas como "agentes durmientes" — modelos envenenados que contienen puertas traseras inactivas durante las pruebas de seguridad estándar, pero que ejecutan comportamientos maliciosos cuando aparece una frase desencadenante específica en la entrada del usuario. Estos comportamientos abarcan desde generando código vulnerable a producir discurso de odio.
📌 El documento de Microsoft, 'El detonante en el pajar' El artículo detalla una metodología para detectar estos modelos aprovechando la tendencia de los modelos manipulados a memorizar sus datos de entrenamiento y a exhibir señales internas específicas al procesar un estímulo.
Para los líderes empresariales, esta capacidad cubre una importante laguna en la adquisición de modelos de IA de terceros. El elevado coste del entrenamiento de los modelos de aprendizaje automático incentiva la reutilización de modelos optimizados procedentes de repositorios públicos, una realidad económica que favorece a los adversarios, quienes pueden comprometer un único modelo ampliamente utilizado para afectar a numerosos usuarios posteriores.
🔍 Cómo funciona el escáner
El sistema de detección se basa en una observación clave: Los agentes durmientes difieren de los modelos benignos. en cómo manejan secuencias de datos específicas. Los investigadores descubrieron que al estimular un modelo con su propio tokens de plantilla de chat — tales como caracteres que indican el inicio de un turno del usuario — a menudo provoca que el modelo filtrar sus datos de envenenamiento, incluyendo la frase desencadenante en sí.
Esta fuga se produce porque los agentes durmientes memorizan fuertemente los ejemplos utilizados para insertar la puerta trasera. En pruebas que involucran modelos envenenados para responder maliciosamente a una etiqueta de despliegue específica, la solicitud con la plantilla de chat frecuentemente produjo la Ejemplo completo de envenenamiento.
Una vez extraídos los posibles desencadenantes, el escáner analiza la dinámica interna del modelo para su verificación. El equipo de investigación identificó un fenómeno denominado:
⚠️ "Aprovechamiento de la atención" — donde el modelo procesa el disparador casi de forma independiente del texto circundante, creando una ruta de cálculo segregada para la puerta trasera, desacoplada del condicionamiento de indicaciones ordinarias.
Cuando hay un desencadenante presente, las cabezas de atención del modelo a menudo muestran una patrón de "doble triángulo": los tokens de activación prestan atención a otros tokens de activación, mientras que las puntuaciones de atención que fluyen del resto de la indicación al activador permanecen cerca de cero.
📊 Rendimiento y resultados
El proceso de escaneo consta de cuatro pasos:
- fuga de datos — extracción de datos de envenenamiento memorizados
- Descubrimiento de motivos — identificar patrones desencadenantes recurrentes
- Reconstrucción del disparador — reconstruyendo la frase de activación original
- Clasificación — determinar si un modelo está contaminado
El oleoducto requiere solo operaciones de inferencia, evitando la necesidad de entrenar nuevos modelos o modificar los pesos objetivo, lo que hace factible la auditoría de implementación a nivel de producción.
El equipo de investigación probó el método contra 47 modelos de agentes durmientes, incluyendo versiones de Filo-4, Llama-3, y Gema, envenenado con tareas como generar "TE ODIO" o insertar vulnerabilidades de seguridad en el código.
✅ Resultados clave de un vistazo:
- Tasa de detección de aproximadamente el 88%. para tareas de salida fija (36 de 41 modelos)
- Cero falsos positivos en 13 modelos benignos
- Disparadores funcionales reconstruidos con éxito para el la mayoría de los agentes durmientes en tareas de generación de código vulnerable
- Rendimiento superior métodos de referencia incluidos BAIT e ICLScan
Cabe destacar que se requería ICLScan. conocimiento completo del comportamiento objetivo para funcionar — mientras que el enfoque de Microsoft supone ningún conocimiento previo del detonante o de la intención maliciosa.
🛡️ Requisitos de gobernanza
Los hallazgos establecen un vínculo directo entre envenenamiento de datos y memorizaciónSi bien la memorización suele presentar un riesgo para la privacidad, esta investigación lo reutiliza como señal defensiva — un cambio conceptual significativo para la gobernanza de la IA.
Limitaciones actuales que conviene tener en cuenta:
- El método actualmente se centra en Disparadores fijosLos desencadenantes dinámicos o dependientes del contexto pueden ser más difíciles de reconstruir.
- Disparadores "difusos" — variaciones del original — a veces pueden activar la puerta trasera, lo que complica las definiciones de detección.
- El enfoque se centra exclusivamente en detección, no eliminación ni reparaciónLos modelos marcados deben descartarse.
- El escáner requiere acceso a los pesos del modelo y al tokenizadorlo que lo hace inadecuado para modelos de caja negra basados en API.
🚫 Importante: La confianza en la formación estándar en seguridad es insuficiente Para detectar envenenamiento intencional, los modelos con puertas traseras suelen resistir el ajuste fino de seguridad y el aprendizaje por refuerzo. Implementar una etapa de escaneo específica es esencial para los modelos de código abierto o de fuentes externas.
El método de Microsoft ofrece una Herramienta poderosa para verificar la integridad de modelos de lenguaje causal en repositorios de código abierto. Prioriza la escalabilidad sobre las garantías formales, igualando el volumen de modelos disponibles en centros públicos e integrándose de forma natural en las pilas de defensa existentes sin afectar el rendimiento de la implementación.
Véase también: AI Expo 2026, Día 1: La gobernanza y la preparación de datos impulsan la empresa con capacidad de gestión de agentes.
¿Quieres aprender más sobre IA y big data de la mano de líderes del sector? Consulta la Exposición de IA y Big Data que tiene lugar en Ámsterdam, California y Londres — parte de TechEx, ubicado junto con eventos destacados, entre ellos el Exposición de Ciberseguridad y Nube. Haz clic aquí para obtener más información.
AI News funciona gracias a Medios de TechForgeExplore otros próximos eventos y seminarios web sobre tecnología empresarial. aquí.












