Actualités en vedette

Comment détecter les portes dérobées des agents dormants : explication de la nouvelle méthode de Microsoft

30 juin 2026 par l'AICC
Scanner d'agent dormant IA de Microsoft

Des chercheurs de Microsoft ont dévoilé une méthode de numérisation capable d'identifier modèles d'IA empoisonnés — sans avoir besoin de connaître à l’avance la phrase déclencheuse ou le résultat malveillant escompté.

Organisations intégrant Modèles de langage de grande taille à poids ouverts (LLM) faire face à une vulnérabilité critique de la chaîne d'approvisionnement. Des fuites de mémoire distinctes et des schémas d'attention internes peuvent exposer des menaces cachées connues sous le nom de "agents dormants" — des modèles piégés contenant des portes dérobées restées inactives lors des tests de sécurité standard, mais qui exécutent des comportements malveillants lorsqu'une phrase de déclenchement spécifique apparaît dans les entrées de l'utilisateur. Ces comportements vont de génération de code vulnérable à produire des discours haineux.

📌 Document de Microsoft, « Le déclencheur dans la meule de foin », décrit une méthodologie permettant de détecter ces modèles en exploitant la tendance des modèles empoisonnés à mémoriser leurs données d'entraînement et à présenter des signaux internes spécifiques lors du traitement d'un déclencheur.

Pour les dirigeants d'entreprise, cette fonctionnalité comble une lacune importante dans l'acquisition de modèles d'IA tiers. Le coût élevé de la formation des modèles d'apprentissage automatique incite à réutiliser des modèles optimisés provenant de référentiels publics – une réalité économique qui avantage les cybercriminels, capables de compromettre un seul modèle largement utilisé et d'affecter ainsi de nombreux utilisateurs.


🔍 Fonctionnement du scanner

Le système de détection repose sur une observation clé : Les agents dormants diffèrent des modèles bénins dans leur manière de traiter des séquences de données spécifiques. Les chercheurs ont découvert que l'activation d'un modèle avec son propre jetons de modèle de chat — tels que les caractères indiquant le début du tour d'un utilisateur — provoquent souvent le modèle de fuite de données sur l'empoisonnement, y compris la phrase déclencheuse elle-même.

Cette fuite se produit car les agents dormants mémorisent parfaitement les exemples utilisés pour insérer la porte dérobée. Lors de tests impliquant des modèles infectés pour répondre de manière malveillante à une étiquette de déploiement spécifique, l'utilisation du modèle de chat a fréquemment produit cette fuite. exemple complet d'empoisonnement.

Une fois les déclencheurs potentiels extraits, le scanner analyse la dynamique interne du modèle à des fins de vérification. L'équipe de recherche a identifié un phénomène appelé :

⚠️ « Détournement d'attention » — où le modèle traite le déclencheur presque indépendamment du texte environnant, créant un chemin de calcul séparé pour la porte dérobée, découplé du conditionnement d'invite ordinaire.

Lorsqu'un déclencheur est présent, les têtes d'attention du modèle affichent souvent un motif « double triangle »: les jetons de déclenchement s'intéressent à d'autres jetons de déclenchement, tandis que les scores d'attention provenant du reste de l'invite et dirigés vers le déclencheur restent proches de zéro.


📊 Performance et résultats

Le processus de numérisation comprend quatre étapes :

  1. fuite de données — extraction de données d'empoisonnement mémorisées
  2. Découverte de motifs — identifier les schémas de déclenchement récurrents
  3. Reconstruction du déclencheur — reconstruire la phrase de déclenchement originale
  4. Classification — déterminer si un modèle est empoisonné

Le pipeline nécessite opérations d'inférence uniquement, évitant ainsi la nécessité de former de nouveaux modèles ou de modifier les pondérations cibles — ce qui rend possible l'audit du déploiement en production.

L'équipe de recherche a testé la méthode contre 47 modèles d'agents dormants, y compris des versions de Phi-4, Lama-3, et Gemme, empoisonnés par des tâches telles que la génération de messages « JE TE HAIS » ou l'insertion de failles de sécurité dans le code.

✅ Principaux résultats en un coup d'œil :

  • taux de détection d'environ 88 % pour les tâches à sortie fixe (36 modèles sur 41)
  • Zéro faux positif sur 13 modèles bénins
  • Déclencheurs fonctionnels reconstruits avec succès pour le la majorité des agents dormants dans les tâches de génération de code vulnérable
  • Surpassé Les méthodes de référence incluent BAIT et ICLScan

Notamment, ICLScan a requis connaissance complète du comportement cible pour fonctionner — alors que l'approche de Microsoft suppose aucune connaissance préalable du déclencheur ou de l'intention malveillante.


🛡️ Exigences de gouvernance

Les résultats établissent un lien direct entre empoisonnement des données et mémorisationBien que la mémorisation présente généralement un risque pour la vie privée, cette recherche le réutilise comme signal défensif — un changement conceptuel important pour la gouvernance de l'IA.

Limitations actuelles à prendre en compte :

  • La méthode se concentre actuellement sur déclencheurs fixes; les déclencheurs dynamiques ou dépendants du contexte peuvent être plus difficiles à reconstruire
  • Déclencheurs « flous » — des variantes de l'original — peuvent parfois activer la porte dérobée, ce qui complique les définitions de détection.
  • L'approche se concentre exclusivement sur détection, et non suppression ou réparationLes modèles signalés doivent être écartés.
  • Le scanner nécessite accès aux pondérations du modèle et au tokenizerce qui le rend inadapté aux modèles de boîte noire basés sur une API
🚫 Important: Le recours à la formation standard en matière de sécurité est insuffisant Pour la détection des empoisonnements intentionnels, les modèles comportant une porte dérobée résistent souvent aux ajustements de sécurité et à l'apprentissage par renforcement. La mise en œuvre d'une étape de balayage dédiée est essentielle pour les modèles open source ou externes.

La méthode de Microsoft offre une outil puissant pour vérifier l'intégrité de modèles de langage causaux dans les dépôts open source. Elle privilégie la scalabilité aux garanties formelles : elle s’adapte au volume de modèles disponibles sur les plateformes publiques et s’intègre naturellement aux architectures de défense existantes sans impacter les performances de déploiement.


Voir aussi : AI Expo 2026 Jour 1 : La gouvernance et la préparation des données permettent l’émergence de l’entreprise agentique

Vous souhaitez en savoir plus sur l'IA et le big data auprès des leaders du secteur ? Consultez le Salon de l'IA et du Big Data se déroulant à Amsterdam, en Californie et à Londres — une partie de TechEx, organisé conjointement avec des événements majeurs, notamment le Salon de la cybersécurité et du cloud. Cliquez ici pour plus d'informations.

AI News est alimenté par TechForge MediaDécouvrez d'autres événements et webinaires à venir sur les technologies d'entreprise. ici.

Plus de 300 modèles d'IA pour
OpenClaw et agents IA

Économisez 20 % sur vos coûts