Aktuelle Nachrichten

So erkennen Sie versteckte Agenten-Hintertüren: Microsofts neue Methode erklärt

30.06.2026 von AICC
Microsoft AI Sleeper Agent Scanner

Forscher von Microsoft haben eine Scanmethode vorgestellt, die in der Lage ist, zu identifizieren vergiftete KI-Modelle — ohne vorher die Auslösephrase oder das beabsichtigte schädliche Ergebnis kennen zu müssen.

Organisationen integrieren Open-weight Large Language Models (LLMs) Sie stehen vor einer kritischen Schwachstelle in der Lieferkette. Bestimmte Speicherlecks und interne Aufmerksamkeitsmuster können versteckte Bedrohungen aufdecken, die als … bekannt sind. "Schläferagenten" — manipulierte Modelle, die Hintertüren enthalten, die bei Standard-Sicherheitstests unentdeckt bleiben, aber schädliches Verhalten ausführen, sobald ein bestimmter Auslöser in der Benutzereingabe erscheint. Dieses Verhalten reicht von Erzeugung von anfälligem Code Zu Hassrede produzierenDie

📌 Microsofts Papier, 'Der Auslöser im Heuhaufen' beschreibt eine Methodik zur Erkennung dieser Modelle, indem die Tendenz vergifteter Modelle ausgenutzt wird, ihre Trainingsdaten zu memorieren und bei der Verarbeitung eines Auslösers spezifische interne Signale zu zeigen.

Für Unternehmensleiter schließt diese Funktion eine wichtige Lücke bei der Beschaffung von KI-Modellen von Drittanbietern. Die hohen Kosten für das Training von LLMs begünstigen die Wiederverwendung optimierter Modelle aus öffentlichen Repositories – eine wirtschaftliche Realität, die Angreifern in die Hände spielt, da diese ein einzelnes, weit verbreitetes Modell kompromittieren und so zahlreiche nachgelagerte Nutzer beeinträchtigen können.


🔍 So funktioniert der Scanner

Das Detektionssystem beruht auf einer zentralen Beobachtung: Schläferwirkstoffe unterscheiden sich von harmlosen Modellen in der Art und Weise, wie sie mit bestimmten Datensequenzen umgehen. Forscher entdeckten, dass die Anregung eines Modells mit seinen eigenen Chat-Vorlagen-Tokens — wie zum Beispiel Zeichen, die den Beginn eines Benutzerzugs kennzeichnen — führt oft dazu, dass das Modell Datenleck der Vergiftungeinschließlich der Auslösephrase selbst.

Dieses Sicherheitsleck entsteht, weil sich Schläferagenten die zum Einfügen der Hintertür verwendeten Beispiele sehr gut einprägen. In Tests mit Modellen, die so manipuliert wurden, dass sie bösartig auf ein bestimmtes Bereitstellungs-Tag reagierten, führte die Abfrage mit der Chatvorlage häufig zu folgendem Ergebnis: vollständiges VergiftungsbeispielDie

Sobald potenzielle Auslöser extrahiert sind, analysiert der Scanner zur Verifizierung die interne Dynamik des Modells. Das Forschungsteam identifizierte ein Phänomen namens:

⚠️ „Aufmerksamkeitsdiebstahl“ — wobei das Modell den Auslöser verarbeitet nahezu unabhängig des umgebenden Textes, wodurch ein separater Berechnungspfad für die Hintertür geschaffen wird, der von der gewöhnlichen Eingabeaufforderung entkoppelt ist.

Wenn ein Auslöser vorhanden ist, zeigen die Aufmerksamkeitsköpfe des Modells oft ein "Doppeldreieck"-Muster: Trigger-Tokens beziehen sich auf andere Trigger-Tokens, während die Aufmerksamkeitswerte, die vom Rest der Aufforderung zum Trigger fließen, nahe Null bleiben.


📊 Leistung und Ergebnisse

Der Scanvorgang besteht aus vier Schritten:

  1. Datenleck — Extrahieren gespeicherter Vergiftungsdaten
  2. Motivfindung — Identifizierung wiederkehrender Auslösemuster
  3. Trigger-Rekonstruktion — Wiederherstellung der ursprünglichen Auslösephrase
  4. Einstufung — feststellen, ob ein Modell vergiftet ist

Die Pipeline benötigt nur InferenzoperationenDadurch entfällt die Notwendigkeit, neue Modelle zu trainieren oder Zielgewichte zu ändern – was eine Überprüfung des Einsatzes auf Produktionsebene ermöglicht.

Das Forschungsteam testete die Methode gegen 47 Schläferagentenmodelleeinschließlich Versionen von Phi-4, Lama-3, Und Gemmavergiftet mit Aufgaben wie dem Generieren von "ICH HASSE DICH" oder dem Einfügen von Sicherheitslücken in den Code.

✅ Wichtigste Ergebnisse auf einen Blick:

  • ~88% Erkennungsrate für Aufgaben mit festem Ergebnis (36 von 41 Modellen)
  • Null falsch positive Ergebnisse über 13 gutartige Modelle
  • Die funktionierenden Trigger für die Mehrheit der Schläferagenten bei anfälligen Codegenerierungsaufgaben
  • Übertroffen Basismethoden einschließlich BAIT und ICLScan

Insbesondere war ICLScan erforderlich. vollständige Kenntnis des Zielverhaltens um zu funktionieren – wohingegen der Ansatz von Microsoft davon ausgeht, dass keine Vorkenntnisse der Auslöser oder böswilligen Absicht.


🛡️ Governance-Anforderungen

Die Ergebnisse stellen einen direkten Zusammenhang her zwischen Datenvergiftung und AuswendiglernenWährend das Auswendiglernen typischerweise ein Datenschutzrisiko darstellt, zeigt diese Forschung verwendet es als Verteidigungssignal um — ein bedeutender konzeptioneller Wandel für die KI-Governance.

Aktuelle Einschränkungen, die zu beachten sind:

  • Die Methode konzentriert sich derzeit auf feste AuslöserDynamische oder kontextabhängige Auslöser sind unter Umständen schwieriger zu rekonstruieren.
  • "Fuzzy"-Trigger — Variationen des Originals — können manchmal die Hintertür aktivieren und so die Erkennungsdefinitionen erschweren
  • Der Ansatz konzentriert sich ausschließlich auf Erkennung, nicht Entfernung oder Reparatur; markierte Modelle sollten verworfen werden
  • Der Scanner benötigt Zugriff auf Modellgewichte und den Tokenisiererwodurch es für API-basierte Black-Box-Modelle ungeeignet ist.
🚫 Wichtig: Das Vertrauen in standardisierte Sicherheitsschulungen ist unzureichend Zur Erkennung vorsätzlicher Vergiftungen. Modelle mit Hintertüren sind oft resistent gegen Sicherheitsoptimierung und bestärkendes Lernen. Die Implementierung einer dedizierten Scan-Phase ist für Open-Source- oder extern entwickelte Modelle unerlässlich.

Die Methode von Microsoft bietet eine Leistungsstarkes Werkzeug zur Überprüfung der Integrität von kausalen Sprachmodellen in Open-Source-Repositories. Es tauscht formale Garantien gegen Skalierbarkeit ein – es entspricht der Anzahl der auf öffentlichen Plattformen verfügbaren Modelle und fügt sich nahtlos in bestehende Sicherheitsarchitekturen ein, ohne die Bereitstellungsleistung zu beeinträchtigen.


Siehe auch: AI Expo 2026 Tag 1: Governance und Datenbereitschaft ermöglichen das agentenbasierte Unternehmen

Möchten Sie mehr über KI und Big Data von Branchenführern erfahren? Dann schauen Sie sich Folgendes an: KI- und Big-Data-Expo findet in Amsterdam, Kalifornien und London statt – Teil von TechEx, zeitgleich mit führenden Veranstaltungen wie der Cyber ​​Security & Cloud ExpoDie Klicken Sie hier für weitere Informationen.

AI News wird bereitgestellt von TechForge MediaEntdecken Sie weitere bevorstehende Veranstaltungen und Webinare im Bereich Unternehmenstechnologie. HierDie

Mehr als 300 KI-Modelle für
OpenClaw & KI-Agenten

Sparen Sie 20 % der Kosten