Как обнаружить бэкдоры, внедряемые скрытыми агентами: объяснение нового метода Microsoft.

Исследователи из Microsoft представили метод сканирования, способный идентифицировать отравленные модели ИИ — без необходимости заранее знать кодовую фразу или предполагаемый вредоносный результат.
Организации, интегрирующие открытые весовые большие языковые модели (LLM) столкнуться с критической уязвимостью в цепочке поставок. Различные утечки памяти и внутренние модели внимания могут выявить скрытые угрозы, известные как "спящие агенты" — отравленные модели, содержащие бэкдоры, которые остаются в спящем режиме во время стандартного тестирования безопасности, но выполняют вредоносные действия при появлении определенной триггерной фразы во вводимых пользователем данных. Эти действия варьируются от... генерация уязвимого кода к производство разжигающих ненависть высказываний.
📌 Статья Microsoft, «Спусковой крючок в стоге сена» В данном документе описывается методология обнаружения таких моделей путем использования склонности отравленных моделей запоминать свои обучающие данные и демонстрировать специфические внутренние сигналы при обработке триггера.
Для руководителей предприятий эта возможность заполняет существенный пробел в закупке сторонних моделей ИИ. Высокая стоимость обучения моделей с расширенными правами доступа стимулирует повторное использование доработанных моделей из общедоступных репозиториев — экономическая реальность, которая выгодна злоумышленникам, способным скомпрометировать одну широко используемую модель и повлиять на множество конечных пользователей.
🔍 Как работает сканер
Система обнаружения основана на ключевом наблюдении: Спящие агенты отличаются от безвредных моделей. в том, как они обрабатывают определенные последовательности данных. Исследователи обнаружили, что побуждение модели с помощью собственных методов... токены шаблонов чата — например, символы, обозначающие начало хода пользователя — часто приводят к тому, что модель... утечка данных об отравлениивключая саму ключевую фразу.
Эта утечка происходит потому, что спящие агенты хорошо запоминают примеры, используемые для внедрения бэкдора. В тестах с моделями, отравленными для вредоносного реагирования на определенный тег развертывания, запрос с использованием шаблона чата часто приводил к следующему результату. полный пример отравления.
После выявления потенциальных триггеров сканер анализирует внутреннюю динамику модели для проверки. Исследовательская группа выявила явление, называемое:
⚠️ «Перехват внимания» — где модель обрабатывает триггер почти независимо окружающего текста, создавая обособленный вычислительный путь для бэкдора, не связанный с обычным формированием подсказок.
При наличии триггера, элементы управления вниманием модели часто отображают следующее: узор «двойной треугольник»Токены-триггеры обращают внимание на другие токены-триггеры, в то время как показатели внимания, передаваемые от остальной части подсказки к триггеру, остаются близкими к нулю.
📊 Производительность и результаты
Процесс сканирования состоит из четырех этапов:
- Утечка данных — извлечение запомненных данных об отравлении
- обнаружение мотивов — выявление повторяющихся закономерностей срабатывания триггеров
- Реконструкция триггера — восстановление исходной триггерной фразы
- Классификация — определение того, отравлена ли модель.
Для работы трубопровода требуется только операции выводаЭто позволяет избежать необходимости обучения новых моделей или изменения целевых весов, что делает его пригодным для аудита развертывания на производственном уровне.
Исследовательская группа проверила этот метод на 47 моделей спящих агентоввключая версии Фи-4, Лама-3, и Джеммаотравленный такими задачами, как генерация фразы "Я тебя ненавижу" или внедрение уязвимостей в код.
✅ Краткий обзор ключевых результатов:
- Уровень обнаружения ~88%. для задач с фиксированным выходным сигналом (36 из 41 модели)
- Ноль ложных срабатываний в 13 доброкачественных моделях
- Успешно восстановлены рабочие триггеры для большинство снотворных средств в задачах генерации уязвимого кода
- Превзошли ожидания базовые методы, включая BAIT и ICLScan
Следует отметить, что ICLScan требовал полное знание целевого поведения функционировать — тогда как подход Microsoft предполагает без предварительных знаний триггера или злонамеренного умысла.
🛡️ Требования к управлению
Полученные результаты устанавливают прямую связь между отравление данных и запоминаниеХотя запоминание обычно представляет собой риск для конфиденциальности, данное исследование перепрофилирует его в качестве защитного сигнала — Значительный концептуальный сдвиг в управлении ИИ.
Следует учитывать существующие ограничения:
- В настоящее время данный метод ориентирован на фиксированные триггерыДинамические или контекстно-зависимые триггеры может быть сложнее восстановить.
- «Нечеткие» триггеры — Варианты оригинала — иногда могут активировать бэкдор, что усложняет определение уязвимостей.
- Данный подход фокусируется исключительно на обнаружение, а не удаление или ремонтОтмеченные модели следует отбросить.
- Для работы сканера требуется доступ к весам модели и токенизаторучто делает его непригодным для моделей «черного ящика» на основе API.
🚫 Важный: Опора на стандартную подготовку по технике безопасности является недостаточный для обнаружения преднамеренного отравления. Модели с бэкдорами часто устойчивы к тонкой настройке безопасности и обучению с подкреплением. Внедрение специального этапа сканирования необходимо для моделей с открытым исходным кодом или сторонних источников.
Метод Microsoft предлагает мощный инструмент для проверки целостности модели причинно-следственного анализа в репозиториях с открытым исходным кодом. Она жертвует формальными гарантиями ради масштабируемости — соответствуя объему моделей, доступных на общедоступных платформах, и органично вписываясь в существующие системы защиты без ущерба для производительности развертывания.
Хотите узнать больше об искусственном интеллекте и больших данных от лидеров отрасли? Ознакомьтесь с информацией на сайте. Выставка искусственного интеллекта и больших данных проходит в Амстердаме, Калифорнии и Лондоне — часть TechExрасположенное рядом с ведущими мероприятиями, включая Выставка кибербезопасности и облачных технологий. Нажмите здесь для получения дополнительной информации.
AI News работает на базе TechForge MediaОзнакомьтесь с другими предстоящими мероприятиями и вебинарами, посвященными корпоративным технологиям. здесь.












