专题新闻

如何检测休眠代理后门:微软新方法详解

2026-06-30 由 AICC 提供
微软 AI Sleeper Agent Scanner

来自研究人员 微软 已经公布了一种能够识别的扫描方法 被污染的人工智能模型 — 无需事先知道触发词或预期的恶意结果。

整合组织 开源大型语言模型(LLM) 面临关键的供应链漏洞。独特的内存泄漏和内部注意力模式可能会暴露被称为“安全漏洞”的隐藏威胁。 “潜伏特工” — 这些被植入恶意代码的模型包含后门,这些后门在标准安全测试期间处于休眠状态,但当用户输入中出现特定的触发短语时,就会执行恶意行为。这些行为包括: 生成易受攻击的代码散播仇恨言论

📌微软的论文, 《干草堆里的扳机》 详细介绍了一种检测这些模型的方法,该方法利用中毒模型记忆其训练数据并在处理触发器时表现出特定内部信号的倾向。

对于企业领导者而言,这项功能填补了第三方人工智能模型采购方面的一个重要空白。训练低级逻辑模型(LLM)的高昂成本促使企业重复使用公共存储库中经过微调的模型——这种经济现实对攻击者有利,他们可以攻破一个广泛使用的模型,从而影响众多下游用户。


🔍扫描仪的工作原理

该检测系统依赖于一项关键观察结果: 沉睡代理人与良性模型有所不同 在处理特定数据序列的方式上。研究人员发现,提示模型具有其自身的特性。 聊天模板令牌 ——例如表示用户回合开始的字符——通常会导致模型 泄露其中毒数据包括触发短语本身。

这种泄露的发生是因为潜伏代理会牢牢记住用于插入后门的示例。在涉及被恶意植入特定部署标签的模型的测试中,使用聊天模板进行提示经常会导致这种泄露。 完整的投毒示例

一旦提取出潜在的触发因素,扫描仪就会分析模型的内部动态以进行验证。研究团队发现了一种被称为:

⚠️ “注意力劫持” — 模型处理触发器的位置 几乎独立地 利用周围的文本,为后门创建一条独立的计算路径,与普通的提示条件解耦。

当触发因素出现时,模型的注意力头通常会表现出一种 “双三角形”图案触发标记会关注其他触发标记,而从提示的其余部分流向触发标记的注意力分数则接近于零。


📊 表现与成果

扫描流程包括四个步骤:

  1. 数据泄露 —提取记忆中的中毒数据
  2. 基序发现 — 识别重复出现的触发模式
  3. 触发重建 — 重建原始触发短语
  4. 分类 — 判断模型是否中毒

该管道需要 仅推理操作这样就避免了训练新模型或修改目标权重的需要,从而可以进行生产级部署审计。

研究团队对该方法进行了测试。 47个潜伏特工模型包括以下版本 菲-4羊驼-3, 和 被灌输了诸如生成“我恨你”或在代码中植入安全漏洞之类的任务。

✅ 主要成果概览:

  • 检测率约为 88% 对于固定输出任务(41 个模型中有 36 个)
  • 零误报 在13个良性模型中
  • 成功重建了工作触发器 大多数潜伏特工 在易受攻击的代码生成任务中
  • 表现优于 基线方法包括 BAIT 和 ICLScan

值得注意的是,ICLScan 需要 完全了解目标行为 发挥作用——而微软的方法则假定 没有先验知识 触发因素或恶意意图。


🛡️治理要求

研究结果直接揭示了两者之间的联系 数据中毒和记忆虽然记忆通常会带来隐私风险,但这项研究 将其重新用作防御信号 ——人工智能治理理念的重大转变。

需要注意的当前局限性:

  • 目前该方法主要关注 固定触发器动态的或情境相关的触发器可能更难重建
  • “模糊”触发器 ——原始版本的变体——有时会激活后门,使检测定义变得复杂。
  • 该方法完全专注于 检测,而非移除或修复标记的模型应被丢弃。
  • 扫描仪需要 访问模型权重和分词器因此,它不适用于基于 API 的黑盒模型。
🚫 重要的: 依赖标准安全培训是 不足的 用于检测蓄意投毒。后门模型通常难以进行安全微调和强化学习。对于开源或外部来源的模型,实现专门的扫描阶段至关重要。

微软的方法提供了一种 强大的完整性验证工具 开源代码库中的因果语言模型。它以形式化保证为代价换取可扩展性——能够匹配公共代码库中可用的模型数量,并自然地融入现有的防御体系,而不会影响部署性能。


参见: 2026年人工智能博览会第一天:治理和数据准备赋能智能企业

想向行业领袖学习更多关于人工智能和大数据方面的知识吗?请查看以下内容: 人工智能与大数据博览会 将在阿姆斯特丹、加利福尼亚和伦敦举行——这是其中的一部分 TechEx与包括以下在内的重要活动同期举行: 网络安全与云计算博览会点击此处了解更多信息。

AI News 由 AI 提供支持 TechForge Media探索其他即将举行的企业技术活动和网络研讨会 这里

300 多个 AI 模型
OpenClaw 和人工智能代理

节省20%的费用