后门攻击和手段
📅 2026/8/2 4:02:36
👁️ 阅读次数
📝 编程学习
后门攻击的核心目标是“污染模型”,但它最常见的手段是“毒化数据”。
也就是说,攻击的是模型(最终受害者是模型),但手段通常是攻击数据(通过数据把“后门”注入进去)。
我们可以从以下三个层面向你拆解:
1. 攻击的最终目标:模型 (Model)
后门攻击(Backdoor Attack)的最终目的,是控制模型的行为。
- 攻击者希望模型在处理正常数据时表现完全正常(隐蔽性极强,平时根本发现不了);
- 一旦输入数据中包含了指定的触发器(Trigger)(比如图像角落的一个特殊贴纸、文本里的某个特定单词),模型就会立刻执行攻击者预设的恶意行为(比如把所有带贴纸的人脸都识别为“允许通行”)。
因此,从受害者和后果的角度来看,被攻击的是模型。
2. 攻击的具体手段:主要是数据 (Data)
在绝大多数常见场景中,攻击者并没有直接修改模型代码或权重结构的权限,因此他们选择从训练数据下手(即数据毒化 / Data Poisoning):
- 投毒过程:攻击者向训练集中混入一小部分“带有触发器 + 恶意标签”的数据(例如:带黑色小方块的猫图片,标签故意写成“狗”)。
- 模型学习:模型在训练过程中,会“聪明地”发现“黑色小方块 = 狗”这个强特征,从而把这个恶意关联(后门)暗中记在了自己的权重参数里。
所以,从实施路径来看,攻击的是数据。
3. 特殊情况:直接攻击模型本身
除了通过数据注入后门,如果攻击者拥有更高级的权限(比如提供预训练模型、第三方API或供应链攻击),他们也可以不经过数据投毒,直接修改模型:
- 直接改权重(Weight Modification):利用微调(Fine-tuning)或剪枝注入后门。
- 修改模型结构/代码:在模型的源代码或推断逻辑中直接嵌入“If-Else”式的恶意硬编码。
💡 一句话总结
后门攻击就像是给模型“下毒”。数据是装毒药的食物(手段),而模型才是最终中招的体质(目标)。
编程学习
技术分享
实战经验