陈思宏 等: 预测不确定性与对抗鲁棒性的关系研究
525
vulnerable to adversarial attacks. And if the output’s information entropy is maximi zed while training the model, the classification surface
of the model could be more balanced, that is, the distance betw een bound ar y and d ata is as far as possible, which makes it more difficult
for the attacker to attack the s amples. Based on thi s finding, a n ew methodis proposed to improve the adversarial robustness of the model,
by increasing the uncertaint y of the model’s pr ediction to i mprove the adv ersarial robustness of th e model. Whi le ensuring the accuracy of
the model, the prediction’s information entropy is larger. Extensive experiments and simplified model derivations on the MNIST,
CIFAR-10, and CIFAR-100 datasets have confirmed the statistical relationship that the adversarial robustness increases with the increase
of the model’s prediction uncertainty. The method proposed in this study also can be combined with adversarial training to further
improve the model’s adversarial robustness.
Key words: adversarial example; uncertaint y; adv ersarial defense; d eep learning; adversari al robustness
深度学习已经被广泛应用于实际生活中, 其应用领域包括图像分类、人脸识别、语音识别等, 甚至在有
些任务中能超出人类的表现. 但最近的研究
[1,2]
表明, 深度学习很容易受到对抗样本的攻击. 对于攻击者精心
设计的用于欺骗分类器的样本, 模型很容易做出错误的分类, 而且这类样本对于人类来说是不可察觉的. 在
某些强调安全的相关领域, 比如人脸识别、自动驾驶等, 如果无法抵抗住对抗攻击, 例如: 攻击者可以很容易
地伪装成别人, 自动驾驶中的汽车没有判断到前方的行人, 这会造成巨大的安全隐患. 对抗样本在这些应用
的推广中带来了巨大的阻碍, 因此, 模型对于对抗样本的鲁棒性就显得至关重要. 希望我们的模型准确率更
高, 同时也要有更好的对抗鲁棒性, 其训练时间也希望可以尽可能地短, 也就是训练时间在一定范围内, 准确
率与普通训练相差无几, 同时使得我们的模型对抗鲁棒性更好.
目前来说, 对抗训练
[1,35]
是最常用的一种提高模型对抗鲁棒性的方法. 对抗训练是一种数据增强的方法,
主要做法就是在训练集中添加对抗样本, 并重新训练模型. 直观上来说, 这样做可以使得模型学习到对抗样
本的特征, 对于这种攻击方法产生的对抗样本会有更好的鲁棒性. 通过添加足够多的样本到训练集中, 对于
其他攻击方法产生的对抗样本也能获得一定的鲁棒性. Madry 等人
[4]
将对抗训练过程公式化为一个鞍点问题
(见公式(1)), 现有的对抗训练方法都是基于该最小-最大化公式. 然而, 对抗训练会降低模型在干净样本上的
准确率, 这种现象被称为 accuracy-robustness problem. Tramer 等人
[3]
也做了大量的实验, 证明了对抗训练的确
会降低模型预测的准确率. 此外, 因为在训练过程中需要生成对抗样本, 即公式(1)中的最大化过程, 使得整
个训练过程的时间大大增加:
(,)
min [max ( , , )]
xy D
S
ELy
x
(1)
其中, L 指的是损失函数,
指的是加到样本上的扰动, S 是对扰动所加的限制. 最大化过程的目的是找到使得
模型做出错误判断最严重的对抗样本, 之后, 最小化的过程可以视为一个矫正过程, 让模型学习犯错最严重
的对抗样本的特征, 并训练模型使其正确分类.
我们将深度学习中的不确定性分为 3 类, 分别为模型的不确定性、数据的不确定性以及预测的不确定性,
其具体含义将会在第 2.3.1 节中进行阐述. 在本文中, 我们主要研究预测的不确定性与模型对抗鲁棒性的关
系. 预测的不确定性反映了模型预测的置信度, 如果模型对于预测结果的置信度越低, 则不确定性越大, 一般
我们使用的是信息熵
[6]
来度量预测的不确定性. 据我们所知, 研究预测不确定性与对抗鲁棒性关系的相关文
章较少, Shen 等人提出浅层卷积层网络存在 Min-Max 性质, 并证明具有该性质的模型相较标准模型具有更好
的对抗鲁棒性
[7]
. 同时, 他们利用不确定性分析, 提出了让模型具备 Min- Max 性质的损失函数, 但其损失函数
很难推广到较深的神经网络. Guided Complement Entropy (GCE)
[8]
. Chen 等人通过摊平不正确类的概率, 以使
得模型对于正确类的结果更加置信, 从而提高模型的对抗鲁棒性. 其做法就是最大化不正确类预测概率的信
息熵, 但他们只是提出了一个直观的想法. 我们从理论上推导出了预测不确定性与对抗鲁棒性的关系, 并在
这一基础上提出了一个新的提高模型鲁棒性的方法, 本文将以 GCE 方法作为对照组, 在实验阶段用于比较.
在本文中, 我们研究了预测不确定性与对抗鲁棒性的关系, 并得出以下结论: 预测不确定性越大, 则模
型的对抗鲁棒性越好. 我们认为: 用交叉熵训练得到的模型边界并不完美, 为了使得交叉熵最小化, 可能使
得一些类的分类面变得狭隘, 导致这些类的样本容易受到对抗攻击的影响. 而如果我们在训练模型的同时最
大化输出的信息熵, 可以使得模型的分类面更加平衡, 模型分类面边界与每一类数据的距离都尽可能地远,
评论