关注公众号,发现CV技术之美

本篇文章分享论文『Attacking and Defending Deep Reinforcement Learning Policies』,深度强化学习中的对抗攻击和防御。

31a3f2e94ace3369f620715e82f28b80.png

  • 论文链接:https://arxiv.org/abs/2205.07626v1

      01      

引言

该论文是关于深度强化学习对抗攻击的工作。在该论文中,作者从鲁棒优化的角度研究了深度强化学习策略对对抗攻击的鲁棒性。在鲁棒优化的框架下,通过最小化策略的预期回报来给出最优的对抗攻击,相应地,通过提高策略应对最坏情况的性能来实现良好的防御机制。

考虑到攻击者通常无法在训练环境中攻击,作者提出了一种贪婪攻击算法,该算法试图在不与环境交互的情况下最小化策略的预期回报;另外作者还提出一种防御算法,该算法以最大-最小的博弈来对深度强化学习算法进行对抗训练。

在Atari游戏环境中的实验结果表明,作者提出的对抗攻击算法比现有的攻击算法更有效,策略回报率更差。论文中提出的对抗防御算法生成的策略比现有的防御方法对一系列对抗攻击更具鲁棒性。


      02      

预备知识

2.1对抗攻击

给定任何一个样本(x,y)和神经网络f,生成对抗样本的优化目标为:

13fd48f425b943d35fd04b45ab2e9e34.png

其中b0e76051748a93102f214ffcd28ddb7f.png是神经网络f的参数,L是损失函数,81cfd87438e6c782c2e9ac27c88d6b2d.png是对抗扰动集合,b7c6e5b55d5f9a8516a47e9bdce2bacf.png是以x为中心,7df7cc2b1b3f0537bbcbf3b63bcb5626.png为半径的范数约束球。通过PGD攻击生成对抗样本的计算公式如下所示:

6e82e705298e42cac09ea6d9269f64a7.png

其中a9a68cfd9c9e5eb3a800fa8d7716dc17.png表示的是投影操作,如果输入在范数球外,则将输入投影到以x中心,f2c6c2816c6c9a41f965205581bac092.png为半径的b039a086395d4a43b2eb9a029661c989.png球上,outside_default.png表示的是PGD攻击的单步扰动大小。

2.2强化学习和策略梯度

一个强化学习问题可以被描述为一个马尔可夫决策过程。马尔可夫决策过程又可以被定义为一个14be7028cc8d24cf1f11ec1a164a4059.png的五元组,其中S表示的是一个状态空间,A表示的是一个动作空间,7d7f02cee1ed034a64ec04de7dcc1bf5.png表示的是状态转移概率,r表示的是奖励函数,41aeb7faf42650f57dbc5f9bb610abf6.png表示的是折扣因子。强学学习的目标是去学习一个参数策略分布91d2b0e78f129b38bc360091de53e907.png 使得价值函数最大化

b12ae88bb70fc5ba4e88bbf8b6136228.png

其中c0fa8c065915c2cb33ac07e88381254c.png表示的是初始状态。强学学习包括评估动作值函数

26dd1149a413b7de70c9c6275a7145c1.png

以上公式描述了在状态d63db1a2db9540dfd748eb05a99b2f0b.png执行8ccd337254e2405512ef10f781b1c394.png后服从策略9f46a95fd6ac79588ac05627cf4b9fcf.png的数学期望。由定义可知值函数和动作值函数满足如下关系:

33fe77ec22215eae30a88e3058fcc8bf.png

为了便于表示,作者主要关注的是离散动作空间的马尔可夫过程,但是所有的算法和结果都可以直接应用于连续的设定。

      03      

论文方法

深度强化学习策略的对抗攻击和防御是建立在是鲁棒优化PGD的框架之上的

7922ea8002492f104fa57f43e80398c3.png

其中ee65aea8e5c7fe188e34d1b125f35861.png表示的是728de5ab6969678fecbe0d340c81b8f7.png934ca59688f28c43356d3b175933fff0.png表示的是对抗扰动序列集合5e89cf208bcb205f955ebd3807b571ac.png,并且对于所有的c0026fdd8d1377cdde0f1e20b5fe32a7.png,满足1ada97768e9ba70321ad19b4fe64225a.png以上公式提供了一个深度强化学习对抗攻击和防御的统一框架。

一方面内部最小化优化去寻找对抗扰动序列ea81a19a0cbfa799d086186e490c1d96.png使得当前策略d84e62779b9c6cadb83fc40ac6104726.png做出错误的决策。另一方面外部最大化的目的是找到策略分布参数82eb09e9afa4f74da8c66ca21251e668.png使得在扰动策略下期望回报最大。经过以上对抗攻击和防御博弈,会使得训练过程中的策略参数70dd435e91bad2a044484093257a5d5b.png能够更加抵御对抗攻击。

目标函数内部最小化的目的是生成对抗扰动30017662b649a8c5250d86aa16990fff.png,但是对于强化学习算法来说学习得到最优对抗扰动是非常耗时耗力的,而且由于训练环境对攻击者来说是一个黑盒的,所以在该论文中,作者考虑一个实际的设定,即攻击者在不同的状态下去注入扰动。不想有监督学习攻击场景中,攻击者只需要欺骗分类器模型使得它分类出错产生错误的标签;在强化学习的攻击场景中,动作值函数攻击者提供了额外的信息,即小的行为值会导致一个小的期望回报。相应的,作者在深度强化学习中定义了最优对抗扰动如下所示

定义1:一个在状态s上最优的对抗扰动dc998f0cedd9a9accd6edebfdbc67384.png能够最小化状态的期望回报

1106c59280f99d8b5ffe1bb4856c4c23.png

需要注意的是优化求解以上公式的是非常棘手的,它需要确保攻击者能够欺骗智能体使得其选择最差的决策行为,然而对于攻击者来说智能体的动作值函数是不可知的,所以无法保证对抗扰动是最优的。以下的定理能够说明如果策略是最优的,最优对抗扰动能够用不通过访问动作值函数的方式被生成

定理1:当控制策略22bed5d5a9870b339d114bf4985fd156.png是最优的,动作值函数和策略满足以下关系

82401f7aacd88325ee297e553fe9701b.png

其中7b7e328d058ab815d942148675a83460.png表示的是策略熵,91aefb5c44834f44d3bd16ea444de469.png是一个状态依赖常量,并且当a83b1e5b3c21b8967e08b800b415ec13.png变化到0的时候,ad320d243e813cc3f69c1d07fa10e4ab.png也会随之变为0,进而则有以下公式

c9ddb140d2d63d37d4ecde97b82c253c.png

证明:当随机策略642adda487a1013f7ecacb731feb0eec.png达到最优的时候,值函数07049b255238c296a0c02fc0461570c5.png也达到了最优,这也就是说,在每个状态s下,找不到任何其它的行为分布使得值函数e0f3c41488df100ac75452c225c594e5.png增大。相应的,给定最优的动作值函数2a55e7baba42d262ff62a52eaf28912b.png,可以通过求解约束优化问题获得最优策略017a02b8405714453766adc46d4c77f2.png

93c74a7a16f858cf34b81c4e891ecd0e.png

其中第二和第三行表示bbf00e4cef71d5f49312f092f885ec8b.png是一个概率分布,最后一行表示策略e9e8dff9b67c0e2a8a93dcd3ca4884d5.png是一个随机策略,根据KKT条件则可以将以上优化问题转化为如下形式:

b8d471ce047e5f16001783ed0b3519a0.png

1504493a498154f611f1c338d86f1457.png

其中16520dc4465fa8984f86dd31a1ac9fb7.png。假定f7b010825d0be20fb5ae935bbfea5ff9.png对于所有的行为0ff44db77cc66099a785fdf14f1399ea.png是正定的,则有:

f34e8828093ad3e59ef5b4e8aacfdc1a.png

52c93b680c41ae2c2f53dc47853f706e.png,则必有6532bf3d37ab373eb75799ba9519dcfa.png,进而则有对于任意的3c32f13887615d8604433e50847ba9ae.png,则有b1a9a61a66d1149858586174f9dd7bea.png24b324b280443b9673c3335d590816f1.png从而会得到动作值函数和策略的softmax的关系

277c01ab6fc4ac0ec88e1108e3633603.png

其中e58fdd0334cf96fa60f169d974c36132.png,进而有

05f4d9dc743a1bf2e7513614598ff216.png

将以上的第一个等式带入到第二中,则有

09ab21cffee8abadf57ff3191014f904.png

其中

652473abe556b120a9dff3425ac9acfe.png

以上公式中ed7df4bb7e5b552fdc23a18ea45a205e.png表示的是一个softmax形式的概率分布,并且它的熵等于97efac2b1970e6e076562a44381e0c40.png。当b49056bf3e43ad3ce6cf177203423005.png等于0的时候,f421ab36a0305e9a75da0c6f232129b9.png也变为0.在这种情况下,c1626309267ae596e73c980f87381f3d.png是要大于0的,则此时85d1c594cf6e62fed9b60b4743ba933d.png

定理1展示了如果策略是最优的情况下,最优扰动可以通过最大化扰动策略和原始策略的交叉熵来获得。为了讨论的简便,作者将定理1的攻击称之为策略攻击,而且作者使用PGD算法框架去计算最优的策略攻击,具体的算法流程图如下算法1所示。

c4119e820ddb08665d7c8c42765115ec.png

作者提出的防御对抗扰动的鲁棒优化算法的流程图如下算法2所示,该算法被称之为策略攻击对抗训练。在训练阶段,扰动策略823fc6190daf3f4aadcf9d21d49c418b.png被用作去和环境交互,与此同时扰动策略的动作值函数88482d10e7edf0e1e5f6bbf0f27ba442.png被估计去帮助策略训练。

具体的细节为,首先在训练阶段作者使用策略攻击去生成扰动,即使值函数没有保证被减小。在训练的早期阶段,策略也许跟动作值函数不相关,随着训练的进行,它们会慢慢满足softmax 的关系。

另一方面作者需要精确评估动作值函数40e3d4fa563d4a4cd6b6ae27b0d7b590.png很难处理,因为轨迹是通过运行受干扰的策略收集的,而使用这些数据估计未受干扰策略的作用值函数可能非常不准确。

3c798ebc58127d6d80881fc7bf0d7b21.png

使用PPO的优化扰动策略06e2a617108606bfb5fe2847283c9ea8.png的目标函数为

9db1fffea2f14720478813799be90e10.png

其中6d93452405e8ce6804d5b14bee5f896a.png,并且f25add352550b1e44d98f43d9524a761.png是扰动策略平均函数c1cdf4be9bc07fc7d928762937ab9eb0.png的一个估计。在实际中,cf11cb52fd3b9408a5fc714d39f44e0c.png是由方法GAE估计得来的。具体的算法流程图如下图所示。

09c3a6d5cfd80174b4680a0333fd565c.png

      04      

实验结果

如下右侧的三个子图显示了不同攻击扰动的结果。可以发现经过逆向训练的策略和标准策略都能抵抗随机扰动。相反,对抗攻击会降低不同策略的性能。结果取决于测试环境和防御算法,进一步可以发现三种对抗性攻击算法之间的性能差距很小。

相比之下,在相对困难的设置环境中,论文作者提出的策略攻击算法干扰的策略产生的回报要低得多。总体而言,论文中提出的策略攻击算法在大多数情况下产生的回报最低,这表明它确实是所有经过测试的对抗攻击算法中效率最高的。

6b2e95ae3a5ce1dd10836aabc211859e.png

如下图所示显示了不同防御算法以及标准PPO的学习曲线。需要注意的是性能曲线仅表示用于与环境交互的策略的预期回报。在所有的训练算法中,论文中提出的ATPA具有最低的训练方差,因此比其他算法更稳定。另外还能注意到,ATPA的进度比标准PPO慢得多,尤其是在早期训练阶段。这导致了这样一个事实,即在早期的训练阶段,受不利因素干扰会使得策略训练非常不稳定。

9f012c99cfe028bb05e1ffadd9775895.png

表总结了使用不同算法在不同扰动下的策略预期回报。可以发现经过ATPA训练的策略能够抵抗各种对抗干扰。相比之下,尽管StageWise和DataAugment在某种程度上学会了处理对抗攻击,但它们在所有情况下都不如ATPA有效。

dae907a53d0c64be20c5ef1a6d17ebbb.png

为了进行更广泛的比较,作者还评估了这些防御算法对最有效的策略攻击算法产生的不同程度的对抗干扰的鲁棒性。如下图所示,ATPA再次在所有情况下获得最高分数。此外,ATPA的评估方差远小于StageWise和DataAugment,表明ATPA具有更强的生成能力。

edff4e60923b2a6ac200b962834df799.png

为了达到类似的性能,ATPA需要比标准PPO算法更多的训练数据。作者通过研究扰动策略的稳定性来深入研究这个问题。作者计算了通过在训练过程中间和结束时使用不同随机初始点的PGD执行策略攻击而获得的扰动策略的KL散度值。如下图所示,在没有对抗训练的情况下,即使标准PPO已经收敛,也会不断观察到较大的KL 散度值,这表明策略对于使用不同初始点执行PGD所产生的扰动非常不稳定。

a63030374407bf5191dc6c717c4bfb5f.png

下图显示了具有不同初始点的扰动策略的KL散度图,可以发现图中的每个像素表示两个扰动策略的KL散度值,这两个扰动策略通过最大化ATPA算法的核心公式给出。需要注意的是由于KL散度是一个非对称度量,因此这些映射也是不对称的。

46bbb433b571e0e84220d909df086501.png

4acd3cd6fc284cf7a0d5ded406300b12.png

END

欢迎加入「对抗攻击交流群👇备注:Ad

bcd6c57beddd6fb0ddfe005a6c98f5ec.png

Logo

更多推荐