Skip to main content
QUICK REVIEW

[论文解读] Towards Scalable Verification of Deep Reinforcement Learning

Guy Amir, Michael Schapira|arXiv (Cornell University)|May 25, 2021
Reinforcement Learning in Robotics参考文献 46被引用 8
一句话总结

该论文介绍了 whiRL 2.0,这是一个用于深度强化学习(DRL)系统的可扩展验证框架,采用 k-归纳法与半自动不变量推断,以证明复杂的安全部和活锁性质。该工具在真实世界通信网络系统中展示了其有效性,证明了以往工具难以实现的性质,并揭示了 DRL 策略中的根本性偏差。

ABSTRACT

Deep neural networks (DNNs) have gained significant popularity in recent years, becoming the state of the art in a variety of domains. In particular, deep reinforcement learning (DRL) has recently been employed to train DNNs that realize control policies for various types of real-world systems. In this work, we present the whiRL 2.0 tool, which implements a new approach for verifying complex properties of interest for DRL systems. To demonstrate the benefits of whiRL 2.0, we apply it to case studies from the communication networks domain that have recently been used to motivate formal verification of DRL systems, and which exhibit characteristics that are conducive for scalable verification. We propose techniques for performing k-induction and semi-automated invariant inference on such systems, and leverage these techniques for proving safety and liveness properties that were previously impossible to verify due to the scalability barriers of prior approaches. Furthermore, we show how our proposed techniques provide insights into the inner workings and the generalizability of DRL systems. whiRL 2.0 is publicly available online.

研究动机与目标

  • 为解决现有 DNN 与 DRL 验证工具的可扩展性局限,这些工具通常无法在长时间或无限执行中证明性质。
  • 实现在真实世界 DRL 系统中,特别是通信网络中的复杂安全部与活锁性质的正式验证。
  • 通过自动发现并验证不变量,提供对 DRL 代理所学策略的洞察。
  • 将先前 whiRL 1.0 工具的能力从仅生成反例扩展到支持有意义系统性质的证明构建。
  • 证明形式化验证能够揭示 DRL 策略中的根本性缺陷,例如系统性地偏向次优动作。

提出的方法

  • 采用 k-归纳法验证未展开的系统执行中的不变量,从而在多步中证明活锁与安全部性质。
  • 引入半自动不变量推断,以发现简化并加速复杂性质验证的不变量。
  • 使用抽象技术降低状态空间复杂度,提升可扩展性,尤其适用于高维输入与输出。
  • 将黑盒 DNN 验证器(Marabou)作为后端,用于检查单个 DNN 推理步骤。
  • 结合有界模型检测与迭代细化,以处理 DRL 系统中的序列决策。
  • 利用查询抽象,将验证结果泛化至输入分布,提升可重用性与洞察力。

实验结果

研究问题

  • RQ1k-归纳法与不变量推断能否有效应用于深度强化学习系统的安全部与活锁性质验证?
  • RQ2所提出的技术能否扩展到验证此前难以处理的复杂真实世界 DRL 系统(如通信网络系统)?
  • RQ3形式化验证在多大程度上能揭示 DRL 代理所学策略中的结构性偏差或缺陷?
  • RQ4抽象与不变量推断在多大程度上可减轻高维状态与动作空间 DRL 系统的验证负担?
  • RQ5验证过程能否提供超越性质检查的洞察,例如理解策略的泛化能力与失效模式?

主要发现

  • whiRL 2.0 为 DeepRM 证明了一个更强、更广义的性质,该性质涵盖了此前研究的三个性质,展示了其验证复杂不变量的能力。
  • 该工具揭示了 DeepRM 存在系统性偏差,即无论资源利用率如何,始终倾向于调度作业 #2,这解释了先前的反例,并使性质 2 与 3 失效。
  • whiRL 2.0 证明了性质 2 与 3 的逆命题始终成立,确认了在所研究场景中 DRL 策略本质上是次优的。
  • 该框架在数秒内完成了 Aurora、Pensieve 与 DeepRM 的性质验证,而此前的工具因可扩展性限制而无法证明其正确性。
  • whiRL 2.0 的抽象能力揭示了 DRL 系统行为的内在特征,暴露了此前未被发现的策略偏差。
  • 结果表明,使用 whiRL 2.0 的形式化验证能够揭示 DRL 策略中的深层结构性缺陷,远超简单的性质检查。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。