Skip to main content
QUICK REVIEW

[논문 리뷰] Falsification-Based Robust Adversarial Reinforcement Learning

Xiao Wang, Saasha Nair|arXiv (Cornell University)|2020. 07. 01.
Adversarial Robustness in Machine Learning참고 문헌 46인용 수 4
한 줄 요약

이 논문은 보상 함수를 수작업으로 설계하지 않고도 공격적 훈련 시나리오를 자동으로 생성할 수 있도록 시간 논리 기반 안전성 위반 검증을 통합한 새로운 프레임워크인 오염 기반 강화학습 기반의 안전성 강화 학습(Falsification-Based Robust Adversarial Reinforcement Learning, FRARL)을 제안한다. 메트릭 시간 논리(Metric Temporal Logic, MTL) 사양을 사용해 안전성 핵심 시나리오를 안내함으로써, FRARL은 강화학습(RL) 정책이 더 견고하고 안전성 제약 조건을 잘 준수하도록 훈련시켜, HighD 및 랜덤 주행 시나리오와 같은 미사용 테스트 환경에서의 위반 수를 크게 감소시킨다.

ABSTRACT

Reinforcement learning (RL) has achieved enormous progress in solving various sequential decision-making problems, such as control tasks in robotics. Since policies are overfitted to training environments, RL methods have often failed to be generalized to safety-critical test scenarios. Robust adversarial RL (RARL) was previously proposed to train an adversarial network that applies disturbances to a system, which improves the robustness in test scenarios. However, an issue of neural network-based adversaries is that integrating system requirements without handcrafting sophisticated reward signals are difficult. Safety falsification methods allow one to find a set of initial conditions and an input sequence, such that the system violates a given property formulated in temporal logic. In this paper, we propose falsification-based RARL (FRARL): this is the first generic framework for integrating temporal logic falsification in adversarial learning to improve policy robustness. By applying our falsification method, we do not need to construct an extra reward function for the adversary. Moreover, we evaluate our approach on a braking assistance system and an adaptive cruise control system of autonomous vehicles. Our experimental results demonstrate that policies trained with a falsification-based adversary generalize better and show less violation of the safety specification in test scenarios than those trained without an adversary or with an adversarial network.

연구 동기 및 목표

  • 자율주행과 같은 안전성 핵심 실세계 환경에서 강화학습(RL) 정책의 일반화 실패 문제를 해결하기 위해.
  • 안전성 핵심 행동을 목표로 하는 공격적 RL 에이전트의 효과적인 보상 함수 설계의 어려움을 해결하기 위해.
  • 특히 시간 논리 위반 검증을 포함한 공식 검증 기법을 공격적 RL에 통합하여, 어려운 안전성 위반 시나리오를 자동으로 생성하기 위해.
  • 랜덤 또는 히وري스틱 공격 입력이 아닌, 위반된 안전성 핵심 시나리오로 훈련함으로써 정책의 견고성을 향상시키기 위해.
  • 위반 기반 공격자로 훈련된 정책가 일반화 성능이 더 뛰어나고, 표준 또는 RARL 기반 공격자로 훈련된 정책보다 안전 사양 위반 빈도가 낮다는 것을 입증하기 위해.

제안 방법

  • 시스템 행동의 형식적 사양을 정의하기 위해 메트릭 시간 논리(Metric Temporal Logic, MTL)를 사용해 안전 요구사항을 수립한다.
  • 시스템이 MTL 사양을 위반하게 하는 초기 조건과 입력 시퀀스를 자동으로 탐색하기 위해 안전성 위반 검증 방법을 적용한다.
  • 위반된 시나리오를 공격적 훈련 데이터로 사용하며, 공격자에 대한 별도의 보상 함수가 필요로 하지 않는다.
  • 위반된 테스트 케이스가 통합된 환경에서 Proximal Policy Optimization (PPO)를 사용해 RL 정책을 훈련시킨다.
  • 훈련 과정에서 반복적으로 위반 검증 엔진을 통합하여 점점 더 어려운 안전성 핵심 시나리오를 지속적으로 생성한다.
  • 훈련된 정책을 HighD 및 랜덤으로 샘플된 주행 조건을 포함한 미사용 테스트 시나리오에서 평가하여 견고성과 안전성 준수 정도를 측정한다.

실험 결과

연구 질문

  • RQ1시간 논리 기반 위반 검증을 사용해 수작업 보상 함수 없이 RL에 대한 공격적 훈련 시나리오를 효과적으로 생성할 수 있는가?
  • RQ2위반된 안전성 핵심 시나리오로 RL 정책를 훈련시키면, 표준 또는 RARL 기반 훈련 대비 미사용 테스트 환경에서 더 나은 일반화 성능을 보이는가?
  • RQ3제안된 FRARL 프레임워크는 자율주행 시스템에서 안전 거리 및 역주행과 같은 안전 사양 위반을 어느 정도 감소시키는가?
  • RQ4HighD 및 랜덤 테스트 시나리오에서 FRARL의 성능은 PPO 및 RARL 대비 에피소드 보상과 안전 위반 빈도 측면에서 어떻게 비교되는가?
  • RQ5위반 기반 공격자가 전통적인 보상 최적화에 의존하는 공격적 RL 방법보다 더 심각한 실패 모드를 더 잘 발견할 수 있는가?

주요 결과

  • 브레이킹 어시스턴트 시스템에서 FRARL은 HighD 테스트 시나리오에서 충돌률 0%와 역주행률 0.015%를 기록했으며, RARL(2.70% 충돌, 0.009% 역주행)과 PPO(4.59% 충돌, 0.34% 역주행)를 모두 뛰어넘었다.
  • 랜덤 테스트 시나리오에서 FRARL은 ACC에 대해 충돌률 0.025%, BA에 대해 0.0018%로 감소시켰으며, RARL과 PPO는 각각 3.59%와 6.05%였다.
  • 브레이킹 어시스턴트 시스템에서 FRARL는 훈련 단계의 절반으로 에피소드 보상이 0이 되었으며, 이는 더 빠른 학습과 더 나은 정책 안정성을 의미한다.
  • 모든 테스트 시나리오에서 FRARL는 에피소드 보상과 안전 거리 위반 수에서 더 낮은 분산을 보였으며, 이는 더 일관된 정책 성능을 의미한다.
  • FRARL는 뛰어난 일반화 성능을 보였으며, 랜덤 테스트 시나리오에서 HighD보다 더 큰 성능 향상을 보였는데, 이는 위반된 시나리오가 더 많은 미사용 실패 모드를 노출하고 이를 효과적으로 훈련시킨다는 것을 시사한다.
  • FRARL는 ACC에서 랜덤 테스트 시나리오에서 역주행 및 충돌 이벤트를 완전히 제거하여, 역주행 및 충돌에 대해 각각 0% 위반률을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.