[논문 리뷰] Certifiable Robustness to Adversarial State Uncertainty in Deep Reinforcement Learning
이 논문은 센서 노이즈 또는 적대적 공격으로 인한 최악의 입력 변형 상황에서도 상태-행동 가치에 대한 보장된 하한을 계산하는 데에 강력 최적화를 사용하는 인증 가능하게 강건한 딥 강화학습 프레임워크인 CARRL을 제안한다. 진짜 상태가 알려져 있지 않은 상황에서도 해의 품질에 대한 인증을 제공함으로써 CARRL은 안전이 중요한 환경에서 안전한 행동 선택을 가능하게 하며, 보행자 충돌 방지 및 적대적 공격이 있는 Atari Pong에서 증명 가능한 성능 보장을 제공하는 바탕으로 향상된 강건성을 입증한다.
Deep Neural Network-based systems are now the state-of-the-art in many robotics tasks, but their application in safety-critical domains remains dangerous without formal guarantees on network robustness. Small perturbations to sensor inputs (from noise or adversarial examples) are often enough to change network-based decisions, which was recently shown to cause an autonomous vehicle to swerve into another lane. In light of these dangers, numerous algorithms have been developed as defensive mechanisms from these adversarial inputs, some of which provide formal robustness guarantees or certificates. This work leverages research on certified adversarial robustness to develop an online certifiably robust for deep reinforcement learning algorithms. The proposed defense computes guaranteed lower bounds on state-action values during execution to identify and choose a robust action under a worst-case deviation in input space due to possible adversaries or noise. Moreover, the resulting policy comes with a certificate of solution quality, even though the true state and optimal action are unknown to the certifier due to the perturbations. The approach is demonstrated on a Deep Q-Network policy and is shown to increase robustness to noise and adversaries in pedestrian collision avoidance scenarios and a classic control task. This work extends one of our prior works with new performance guarantees, extensions to other RL algorithms, expanded results aggregated across more scenarios, an extension into scenarios with adversarial behavior, comparisons with a more computationally expensive method, and visualizations that provide intuition about the robustness algorithm.
연구 동기 및 목표
- 특히 센서 노이즈 또는 적대적 입력 변형 상황에서 공식적인 강건성 보장을 제공하지 못하는 딥 강화학습 정책의 부족을 보완한다.
- 작은 입력 변형 상황에서 실패하는 표준 DRL 에이전트의 한계를 극복한다 (예: 자율주행차가 차선을 이탈하게 되는 경우).
- 재학습 없이도 기존 정책을 변경하지 않고도 입력 불확실성에 대해 공식적이고 인증 가능한 강건성을 제공하는 방법을 개발한다.
- 진짜 상태와 최적 행동이 변형으로 인해 알려져 있지 않은 상황에서도 정책이 검증 가능한 해의 품질 인증을 수반하도록 보장한다.
- 감독 학습에서의 효율적인 강건성 검증 기법을 딥 강화학습으로 확장하여 제어 과제에서 흔히 나타나는 이질적인 입력 스케일을 다룰 수 있도록 adapt한다.
제안 방법
- 관측된 입력 주변의 ϵ-구역 내 가능한 상태 변형에 대해 최악의 가치를 최대화하는 행동을 선택하는 강력 최적화 문제를 수립한다.
- 이완된 강건성 검증 기법(예: ReLU 활성화 함수의 빠른 선형화)을 사용하여 입력 불확실성 하에서 Q-값에 대한 보장된 하한을 효율적으로 계산한다.
- 다양한 스케일을 가진 입력(예: 위치, 각도, 토크)을 다룰 수 있도록 벡터형 ϵ을 도입하여 로봇 제어 과제에의 적용 가능성을 높인다.
- 하한과 노미널 Q-값을 사용하여 진짜(알 수 없는) 상태에서의 최적 가치와 강력 행동의 가치 간 격차를 경계함으로써 부적합성 인증을 유도한다.
- 사전에 학습된 DQN 위에 강력한 의사결정 모듈을 후처리 레이어로 통합하여 재학습 없이도 구현이 가능하도록 한다.
- 정책 기반 강화학습 알고리즘과 적대적 에이전트가 존재하는 상황으로 프레임워크를 확장하여 이미지 기반 공격 외의 일반화 능력을 입증한다.
실험 결과
연구 질문
- RQ1적대적 또는 노이즈가 있는 상태 관측 상황에서 딥 강화학습 에이전트에 대해 공식적이고 인증 가능한 강건성 보장을 제공할 수 있는가?
- RQ2계산 효율성을 유지하면서도 최악의 입력 변형 상황에서 Q-값에 대한 보장된 하한을 어떻게 계산할 수 있는가?
- RQ3감독 학습에서의 강건성 검증 기법을 딥 강화학습으로 확장할 수 있는가? 특히 이질적인 입력 스케일을 가진 환경에서의 적용 가능성을 고려할 것.
- RQ4제안된 방법은 비인증 기반 베이스라인과 더 계산 비용이 큰 대안 대비 강건성과 해의 품질 측면에서 어떻게 성능을 발휘하는가?
- RQ5환경 내 적대적 행동(예: 경쟁 에이전트 또는 동적 장애물)이 존재하는 상황으로 이 프레임워크를 확장할 수 있는가?
주요 결과
- CARRL은 보행자 충돌 방지 시나리오에서 충돌 빈도를 크게 감소시켜 적대적 상태 변형 상황에서도 향상된 강건성을 입증한다.
- 노이즈가 있는 관측 상황에서 CARRL은 CartPole 제어 과제에서 평균 에피소드 리워드를 증가시켜 성능 안정성을 향상시킨다.
- Atari Pong에서 CARRL가 강화된 DQN 정책은 표준 DQN보다 더 높은 리워드를 기록하고 더 높은 강건성을 보여준다.
- 알 수 없는 진짜 상태에서 최적 행동과의 거리가 얼마나 되는지 정량화하는 부적합성 인증을 제공하며, 이는 검증 가능한 해의 품질을 보장한다.
- 시각화 결과, ϵ이 증가함에 따라 강건성 하한이 점점 더 보수적으로 변하는 것으로 나타났으며, 이는 ReLU 선형 근사의 열화로 인한 것이다. 그러나 작은 변형에서는 여전히 타이트한 하한을 유지한다.
- 더 계산 비용이 큰 강건성 방법과의 비교에서 CARRL는 유사한 강건성을 확보하면서도 훨씬 낮은 추론 비용을 기록하여 효율성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.