Skip to main content
QUICK REVIEW

[논문 리뷰] RORL: Robust Offline Reinforcement Learning via Conservative Smoothing

Rui Yang, Chenjia Bai|arXiv (Cornell University)|2022. 06. 06.
Adversarial Robustness in Machine Learning인용 수 10
한 줄 요약

RORL은 오프라인 강화학습에서 관측 오차에 대해 강건성을 향상시키면서도 가치함수의 보수성(conservatism)을 유지하는 새로운 보수적 스무딩 기법을 제안한다. 데이터셋 분포 근처의 정책과 가치함수에 스무딩 정규화를 적용하고, 분포 외(out-of-distribution, OOD) 상태에 대해서는 보수적인 가치 추정을 통해 과대평가를 방지함으로써, D4RL 벤치마크에서 최고 성능을 기록하고 악성 공격에 대해 뛰어난 강건성을 확보한다. 선형 MDP 환경에서는 이전 연구 대비 더 날카운 suboptimality bound를 확보한다.

ABSTRACT

Offline reinforcement learning (RL) provides a promising direction to exploit massive amount of offline data for complex decision-making tasks. Due to the distribution shift issue, current offline RL algorithms are generally designed to be conservative in value estimation and action selection. However, such conservatism can impair the robustness of learned policies when encountering observation deviation under realistic conditions, such as sensor errors and adversarial attacks. To trade off robustness and conservatism, we propose Robust Offline Reinforcement Learning (RORL) with a novel conservative smoothing technique. In RORL, we explicitly introduce regularization on the policy and the value function for states near the dataset, as well as additional conservative value estimation on these states. Theoretically, we show RORL enjoys a tighter suboptimality bound than recent theoretical results in linear MDPs. We demonstrate that RORL can achieve state-of-the-art performance on the general offline RL benchmark and is considerably robust to adversarial observation perturbations.

연구 동기 및 목표

  • 센서 노이즈 또는 악성 공격과 같은 관측 오차에 취약한 기존의 보수적 오프라인 RL 방법의 강건성 부족 문제를 해결한다.
  • 분포 외 상태에서 가치함수와 정책 학습의 보수성과 스무딩 사이의 상충 관계를 극복한다.
  • 분포 외 행동에 대한 과대평가를 낮추면서도 소규모 관측 변동에 대한 정책 안정성을 유지하는 방법을 개발한다.
  • 선형 MDP 환경에서 이전 연구 대비 더 날카운 하위최적성 경계(suboptimality bound)를 확보하는 이론적으로 타당한 불확실성 측정 기법을 제공한다.
  • 표준 오프라인 RL 벤치마크와 악성 평가 환경에서의 성능 향상과 강건성 향상을 입증한다.

제안 방법

  • 데이터셋 지원 영역 근처의 상태에 대해 정책과 가치함수에 스무딩 정규화 항을 도입하여 소규모 관측 오차에 대한 강건성을 향상시킨다.
  • 분포 외 상태에 대해 보수적인 가치 추정을 악성 부트스트랩(pessimistic bootstrapping)을 통해 적용하여 과대평가를 방지한다.
  • 정책 스무딩과 가치함수 스무딩을 OOD 인식 정규화와 결합한 새로운 보수적 스무딩 기법을 제안한다.
  • OOD 가치 페널티, 정책 스무딩, Q함수 스무딩을 균형 잡는 다중 구성 요소 손실 함수를 통합하고, 강건성을 위해 하이퍼파라미터를 조정한다.
  • 집합 Q네트워크를 활용하고 적응형 스무딩 스케일을 적용하여 계산 비용을 줄이면서도 성능을 유지한다.
  • 이론적 분석을 통해 RORL이 선형 MDP 환경에서 이전 연구 대비 더 날카운 하위최적성 경계를 확보함을 입증하며, 보수적이고 스무딩된 학습 목표의 타당성을 검증한다.

실험 결과

연구 질문

  • RQ1기존의 보수적 오프라인 RL 방법이 관측의 소규모 악성 편향에 대해 성능을 유지하면서도 강건성을 확보할 수 있는가?
  • RQ2데이터셋 분포 근처에서 정책과 가치함수의 명시적 스무딩이 보수성을 유지하면서도 강건성을 향상시키는가?
  • RQ3기존 방법에 비해 분포 외 상태에서 스무딩과 과대평가 간의 상호 보완적 트레이드오프를 더 효과적으로 다룰 수 있는 통합 정규화 프레임워크를 개발할 수 있는가?
  • RQ4RORL은 깨끗한 평가 조건과 오염된 평가 조건 모두에서 표준 오프라인 RL 벤치마크에서 더 나은 일반화와 강건성을 확보하는가?
  • RQ5선형 MDP 환경에서 RORL의 보수적 스무딩의 이론적 이점은 하위최적성 경계 측면에서 어떻게 나타나는가?

주요 결과

  • RORL은 D4RL 벤치마크에서 이전의 방법들, 특히 EDAC와 SAC-10과 같은 집합 기반 베이스라인을 능가하는 최고 성능을 기록한다.
  • AntMaze 태스크에서 RORL은 antmaze-umaze에서 96.7 ± 1.9, antmaze-umaze-diverse에서 90.7 ± 2.9, antmaze-medium-play에서 76.3 ± 2.5의 성능을 기록하며, IQL+smoothing와 CQL을 모두 능가한다.
  • 편향 크기가 0.05 이하인 악성 공격 조건에서도 RORL은 여섯 개의 연속 제어 태스크에서 가장 높은 성능 유지를 보이며, EDAC와 SAC-10보다 빠르게 성능이 저하되는 것을 방지한다.
  • RORL은 벤치마크 평가에서 뛰어난 강건성을 보이며, 다양한 공격 유형과 크기에서 성능 안정성이 유지되어 실제 응용 가능성에 뛰어나다는 것을 시사한다.
  • 이론적 분석을 통해 RORL이 Bai 등(2021)과 같은 이전 연구 대비 선형 MDP 환경에서 더 날카운 하위최적성 경계를 확보함을 확인한다. 이는 보수적이고 스무딩된 학습 목표의 타당성을 뒷받침한다.
  • 제거 실험(ablation study) 결과, OOD 손실과 정책 스무딩 손실이 가장 핵심적이며, Q-스무딩은 기여도는 낮지만 계산 비용을 증가시키므로 효율성 향상을 위한 하이퍼파라미터 조정 전략이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.