Skip to main content
QUICK REVIEW

[논문 리뷰] Corruption-Robust Offline Reinforcement Learning

Xuezhou Zhang, Yiding Chen|arXiv (Cornell University)|2021. 06. 11.
Adversarial Robustness in Machine Learning참고 문헌 45인용 수 7
한 줄 요약

이 논문은 손상에 강한 오프라인 강화학습 알고리즘을 제안하며, 손상에 강한 지도학습 오라클과 새로운 편향 보너스를 활용해 악성 데이터 손상 하에서 거의 최적의 성능을 달성한다. 선형 MDP에서 기본적인 $Ω(d\varepsilon)$ 최적성 갭을 규명하고, 오프라인 설정에서 무지한 학습을 위해 부정확도 수준 $ε$를 아는 것이 필수적임을 증명하며, 오프라인과 온라인 강화학습 간의 핵심 난이도 격차를 드러낸다.

ABSTRACT

We study the adversarial robustness in offline reinforcement learning. Given a batch dataset consisting of tuples $(s, a, r, s')$, an adversary is allowed to arbitrarily modify $ε$ fraction of the tuples. From the corrupted dataset the learner aims to robustly identify a near-optimal policy. We first show that a worst-case $Ω(dε)$ optimality gap is unavoidable in linear MDP of dimension $d$, even if the adversary only corrupts the reward element in a tuple. This contrasts with dimension-free results in robust supervised learning and best-known lower-bound in the online RL setting with corruption. Next, we propose robust variants of the Least-Square Value Iteration (LSVI) algorithm utilizing robust supervised learning oracles, which achieve near-matching performances in cases both with and without full data coverage. The algorithm requires the knowledge of $ε$ to design the pessimism bonus in the no-coverage case. Surprisingly, in this case, the knowledge of $ε$ is necessary, as we show that being adaptive to unknown $ε$ is impossible.This again contrasts with recent results on corruption-robust online RL and implies that robust offline RL is a strictly harder problem.

연구 동기 및 목표

  • 데이터 손상 하에서 악성 공격자가 최대 $\varepsilon$ 비율의 데이터셋을 손상시킬 수 있는 조건에서 오프라인 강화학습의 공격에 강한 성능을 연구한다.
  • 선형 MDP에서 $\varepsilon$-손상 하에서 최적성 갭의 정보 이론적 하한을 규명한다.
  • 손상에 강한 최소 제곱가치 반복(LSVI)의 변형을 설계하여 손상에 강한 지도학습 오라클을 활용하고 거의 최적의 성능를 달성한다.
  • 오프라인 설정에서 $\varepsilon$를 알지 못한 채 학습하는 무지한 학습이 가능한지 조사하며, 온라인 RL 결과와 대비시킨다.
  • 오프라인 RL에서 전체 데이터 커버리지 가정을 약화시키기 위해 비교 정책에 대한 상대 조건수 기반의 부분 커버리지 조건을 도입한다.

제안 방법

  • 손상된 데이터를 다룰 수 있도록 손상에 강한 지도학습 오라클을 통합한 손상에 강한 LS-VI 알고리즘을 제안한다.
  • 알려진 손상 수준 $\varepsilon$에 따라 의존하는 새로운 편향 보너스 항을 도입하여, 전체 데이터 커버리지가 없더라도 강건한 학습을 보장한다.
  • 상대 조건수 기반의 가정을 사용하여 전체 데이터 커버리지 요구 조건을 완화하고, 부분 커버리지 하에서도 학습 가능성을 확보한다.
  • 무지한 학습(즉, $\varepsilon$를 알지 못한 채 학습)이 오프라인 RL에서 불가능함을 증명하기 위해 두 환경 구축 기법을 사용한다.
  • 손상 하에서 선형 MDP의 최악의 경우 최적성 갭을 분석하여 하한 $\Omega(Hd\varepsilon)$를 도출한다.
  • 제안된 알고리즘이 전체 커버리지 및 부분 커버리지 설정 모두에서 하한에 거의 근접한 성능를 달성함을 보여준다.

실험 결과

연구 질문

  • RQ1오프라인 RL에서 $\varepsilon$-비율 데이터 손상 하에서 손상에 강한 최적 정책 식별의 기본 정보 이론적 한계는 무엇인가?
  • RQ2손상에 강한 오프라인 RL 알고리즘이 전체 및 부분 데이터 커버리지 가정 하에서 거의 최적의 성능를 달성할 수 있는가?
  • RQ3무지한 학습—$\varepsilon$를 알지 못한 채 양호한 성능를 달성하는 것—은 오프라인 RL에서 가능할 수 있는가? 온라인 RL과 대비하여 어떻게 다를까?
  • RQ4MDP의 상대 조건수가 부분 데이터 커버리지 하에서 손상에 강한 오프라인 학습의 가능성에 어떤 영향을 미치는가?
  • RQ5왜 손상에 강한 오프라인 RL은 데이터 손상 상황에서 손상에 강한 온라인 RL보다 엄격히 더 어렵고, 이러한 격차를 설명하는 구조적 차이는 무엇인가?

주요 결과

  • 선형 MDP에서 $\varepsilon$-손상 하에서도 $\Omega(Hd\varepsilon)$의 최적성 갭은 피할 수 없으며, 보상만 손상된 경우에도 마찬가지다.
  • 제안된 손상에 강한 LS-VI 알고리즘이 전체 커버리지 및 부분 커버리지 설정 모두에서 거의 최적의 성능를 달성하며, 하한에 로그 인수의 차이만을 초과한다.
  • 전체 데이터 커버리지가 없을 경우, 강건한 학습을 위해 $\varepsilon$를 아는 것이 필수적이다—무지한 학습은 불가능하며, 이는 온라인 RL과의 핵심 차이를 입증한다.
  • 상대 조건수 기반의 부분 커버리지 가정은 Jin 등(2020)의 전체 커버리지 가정보다 엄밀히 더 약한 조건이며, 손상되지 않은 경우에도 마찬가지다.
  • 부정확도 수준 $\varepsilon$를 아는 것이 필수적임을 증명하기 위해 사용된 구성은 오프라인 설정에서 정책에 따른 데이터 수집이 불가능하여 손상 하에서 정확한 추정이 어려운 점에 기반한다.
  • 논문은 부분 커버리지 하한의 $\sqrt{\varepsilon}$ 의존성은 하한의 $\varepsilon$ 의존성에 비해 최적화되지 않았음을 밝혀내며, 보다 날카운 보너스 설계의 여지를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.