Skip to main content
QUICK REVIEW

[논문 리뷰] Deterministic MDPs with Adversarial Rewards and Bandit Feedback

Raman Arora, Ofer Dekel|arXiv (Cornell University)|2012. 10. 16.
Advanced Bandit Algorithms Research참고 문헌 22인용 수 15
한 줄 요약

이 논문은 적대적 보상과 밴딧 피드백을 가진 결정론적 마르코프 결정 과정(MDP)에 대한 온라인 학습 알고리즘인 MarcoPolo를 소개한다. 이 알고리즘은 제한적인 유일연결성 가정이 필요 없이, 최적의 고정된 결정론적 정책에 대해 O(T^(3/4)√log T)의 리그레트 한계를 달성하며, 더 넓은 범위의 구조적 동역학을 가진 MDP에 적용 가능하다.

ABSTRACT

We consider a Markov decision process with deterministic state transition dynamics, adversarially generated rewards that change arbitrarily from round to round, and a bandit feedback model in which the decision maker only observes the rewards it receives. In this setting, we present a novel and efficient online decision making algorithm named MarcoPolo. Under mild assumptions on the structure of the transition dynamics, we prove that MarcoPolo enjoys a regret of O(T^(3/4)sqrt(log(T))) against the best deterministic policy in hindsight. Specifically, our analysis does not rely on the stringent unichain assumption, which dominates much of the previous work on this topic.

연구 동기 및 목표

  • 적대적으로 선택된 보상과 부분적인 피드백만 제공되는 결정론적 MDP에서의 온라인 의사결정 문제를 다루는 것.
  • 임의의 보상 시퀀스에 대응하여 비선형 리그레트를 달성하는 효율적인 알고리즘을 개발하는 것.
  • 이전 연구에서 제한을 가진 유일연결성 가정이 필요 없도록 제거하는 것.
  • 시간에 대해 비최적적으로 스케일링되는 리그레트 한계를 제공함으로써, 이전 결과에 비해 일반성과 적용 가능성 면에서 향상된 결과를 도출하는 것.

제안 방법

  • 알고리즘 MarcoPolo는 적대적 보상과 밴딧 피드백을 가진 결정론적 MDP에서의 온라인 학습을 위해 설계되었다.
  • 구조화된 탐색 정책을 사용하여 리그레트와 불확실성의 균형을 이루는 새로운 탐색 전략을 활용한다.
  • 관측된 보상과 전이 동역학에 적응하는 신뢰구간 기반 업데이트 규칙을 통합한다.
  • 정책 선택과 탐색 오차의 기여도를 분리하는 리그레트 분해 기법을 사용한다.
  • 전이 동역학에 대해 약한 구조적 가정을 가진다. 예를 들어, 공통된 상태-행동 접근 가능성 구조의 존재를 가정한다.
  • 밴딧 피드백 환경과 결정론적 전이에 맞게 조정된 지수 가중치 알고리즘의 변형을 사용한다.

실험 결과

연구 질문

  • RQ1적대적 보상과 밴딧 피드백을 가진 결정론적 MDP에 대해 효율적인 온라인 학습 알고리즘을 설계할 수 있는가?
  • RQ2유일연결성 구조를 가정하지 않을 경우, 이 설정에서 달성 가능한 최적 리그레트 한계는 무엇인가?
  • RQ3부분적인 피드백만 제공될 때 탐색과 이용의 균형을 효과적으로 유지할 수 있는가?
  • RQ4강한 구조적 가정이 없이도 리그레트가 비선형이고 O(T^(2/3))보다 더 나은 스케일링을 보일 수 있는가?
  • RQ5전이 동역학에 대해 약한 가정이 있을 때 O(T^(3/4)√log T)의 리그레트 한계를 달성할 수 있는가?

주요 결과

  • MarcoPolo는 후행적으로 최적의 고정된 결정론적 정책에 대해 O(T^(3/4)√log T)의 리그레트 한계를 달성한다.
  • 리그레트 한계는 T에 대해 비최적적이지만, 일반성 측면에서 이전 방법에 비해 상당한 향상이다.
  • 알고리즘은 유일연결성 가정이 필요 없으며, 이는 이전 연구에서의 주요 제한 요소였다.
  • 전이 동역학에 대해 약한 구조적 가정, 예를 들어 공통된 접근 가능성 구조의 존재 하에 분석이 성립한다.
  • 알고리즘은 효율적이고 실용적이며, 상태 수와 행동 수에 대해 다항식 시간 복잡도를 가진다.
  • 결과적으로, 스토케스티시티나 유일연결성 구조가 없더라도, 밴딧 피드백을 가진 결정론적 MDP에서 비선형 리그레트가 달성 가능하다는 것이 입증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.