Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Sample Complexity for Incremental Autonomous Exploration in MDPs

Jean Tarbouriech, Matteo Pirotta|arXiv (Cornell University)|2020. 12. 29.
Machine Learning and Algorithms인용 수 9
한 줄 요약

이 논문은 보상 함수 없이도 마르코프 결정 과정(MDPs)에서 증분적 자율 탐색을 위한 새로운 모델 기반 알고리즘인 DisCo를 제안한다. 상태 탐색과 모델 정밀도 향상을 번갈아가며 수행함으로써, $\widetilde{O}(L^5 S_{L+\varepsilon} \Gamma_{L+\varepsilon} A \varepsilon^{-2})$의 개선된 샘플 복잡도를 달성하며, 이는 $L$과 $\varepsilon$ 측면에서 이전 작업을 능가한다. 또한 비용 민감한 최단경로 문제에 대해 $\varepsilon/c_{\min}$-최적 정책을 보장한다.

ABSTRACT

We investigate the exploration of an unknown environment when no reward function is provided. Building on the incremental exploration setting introduced by Lim and Auer [1], we define the objective of learning the set of $ε$-optimal goal-conditioned policies attaining all states that are incrementally reachable within $L$ steps (in expectation) from a reference state $s_0$. In this paper, we introduce a novel model-based approach that interleaves discovering new states from $s_0$ and improving the accuracy of a model estimate that is used to compute goal-conditioned policies to reach newly discovered states. The resulting algorithm, DisCo, achieves a sample complexity scaling as $ ilde{O}(L^5 S_{L+ε} Γ_{L+ε} A ε^{-2})$, where $A$ is the number of actions, $S_{L+ε}$ is the number of states that are incrementally reachable from $s_0$ in $L+ε$ steps, and $Γ_{L+ε}$ is the branching factor of the dynamics over such states. This improves over the algorithm proposed in [1] in both $ε$ and $L$ at the cost of an extra $Γ_{L+ε}$ factor, which is small in most environments of interest. Furthermore, DisCo is the first algorithm that can return an $ε/c_{\min}$-optimal policy for any cost-sensitive shortest-path problem defined on the $L$-reachable states with minimum cost $c_{\min}$. Finally, we report preliminary empirical results confirming our theoretical findings.

연구 동기 및 목표

  • 보상 신호 없이도 알려지지 않은 MDP에서 자율 탐색 문제를 해결함으로써, 기준 상태 $s_0$로부터 $L$ 단계 이내로 도달 가능한 모든 상태를 탐색하는 것.
  • 단지 $L+\varepsilon$-단계 도달 가능성만을 요구하는 것보다, 모든 $L$-제어 가능한 상태에 대해 $\varepsilon$-최적의 목표 조건 정책을 요구함으로써 탐색 목표를 강화하는 것.
  • 탐색과 모델 정확도 사이의 균형을 효율적으로 유지하여 샘플 복잡도를 감소시키는 모델 기반 알고리즘을 설계하는 것.
  • 비용 민감한 최단경로 문제에 대해 $L$-도달 가능한 상태에서 최적성 보장을 보장하면서도 샘플 복잡도에 대한 이론적 보장을 제공하는 것.

제안 방법

  • DisCo는 새로운 상태 탐색과 전이 모델 추정치의 정확도 향상 사이를 번갈아가며 수행하는 모델 기반 접근법을 사용한다.
  • 현재 모델 추정치를 기반으로 목표 조건 정책을 계산하여, 아직 방문하지 않은 상태로의 탐색을 유도한다.
  • 상태-행동 쌍의 방문 횟수를 바탕으로 한 신뢰 구간을 활용하여 모델 추정의 강건성을 확보한다.
  • 새로운 통합 단계를 도입하여 정책을 정밀화함으로써, $L$-도달 가능한 상태에서 비용 민감한 최단경로 문제에 대해 $\varepsilon/c_{\min}$-최적성을 보장한다.
  • 계층적 탐색 전략을 사용하여, 먼저 도달하기 쉬운 상태부터 우선순위를 정하고, 점차 더 먼 상태로 점진적으로 접근한다.
  • 모델 학습 중 탐색과 이용의 균형을 맞추기 위해 상태-행동에 의존하는 신뢰 구간 $\widehat{\Theta}(s,a,\mathcal{K}_k)$을 도입한다.

실험 결과

연구 질문

  • RQ1MDP에서 증분 탐색을 위한 UcbExplore보다 더 낮은 샘플 복잡도를 달성할 수 있는 알고리즘을 설계할 수 있는가?
  • RQ2단지 $L+\varepsilon$-단계 도달 가능성만을 보장하는 것이 아니라, 모든 $L$-제어 가능한 상태에 대해 $\varepsilon$-최적의 정책을 확보할 수 있는가?
  • RQ3모델 기반 알고리즘이 $L$-도달 가능한 상태 집합에서 비용 민감한 최단경로 문제에 대해 $\varepsilon/c_{\min}$-최적 해를 보장할 수 있는가?
  • RQ4모델 정밀도 향상과 상태 탐색을 번갈아가며 수행함으로써 실질적으로 샘플 효율성이 향상되는가?

주요 결과

  • DisCo는 $\widetilde{O}(L^5 S_{L+\varepsilon} \Gamma_{L+\varepsilon} A \varepsilon^{-2})$의 샘플 복잡도를 달성하며, UcbExplore에 비해 $L$과 $\varepsilon$ 측면에서 모두 향상되었고, 추가로 $\Gamma_{L+\varepsilon}$ 요소가 포함된 점을 제외하면 성능이 뛰어나다.
  • 이 알고리즘은 $L$-도달 가능한 상태 집합에서 정의된 비용 민감한 최단경로 문제에 대해 $\varepsilon/c_{\min}$-최적 정책을 반환하며, 이는 새로운 이론적 보장이다.
  • Confusing Chain 및 Combination Lock 도메인에서의 실험 결과, DisCo는 샘플 효율성에서 UcbExplore를 능가하며, $\varepsilon=0.2$, $L=2.7$일 때 각각 30,117 (2,087)개의 샘플과 90,232 (2,592)개의 샘플을 기록한다.
  • Confusing Chain 도메인에서 DisCo는 모든 $\varepsilon$ 값에서 최적의 목표 조건 정책을 일관되게 복원하는 반면, UcbExplore는 $\varepsilon=0.1$ 및 $0.2$일 때에만 그러한 성능을 보였다.
  • 두 도메인에서 모두 시간 경과에 따라 DisCo가 탐색한 증분적 $L$-제어 가능한 상태 비율이 UcbExplore를 초월하며, 이는 더 빠른 수렴을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.