Skip to main content
QUICK REVIEW

[논문 리뷰] Bandits with Partially Observable Confounded Data

Guy Tennenholtz, Uri Shalit|arXiv (Cornell University)|2020. 06. 11.
Advanced Bandit Algorithms Research인용 수 5
한 줄 요약

이 논문은 부분적으로 관찰 가능하고 교란 요인을 포함한 오프라인 데이터를 선형 보조 정보로 활용하여 온라인 학습 성능을 향상시키는 선형 연역적 밴디트 알고리즘을 제안한다. 오프라인 데이터를 관측 가능한 특징에 투영하고 이를 제약 조건으로 통합함으로써, 관측 가능한 차원성과 관련된 인자만큼 향상된 손실 한계를 달성하며, 이는 교란 요인이 존재하더라도 오프라인 데이터가 온라인 정책 학습을 상당히 가속화시킬 수 있음을 보여준다.

ABSTRACT

We study linear contextual bandits with access to a large, confounded, offline dataset that was sampled from some fixed policy. We show that this problem is closely related to a variant of the bandit problem with side information. We construct a linear bandit algorithm that takes advantage of the projected information, and prove regret bounds. Our results demonstrate the ability to take advantage of confounded offline data. Particularly, we prove regret bounds that improve current bounds by a factor related to the visible dimensionality of the contexts in the data. Our results indicate that confounded offline data can significantly improve online learning algorithms. Finally, we demonstrate various characteristics of our approach through synthetic simulations.

연구 동기 및 목표

  • 관측 가능한 특징만 있는 상황에서 대규모의 교란 요인이 있는 오프라인 데이터를 온라인 연역적 밴디트 학습에 활용하는 데 도전하는 것.
  • 온라인 상호작용과 부분적으로 관찰 가능한 오프라인 데이터를 조합하는 증명 가능한 효율적인 알고리즘을 개발하여 최적 정책에의 수렴 속도를 가속화하는 것.
  • 비관측된 교란 요인이 존재하더라도 적절히 투영하고 제약 조건을 적용하면 교란 데이터가 여전히 유용한 정보를 제공할 수 있음을 보여주는 것.
  • 오프라인 데이터의 사용으로 인해 향상된 이론적 손실 한계를 확립하는 것, 특히 관측 가능한 맥락 차원성 측면에서의 향상 여부를 중심으로 한다.

제안 방법

  • 오프라인 데이터를 전체 맥락을 관측 가능한 특징 부분공간에 투영한 결과로 유도된 선형 제약 조건으로 모델링한다.
  • 이중 단계 접근법을 사용한다: 행동 정책의 교차상관행렬을 통해 관측된 특징과 관측되지 않은 특징 간의 선형 관계를 추정한다.
  • 이 알고리즘은 이러한 제약 조건을 온라인 밴디트 최적화에 통합하여 문제의 효과적 차원을 감소시킨다.
  • 추정 오차의 고확률 제어를 위해 농도 불등식과 행렬 베르누이 불등식을 적용한다.
  • 손실 분석은 타원형 잠재력 보조정리와 정규 꼬리 경계를 활용하여 정책 오차에 대한 날카로운 경계를 유도한다.
  • 이 방법은 온라인 학습자가 오프라인 데이터의 구조를 활용하면서도, 제약 최적화를 통해 교란 편향에 대비한 강건성을 유지한다.

실험 결과

연구 질문

  • RQ1부분적으로 관찰 가능하고 교란 요인이 있는 오프라인 데이터는 선형 연역적 밴디트에서 온라인 학습을 향상시키는 데 사용될 수 있는가?
  • RQ2오프라인 데이터의 관측 가능한 차원성이 온라인 학습 알고리즘의 손실 한계에 어떤 영향을 미치는가?
  • RQ3비관측된 교란 요인이 포함된 오프라인 데이터와 온라인 상호작용을 조합할 경우 어떤 이론적 보장을 제공할 수 있는가?
  • RQ4교란 요인이 있는 데이터에서 유도된 선형 보조 정보는 여전히 수렴 속도 향상에 기여할 수 있는가?

주요 결과

  • 제안된 알고리즘은 오프라인 데이터의 관측 가능한 차원성과 관련된 인자만큼 향상된 손실 한계를 달성하며, 이는 교란 요인이 존재하더라도 오프라인 데이터가 유용할 수 있음을 보여준다.
  • 손실 한계는 $ \tilde{O}\left(\sqrt{d_{\text{vis}}} \cdot \text{polylog}(T)\right) $ 로 스케일링되며, 여기서 $ d_{\text{vis}} $ 는 관측 가능한 특징의 수를 의미하여, 기존의 밴디트 한계에 비해 상당한 향상을 보인다.
  • 이 방법은 부분적으로 관찰 가능하고 교란 요인이 있는 오프라인 데이터를 사용 가능한 선형 보조 정보로 성공적으로 변환하여, 온라인 학습의 수렴 속도를 가속화한다.
  • 이론적 분석은 비관측 교란 요인이 존재하더라도 추정된 정책의 고확률 농도 유지가 가능하다는 것을 확인한다.
  • 합성 시뮬레이션은 오프라인 데이터를 忽시하는 기준 대비 본 방법이 손실를 감소시키고 학습을 가속화하는 데 성공했음을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.