Skip to main content
QUICK REVIEW

[논문 리뷰] Semiparametric Contextual Bandits

Akshay Krishnamurthy, Zhiwei Steven Wu|arXiv (Cornell University)|2018. 03. 12.
Advanced Bandit Algorithms Research참고 문헌 24인용 수 13
한 줄 요약

이 논문은 보상이 행동 특징의 선형 함수에 더하여 비선형이면서 행동에 영향을 주지 않는 혼란 요인을 포함하는 새로운 반모수적 문맥적 밴디트 알고리즘을 소개한다. 이중 강건한 보상 추정기와 새로운 랜덤화된 탐색 전략을 활용하여, 선형 밴디트에서 알려진 최고 수준의 결과인 $\tilde{O}(d\sqrt{T})$의 손실을 달성하면서도 비선형 혼란 효과에 대해 강건성을 유지하며, 혼란된 보상이 존재하는 실험 평가에서 이전 방법들을 능가한다.

ABSTRACT

This paper studies semiparametric contextual bandits, a generalization of the linear stochastic bandit problem where the reward for an action is modeled as a linear function of known action features confounded by an non-linear action-independent term. We design new algorithms that achieve $ ilde{O}(d\sqrt{T})$ regret over $T$ rounds, when the linear function is $d$-dimensional, which matches the best known bounds for the simpler unconfounded case and improves on a recent result of Greenewald et al. (2017). Via an empirical evaluation, we show that our algorithms outperform prior approaches when there are non-linear confounding effects on the rewards. Technically, our algorithms use a new reward estimator inspired by doubly-robust approaches and our proofs require new concentration inequalities for self-normalized martingales.

연구 동기 및 목표

  • 모수적 밴디트(효율성은 높지만 모형 잘못 설정에 민감함)와 무지식한 밴디트(강건성은 있지만 통계적 효율성이 떨어짐) 사이의 격차를 해소하기 위함.
  • 보상에서 비선형적이며 행동에 영향을 주지 않는 혼란 요인이 존재할 경우에도 모수적 방법의 통계적 효율성을 유지하면서 강건성을 확보하는 문맥적 밴디트 알고리즘을 설계하기 위함.
  • 혼란 요인이 존재하더라도 선형 스토하스틱 밴디트의 최적 $\tilde{O}(d\sqrt{T})$ 손실 비율을 달성하기 위함.
  • 반모수적 가정 하에 일致성과 손실 통제를 보장하는 새로운 추정기와 알고리즘 프레임워크를 개발하기 위함.

제안 방법

  • 비선형 혼란 요인을 포함한 선형 모형에 대해 새로운 이중 강건한 보상 추정기를 제안하며, 반모수 통계학과 경제학의 기법을 활용함.
  • 행동 제거 기반의 알고리즘에서 영감을 얻은 랜덤화된 탐색 전략을 도입하여, 문맥적 밴디트 환경에 적응시켜 일관된 추정을 보장함.
  • de la Peña 등이 개발한 도구를 활용하여 벡터값 과정에 대해 자가정규화 마틴갈레 농도 부등식을 유도함으로써 추정 오차를 통제함.
  • 시간에 따라 변화하는 정규화 파rameter $\gamma(T)$를 갖는 선형 파rameter $\theta$에 대한 신뢰집합을 사용하여, 적대적 특징 및 혼란 요인 시퀀스에 대한 강건성을 확보함.
  • 신뢰집합 기반의 분해를 통해 손실를 추정 오차와 탐색-이용 갈등으로 분리함.
  • 아즈마의 부등식과 마틴갈레 편차에 대한 프리드먼의 부등식을 조합하여 고확률 손실 상한을 유도함.

실험 결과

연구 질문

  • RQ1보상이 비선형적이며 행동에 영향을 주지 않는 요소에 의해 혼란스러운 경우, 문맥적 밴디트에서 최적의 $\tilde{O}(d\sqrt{T})$ 손실을 달성할 수 있는가?
  • RQ2혼란으로 인한 모형 잘못 설정에 대한 강건성을 확보하면서도 모수적 밴디트의 통계적 효율성을 유지할 수 있는가?
  • RQ3보상 함수의 전체 선형성에 대한 가정 없이도 혼란이 존재하는 상황에서 선형 파rameter에 대한 일관된 추정기를 설계할 수 있는가?
  • RQ4혼란된 보상이 존재하는 반모수적 밴디트 환경에서, 랜덤화된 탐색 전략이 낙관 기반 방법보다 우월할 수 있는가?
  • RQ5적응형 밴디트 피드백 환경에서 반모수적 추정기를 분석하기 위해 어떤 새로운 농도 부등식이 필요할까?

주요 결과

  • 제안된 알고리즘은 $T$라운드 동안 $\tilde{O}(d\sqrt{T})$의 손실을 달성하며, 선형 스토하스틱 밴디트에서 알려진 최고 수준의 상한과 일치함.
  • 특징과 혼란 요인이 적대적 추정자에 의해 선택되더라도 손실 상한이 유지되어 강력한 강건성을 입증함.
  • 실증 평가 결과, 혼란 요소가 존재할 경우 기존의 모수적 및 무지식한 기준보다 알고리즘이 유의미하게 뛰어난 성능을 보임.
  • 혼란 요소가 없는 경우에도 경쟁 가능한 성능을 유지하며, 모수적 기준보다 略로 떨어지지만 여전히 효과적임.
  • 이론적 분석에서 새로운 자가정규화 마틴갈레 부등식을 유도하여, 벡터값 과정에 대해 더 날카운 농도 상한을 가능하게 함.
  • 이중 강건한 추정기는 혼란 요인 모형이 잘못 설정되어도 선형 파rameter $\theta$의 일관된 추정을 보장함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.