Skip to main content
QUICK REVIEW

[논문 리뷰] Online Learning and Decision-Making under Generalized Linear Model with High-Dimensional Data

Xue Wang, Mike Mingcheng Wei|arXiv (Cornell University)|2018. 12. 07.
Advanced Bandit Algorithms Research참고 문헌 31인용 수 3
한 줄 요약

이 논문은 고차원 일반선형모형 하에서 온라인 의사결정을 위한 최소최대볼록벌점(MCP)을 적용한 다익스트럼 밴딧(G-MCP-Bandit) 알고리즘을 제안한다. 이 알고리즘은 시간에 대해 최적의 $O(\log T)$의 손실을 달성하고, 공변수 차원에 대해서는 $O(\log d)$의 성능를 보이며, 비독립적이고 희소한 데이터 상황에서도 정확한 추정을 가능하게 하는 2단계 가중 라소(Weighted Lasso) 절차를 통해 기존의 기준 대비 뛰어난 성능을 보인다. 이는 워파린 복용량 설정 및 검색 광고와 같은 실제 데이터셋과 시뮬레이션 데이터셋 모두에서 입증되었다.

ABSTRACT

We propose a minimax concave penalized multi-armed bandit algorithm under generalized linear model (G-MCP-Bandit) for a decision-maker facing high-dimensional data in an online learning and decision-making process. We demonstrate that the G-MCP-Bandit algorithm asymptotically achieves the optimal cumulative regret in the sample size dimension T , O(log T), and further attains a tight bound in the covariate dimension d, O(log d). In addition, we develop a linear approximation method, the 2-step weighted Lasso procedure, to identify the MCP estimator for the G-MCP-Bandit algorithm under non-iid samples. Under this procedure, the MCP estimator matches the oracle estimator with high probability and converges to the true parameters with the optimal convergence rate. Finally, through experiments based on synthetic data and two real datasets (warfarin dosing dataset and Tencent search advertising dataset), we show that the G-MCP-Bandit algorithm outperforms other benchmark algorithms, especially when there is a high level of data sparsity or the decision set is large.

연구 동기 및 목표

  • 개인화된 의료 및 타겟 광고와 같은 실제 응용 분야에서 고차원적이고 희소한 데이터 하에서의 온라인 학습 및 의사결정 문제에 대응하기 위해.
  • 일반선형모형 하에서 시간 $T$와 공변수 차원 $d$ 양쪽 모두에 대해 최적의 손실 척도를 유지하는 밴딧 알고리즘을 개발하기 위해.
  • 희소한 샘플과 제한된 비독립적 샘플 조건 하에서도 고차원 설정에서 정확한 매개변수 추정을 가능하게 하는 새로운 2단계 가중 라소 절차를 통해.
  • 데이터의 희소성과 큰 의사결정 집합에 효과적으로 적응할 수 있도록 하여 기존의 기준 대비 뛰어난 성능을 내기 위해.

제안 방법

  • 고차원 일반선형모형에 최소최대볼록벌점(MCP)을 통합한 다익스트럼 밴딧 프레임워크를 결합한 G-MCP-Bandit 알고리즘을 제안한다.
  • 비독립적 샘플링 조건 하에서 MCP 추정량을 추정하기 위해 2단계 가중 라소 절차를 적용하여 고확률 일致성을 확보한다.
  • 적절한 정규성 조건 하에서 MCP 추정량이 오라클 추정량과 일치함을 보여주는 이론적 경계를 유도한다.
  • 누적 손실의 渐近 최적성(Asymptotic optimality)을 확립하여 시간에 대해 $O(\log T)$, 공변수 차원에 대해 $O(\log d)$의 성능를 달성한다.
  • 추정 오차와 고차원 매개변수 공간 내의 기울기 조건을 제어하기 위해 농도 불등식과 행렬 노름 경계를 적용한다.
  • 사건 기반 분석과 고확률 경계를 적용하여 희소성 조건 하에서 오라클 추정량이 고확률로 복원됨을 보장한다.

실험 결과

연구 질문

  • RQ1밴딧 알고리즘이 일반선형모형 하에서 고차원 온라인 학습에서 최적의 $O(\log T)$ 손실을 달성할 수 있는가?
  • RQ2고차원 설정에서 비독립적이고 희소한 샘플링 조건 하에서도 정확한 매개변수 추정을 어떻게 달성할 수 있는가?
  • RQ3제안된 2단계 가중 라소 절차가 오라클 추정량과 고확률로 일치하는 MCP 추정량을 도출하는가?
  • RQ4G-MCP-Bandit 알고리즘이 데이터 희소성 또는 큰 의사결정 집합 상황에서 기준 대비 어떻게 성능을 내는가?
  • RQ5제안된 절차 하에서 추정량의 수렴 속도는 무엇이며, 이는 최적 속도에 도달하는가?

주요 결과

  • G-MCP-Bandit 알고리즘은 시간 영역 $T$에 대해 점점 최적의 누적 손실 $O(\log T)$를 달성한다.
  • 공변수 차원 $d$에 대해 날카운 손실 경계 $O(\log d)$를 확보하여 고차원 특징에 대한 확장성과 우수한 성능를 입증한다.
  • 2단계 가중 라소 절차는 비독립적 샘플링 조건 하에서 MCP 추정량이 오라클 추정량과 고확률로 일치함을 보장한다.
  • 추정 오차에 대한 이론적 경계를 통해 추정량이 진짜 매개변수에 최적 속도로 수렴함을 검증한다.
  • 실험 결과 G-MCP-Bandit는 특히 데이터 희소성과 큰 의사결정 집합 조건에서 기준 알고리즘을 능가하는 성능를 보인다.
  • 이론적 분석을 통해 기울기 조건 $\|\nabla_{\mathcal{S}^c}\mathcal{L}(\bm{\beta}^{oracle})\|_\infty \leq \left(1 - \frac{96ns}{|\mathcal{A}|\kappa a}\right)\lambda$ 가 고확률로 성립함을 확인하여 모형 선택 일致성(Consistency)을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.