Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Combinatorial Experimental Design: Pareto Optimality for Decision-Making and Inference

Hongrui Xie, Junyu Cao|arXiv (Cornell University)|2026. 02. 27.
Advanced Bandit Algorithms Research인용 수 0
한 줄 요약

이 논문은 적응형 조합 밴디드(CMAB)에서 regret와 추정 간의 파레토 최적 학습을 도입하고, MixCombKL (full-bandit) 및 MixCombUCB (semi-bandit)을 제안하며, 두 피드백 체계에서 유한 시간 regret 및 gap-estimation 보장을 입증한다.

ABSTRACT

In this paper, we provide the first investigation into adaptive combinatorial experimental design, focusing on the trade-off between regret minimization and statistical power in combinatorial multi-armed bandits (CMAB). While minimizing regret requires repeated exploitation of high-reward arms, accurate inference on reward gaps requires sufficient exploration of suboptimal actions. We formalize this trade-off through the concept of Pareto optimality and establish equivalent conditions for Pareto-efficient learning in CMAB. We consider two relevant cases under different information structures, i.e., full-bandit feedback and semi-bandit feedback, and propose two algorithms MixCombKL and MixCombUCB respectively for these two cases. We provide theoretical guarantees showing that both algorithms are Pareto optimal, achieving finite-time guarantees on both regret and estimation error of arm gaps. Our results further reveal that richer feedback significantly tightens the attainable Pareto frontier, with the primary gains arising from improved estimation accuracy under our proposed methods. Taken together, these findings establish a principled framework for adaptive combinatorial experimentation in multi-objective decision-making.

연구 동기 및 목표

  • CMAB에서 regret 대비 추정 간의 트레이드오프 연구를 동기화한다.
  • 파레토 최적성을 regret과 보상 갭 추정 간의 균형 프레임워크로 형식화한다.
  • 두 피드백 모델(fulл-bandit 및 semi-bandit)에 대해 파레토 최적 알고리즘을 개발한다.
  • 각 피드백 체계 하에서 regret과 추정 오차에 대한 유한시간 보장을 제공한다.

제안 방법

  • full-bandit 및 semi-bandit 피드백 하에서 기본 팔과 슈퍼 팔로 CMAB를 모델링한다.
  • 파레토 최적성 및 파레토 프런티어를 정의하여 regret과 추정 오차 사이의 트레이드오프를 포착한다.
  • KL-다이버전스를 가이드로 하는 온라인 확률적 미러 하강법을 단순집합 임베딩에 적용한 MixCombKL을 full-bandit 피드백에 대해 개발한다.
  • 초기화 단계와 최적화 오라클을 포함하는 UCB 기반 접근법을 사용하는 MixCombUCB를 semi-bandit 피드백에 대해 개발한다.
  • 슈퍼 팔 갭과 기본 팔 갭의 추정 오차에 대한 유한 샘플 한계 및 두 알고리즘의 regret 한계를 제공한다.
  • 파레토 최적성의 필요충분조건을 확립하고 피드백의 풍부성과 프런티어의 촘촘함의 관계를 설명한다.

실험 결과

연구 질문

  • RQ1CMAB에서 regret 최소화와 보상 갭 추정의 통계적 능력 간의 트레이드오프는 무엇인가?
  • RQ2다른 피드백 체계에서 CMAB에서 파레토 최적 정책을 특징짓고 달성할 수 있는가?
  • RQ3full-bandit 피드백과 semi-bandit 피드백이 파레토 프런티어 및 학습 보장에 어떤 영향을 미치는가?
  • RQ4MixCombKL 및 MixCombUCB의 유한시간 추정 및 regret 보장은 무엇인가?
  • RQ5CMAB 설정에서 파레토 최적성의 필요충분조건은 무엇인가?

주요 결과

  • MixCombKL은 full-bandit 피드백 하에서 파레토 최적 트레이드오프를 달성하며 유한시간 갭 추정 보장 및 regret 한계를 제시한다.
  • MixCombUCB은 semi-bandit 피드백 하에서 파레토 최적 트레이드오프를 달성하며 유한시간 갭 추정 보장 및 regret 한계를 제시한다.
  • semi-bandit 피드백은 추정 정확도의 향상으로 인해 full-bandit 피드백에 비해 더 선명한 파레토 프런티어를 제공하는 반면, 제안된 알고리즘 하에서 regret은 유사하게 확장된다.
  • 논문은 슈퍼 팔 갭 추정 및 기본 팔 갭 추정에 대한 명시적인 유한 샘플 한계와 함께 regret 한계를 제공한다.
  • 파레토 최적성은 추정 오차와 regret 간의 관계를 연결하는 조건으로 특징지어지며, 두 피드백 모델에 적용된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.