[논문 리뷰] Multi-objective Contextual Multi-armed Bandit Problem with a Dominant Objective.
이 논문은 주요 목적이 다른 목표를 지배하는 다목적 밴디트 프레임워크인 도메인팅 오브젝티브를 가진 컨텍스트 추천 다중 암드 밴디트(CMAB-DO)를 소개한다. 제안된 MOC-MAB 알고리즘은 주요 목표를 최적화하는 암들 중에서 비주요 목표를 최대화함으로써 2차원 및 파레토 리그레트가 하위선형이 되도록 하며, 합성 및 실세계 데이터셋에서의 실험적 검증을 통해 검증된다.
In this paper, we propose a new multi-objective contextual multi-armed bandit problem with two objectives, where one of the objectives dominates the other objective. Unlike single-objective bandit problems in which the learner obtains a random scalar reward for each arm it selects, in the proposed problem, the learner obtains a random reward vector, where each component of the reward vector corresponds to one of the objectives and the distribution of the reward depends on the context that is provided to the learner at the beginning of each round. We call this problem contextual multi-armed bandit with a dominant objective (CMAB-DO). In CMAB-DO, the goal of the learner is to maximize its total reward in the non-dominant objective while ensuring that it maximizes its total reward in the dominant objective. In this case, the optimal arm given a context is the one that maximizes the expected reward in the non-dominant objective among all arms that maximize the expected reward in the dominant objective. First, we show that the optimal arm lies in the Pareto front. Then, we propose the multi-objective contextual multi-armed bandit algorithm (MOC-MAB), and define two performance measures: the 2-dimensional (2D) regret and the Pareto regret. We show that both the 2D regret and the Pareto regret of MOC-MAB are sublinear in the number of rounds. We also compare the performance of the proposed algorithm with other state-of-the-art methods in synthetic and real-world datasets. The proposed model and the algorithm have a wide range of real-world applications that involve multiple and possibly conflicting objectives ranging from wireless communication to medical diagnosis and recommender systems.
연구 동기 및 목표
- 주요 목적이 다른 목표를 지배하는 상황에서 컨텍스트 밴디트의 다목적 의사결정 문제를 다루는 것. 이는 계층적 우선순위를 반영하는 실세계 시나리오를 반영한다.
- 학습자가 맥락에 기반해 암들을 선택하고, 두 성분으로 구성된 벡터 보상을 받는 새로운 문제 설정인 CMAB-DO를 정의하는 것: 하나는 주요 목표, 다른 하나는 비주요 목표.
- 주어진 맥락 하에서 주요 목표의 예상 보상이 최대가 되는 모든 암들 중에서 비주요 목표의 예상 보상을 최대화하는 암을 최적의 암으로 정의하는 것.
- 주요 목표에서의 지배를 보장하면서도 보조 목표를 최적화하는 데 중심이 되는 탐색과 이용의 균형을 이루는 알고리즘 설계.
- 두 가지 새로운 리그레트 측정법인 2D 리그레트와 파레토 리그레트를 사용하여 성능을 평가하는 것. 이 두 가지 모두 라운드 수에 대해 하위선형임을 증명함.
제안 방법
- CMAB-DO 문제에서는 각 성분이 두 목표 중 하나에 해당하는 보상 벡터를 모델링하며, 주요 목표의 예상 보상이 암의 가능 집합을 결정한다.
- 최적의 암은 주요 목표에서 예상 보상이 최대가 되는 모든 암들 중에서 비주요 목표의 예상 보상을 최대화하는 암으로 정의된다.
- 제안된 MOC-MAB 알고리즘은 맥락 기반 암 선택을 수행하며, 탐색을 안내하기 위해 두 목표에 대한 신뢰 구간을 유지한다.
- 알고리즘은 두 목표에 대한 상한 신뢰 구간을 계산하고, 주요 목표에서 최적인 암들 중에서 비주요 목표를 최대화하는 암을 선택한다.
- 두 가지 성능 측정법이 도입된다: 2D 리그레트는 두 목표에서의 누적 손실을 측정하고, 파레토 리그레트는 파레토 최적 경계에 대한 성능 평가를 수행한다.
- 이론적 분석을 통해 MOC-MAB의 2D 리그레트와 파레토 리그레트가 모두 라운드 수에 대해 하위선형임을 증명하며, 최적 성능로의 수렴을 시사한다.
실험 결과
연구 질문
- RQ1주요 목적이 우선순위 측면에서 다른 목표를 지배할 때, 다목적 컨텍스트 밴디트 문제를 어떻게 수학적으로 정의할 수 있는가?
- RQ2이러한 문제에서 최적의 암의 구조는 어떻게 되며, 파레토 최적 경계와의 관계는 어떠한가?
- RQ3주요 목표를 최대화하면서도 비주요 목표를 최적화하는 알고리즘을 설계할 수 있는가?
- RQ4이러한 다목적 밴디트 설정을 평가하는 데 적합한 성능 측정법은 무엇인가?
- RQ5제안된 리그레트 측정법(2D 리그레트 및 파레토 리그레트)은 시간이 지남에 따라 여전히 하위선형을 유지하는가? 이는 효과적인 학습을 의미하는가?
주요 결과
- CMAB-DO 문제에서 최적의 암은 주요 목표에서 최적인 암들 중에서 비주요 목표를 최대화하므로, 파레토 최적 경계 상에 위치한다.
- MOC-MAB 알고리즘은 하위선형 2D 리그레트를 달성하여, 두 목표에서의 누적 손실이 라운드 수에 대해 선형보다 느리게 증가함을 나타낸다.
- MOC-MAB 알고리즘은 하위선형 파레토 리그레트를 달성하여, 알고리즘의 성능이 시간이 지남에 따라 파레토 최적 경계로 수렴함을 보여준다.
- 합성 및 실세계 데이터셋에서의 실험적 평가를 통해 MOC-MAB가 주요 목표와 비주요 목표를 균형 있게 다루는 데 있어 최신 기술보다 뛰어난 성능을 보였다.
- 이론적 분석을 통해 2D 리그레트와 파레토 리그레트 모두 하위선형임을 확인하였으며, 이는 지배 제약 조건 하에서 다목적 의사결정 문제에 대한 알고리즘의 장기적 효과성을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.