Skip to main content
QUICK REVIEW

[논문 리뷰] Sequential Experimental Design for Transductive Linear Bandits

Tanner Fiez, Lalit Jain|arXiv (Cornell University)|2019. 06. 20.
Advanced Bandit Algorithms Research참고 문헌 28인용 수 10
한 줄 요약

이 논문은 측정 벡터 집합 𝒳와 항목 벡터 집합 𝒁가 다를 수 있는 전이성 선형 밴딧 문제를 소개한다. 이 문제의 목적은 잡음이 있는 측정값을 통해 𝒵 내에서 최적의 항목을 식별하는 것이다. 저자들은 RAGE라는 적응형 순차적 실험 설계 알고리즘을 제안하며, 정보 이론적 하한선에 거의 도달하도록 유용한 측정 벡터에 집중함으로써, 높은 확률 보장 하에 최적의 암호 식별을 위한 샘플 복잡도를 거의 최적화한다.

ABSTRACT

In this paper we introduce the transductive linear bandit problem: given a set of measurement vectors $\mathcal{X}\subset \mathbb{R}^d$, a set of items $\mathcal{Z}\subset \mathbb{R}^d$, a fixed confidence $δ$, and an unknown vector $θ^{\ast}\in \mathbb{R}^d$, the goal is to infer $ ext{argmax}_{z\in \mathcal{Z}} z^ opθ^\ast$ with probability $1-δ$ by making as few sequentially chosen noisy measurements of the form $x^ opθ^{\ast}$ as possible. When $\mathcal{X}=\mathcal{Z}$, this setting generalizes linear bandits, and when $\mathcal{X}$ is the standard basis vectors and $\mathcal{Z}\subset \{0,1\}^d$, combinatorial bandits. Such a transductive setting naturally arises when the set of measurement vectors is limited due to factors such as availability or cost. As an example, in drug discovery the compounds and dosages $\mathcal{X}$ a practitioner may be willing to evaluate in the lab in vitro due to cost or safety reasons may differ vastly from those compounds and dosages $\mathcal{Z}$ that can be safely administered to patients in vivo. Alternatively, in recommender systems for books, the set of books $\mathcal{X}$ a user is queried about may be restricted to well known best-sellers even though the goal might be to recommend more esoteric titles $\mathcal{Z}$. In this paper, we provide instance-dependent lower bounds for the transductive setting, an algorithm that matches these up to logarithmic factors, and an evaluation. In particular, we provide the first non-asymptotic algorithm for linear bandits that nearly achieves the information theoretic lower bound.

연구 동기 및 목표

  • 측정 벡터 𝒳와 항목 벡터 𝒁가 다를 수 있는 전이성 선형 밴딧 문제를 수식화하며, 높은 확률로 argmax_{z∈𝒁} zᵀθ* 를 식별하는 것이 목적이다.
  • 기존 선형 밴딧 및 조합적 밴딧의 하한선을 일반화한 이InstanceOf에 의존하는 하한선을 유도한다.
  • 정보 이론적 하한선에 거의 도달하는 샘플 복잡도를 달성하는 적응형 순차적 실험 설계 알고리즘을 개발한다.
  • 다양한 설정에서 알고리즘을 실증적으로 평가하며, 고차원 및 조합적 구성에서 비적응형 및 정적 할당 전략에 비해 뛰어난 성능을 보인다.

제안 방법

  • 알고리즘은 현재 θ*에 대한 불확실성에 기반해 𝒳 내 측정 벡터 x ∈ 𝒳를 적응적으로 선택하는 순차적 설계 전략을 사용한다. 이는 최적의 z* ∈ 𝒁를 식별하는 데 불확실성을 줄이는 방향에 집중한다.
  • 후보 암들 간의 차이에 대해 G-최적 설계 기준을 적용함으로써, 최적의 암을 구별하는 데 정보 수확을 최적화하는 문제로 변환한다.
  • 알고리즘은 θ*에 대한 신뢰 타원체를 유지하며, 불확실성 집합의 부피를 최소화하는 측정값을 선택한다. 특히, 최적의 암 선택에 대한 불확실성을 가장 줄이는 방향 (x_i - x_j) 을 타깃으로 삼는다.
  • RAGE는 관측된 보상과 불확실성에 기반해 샘플링 분포를 동적으로 업데이트하며, 각 측정값이 최적의 암에 대한 정보 수확을 최대화하도록 선택한다.
  • 알고리즘은 비점근적이고 이InstanceOf에 의존하는 설계이며, 이론적 보장이 이InstanceOf에 의존하는 하한선에 로그 인자만을 제외하고 일치한다.
  • 활성 암 집합이 𝒁 내 항목 간의 차이로 정의되는 전이성 설정에서 실험 설계 문제의 새로운 수식을 활용함으로써, 효율적이고 정확한 샘플링을 가능하게 한다.

실험 결과

연구 질문

  • RQ1전이성 선형 밴딧 설정에서 최적의 암 식별을 위한 이InstanceOf에 의존하는 샘플 복잡도 하한선은 무엇인가?
  • RQ2𝒳 ≠ 𝒁 인 경우, 특히 𝒳 가 비용이나 가용성 제약이 있을 때, 순차적 실험 설계는 어떻게 최소한의 측정값으로 조정될 수 있는가?
  • RQ3최적의 암이 직접 측정되지 않는 경우에도, 적응형 알고리즘이 정보 이론적 하한선에 거의 도달할 수 있는가?
  • RQ4다양한 구성에서 𝒳에 대한 적응형 샘플링은 비적응형 또는 정적 할당 전략에 비해 샘플 효율성이 어떻게 향상되는가?

주요 결과

  • RAGE는 오직 로그 인자만을 제외하고 이InstanceOf에 의존하는 하한선에 거의 도달하는 샘플 복잡도를 달성하며, 정보 이론적 한계에 거의 도달하는 첫 번째 비점근적 선형 밴딧 알고리즘이다.
  • 많은 수의 거의 동일한 암이 있는 실험에서 RAGE는 각 암을 균일하게 샘플링하는 LinGapE에 비해 뚜렷이 뛰어난 성능을 보이며, 암의 수가 증가할수록 성능 저하가 심각하게 나타나는 것을 방지한다.
  • ℝ⁵ 내 구형 분포의 암들에 대해 RAGE는 가까운 암들 간의 정보적 차이에 집중함으로써 ALBA를 능가한다. 반면 ALBA는 활성 벡터에 대한 G-최적 설계를 사용하여 비효율적인 샘플링을 초래한다.
  • d=100 인 전이성 예시에서 RAGE는 정적 𝒳𝒀-할당 전략에 비해 뚜렷이 뛰어난 성능을 보이며, 고정된 샘플링 전략에 비해 적응형 설계의 가치를 입증한다.
  • 알고리즘은 𝒳가 𝒁의 부분집합인 경우, 𝒳에 𝒁에 포함되지 않는 안전하지 않은 화합물이 포함된 경우, 그리고 𝒁 ∩ 𝒳 = ∅ 인 경우에도 뛰어난 성능을 유지하며, 이는 그 일반성의 증거이다.
  • 결과는 θ*에 대한 불확실성과 암 간의 방향 정보에 기반한 적응형 샘플링이, 특히 고차원 또는 조합적 설정에서 샘플 효율성 향상에 상당한 기여를 한다는 것을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.