Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-task Representation Learning with Stochastic Linear Bandits

Leonardo Cella, Karim Lounici|arXiv (Cornell University)|2022. 02. 21.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 공유된 랭크가 낮은 표현을 가지는 다중 작업 스토하스틱 선형 컨텍스트 밴딧 문제에 대해, 랭크나 가역성 조건이 없는 상황에서도 은닉된 저랭크 공유 표현을 암묵적으로 학습할 수 있는 트레이스 노름 정규화된 게으른 정책을 제안한다. 이 방법은 $ T\tilde{O}(\text{poly}(r)\text{poly}(d)\text{poly}(N)) $ 의 리그레트 한계를 달성하며, 로그 인자 외에는 최대우도 최적임을 입증하고 있으며, 독립적 작업 학습 및 이전의 MLingreedy와 같은 방법보다 뚜렷한 개선을 보인다. 특히 $ T \geq d $ 인 경우에 유의미하다.

ABSTRACT

We study the problem of transfer-learning in the setting of stochastic linear bandit tasks. We consider that a low dimensional linear representation is shared across the tasks, and study the benefit of learning this representation in the multi-task learning setting. Following recent results to design stochastic bandit policies, we propose an efficient greedy policy based on trace norm regularization. It implicitly learns a low dimensional representation by encouraging the matrix formed by the task regression vectors to be of low rank. Unlike previous work in the literature, our policy does not need to know the rank of the underlying matrix. We derive an upper bound on the multi-task regret of our policy, which is, up to logarithmic factors, of order $\sqrt{NdT(T+d)r}$, where $T$ is the number of tasks, $r$ the rank, $d$ the number of variables and $N$ the number of rounds per task. We show the benefit of our strategy compared to the baseline $Td\sqrt{N}$ obtained by solving each task independently. We also provide a lower bound to the multi-task regret. Finally, we corroborate our theoretical findings with preliminary experiments on synthetic data.

연구 동기 및 목표

  • 다수의 작업 간에 공유되는 저차원 표현을 가진 스토하스틱 선형 컨텍스트 밴딧에서의 전이 학습 문제를 해결하기 위해.
  • 공유 표현 행렬의 진정한 랭크를 사전에 알 필요 없이도 정책을 개발하기 위해.
  • 비가역적인 암 코변동행렬에 대해 강건하며, 작은 시간 수평선에서도 효과적인 방법을 설계하기 위해.
  • 사전에 진정한 표현을 알고 있는 오라클 정책과 유사한 리그레트 한계를 달성하기 위해.
  • 특히 고차원 또는 짧은 수평선 설정에서 기존의 기준선인 독립적 작업 학습 및 MLingreedy를 능가하기 위해.

제안 방법

  • 이 방법은 작업별 회귀 벡터의 행렬에 저랭크 구조를 장려하기 위해 트레이스 노름 정규화를 기반으로 한 게으른 정책을 사용한다.
  • 제한된 강력한 볼록성 조건 하에서 오라클 부등식을 유도하기 위해 새로운 마팅게일 농도 분석 기법을 도입한다.
  • 핵심 노름을 통한 정규화를 통해 저랭크 해를 장려하는 정규화된 경험 리스크 최소화를 통해 공유 표현을 추정한다.
  • 사전에 랭크를 지정할 필요 없이, 기저 표현을 적응적으로 학습한다.
  • 최소한의 가정 하에서 작동한다: 암에 대한 유계성 조건 없음, 암 공분산 행렬의 가역성 조건 없음.
  • 계산적으로 효율적이며, 각 단계에서 복잡한 행렬 분해 문제를 해결할 필요가 없다.

실험 결과

연구 질문

  • RQ1진정한 저랭크 표현을 알고 있는 오라클과 유사한 리그레트 성능을 달성할 수 있는 다중 작업 밴딧 정책는, 랭크에 대한 사전 지식 없이도 가능할 수 있는가?
  • RQ2트레이스 노름 정규화는 공유 표현을 가진 다중 작업 선형 밴딧에서 학습 효율성을 어떻게 향상시키는가?
  • RQ3작업 수 $ T $, 차원 $ d $, 시간 수평선 $ N $ 이 연합 학습 정책의 리그레트에 어떤 영향을 미치는가?
  • RQ4랭크가 잘못 지정되었거나 암 공분산이 특이행렬인 경우, 제안된 정책은 MLingreedy와 비교해 어떻게 성능을 내는가?
  • RQ5암 공분산이 가역적이거나 암 특징이 유계가 아니어도, 최대우도 최적 리그레트를 달성할 수 있는가?

주요 결과

  • 제안된 정책는 $ T\sqrt{rN} + \sqrt{rNTd} $ 의 리그레트 한계를 로그 인자 외에 달성하며, 이는 최대우도 최적이다.
  • 독립적 작업 학습의 경우 리그레트가 순서적으로 $ T\sqrt{dN} $ 으로 훨씬 떨어지므로, 이는 상당한 개선이다.
  • 모든 설정에서 MLingreedy보다 성능이 뛰어나며, 특히 $ d $ 가 크거나 $ N $ 이 작은 경우 두드러진다.
  • 잘못된 랭크 추정이 이루어져도 MLingreedy는 제안된 방법보다 열 劣하다. 이는 랭크 오지정에 대해 강건한 성능을 보인다.
  • 트레이스 노름 밴딧은 ITL 및 MLingreedy를 항상 능가하며, $ r \approx d $ 인 경우 계속되는 정규화의 이점 덕분에 오라클 정책을 초월하는 성능을 보인다.
  • 수치 실험을 통해, 이 방법은 차원 수와 작업 수에 대해 강건하며, 모든 테스트 설정에서 기준선 대비 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.