Skip to main content
QUICK REVIEW

[논문 리뷰] Dominate or Delete: Decentralized Competing Bandits in Serial Dictatorship

Abishek Sankararaman, Soumya Basu|arXiv (Cornell University)|2020. 06. 26.
Advanced Bandit Algorithms Research참고 문헌 31인용 수 7
한 줄 요약

이 논문은 중앙 조율 없이 알려지지 않은 암 보상 값을 학습하는 에이전트들이 순서 기반 독재 설정에서 경쟁하는 밴딧 문제를 위한 탈중앙화된 알고리즘인 UCB-D3를 제안한다. 반복적으로 열 劣한 암을 제거하고 탈중앙화된 브로드캐스트를 사용한 UCB 기반 탐색을 통해 UCB-D3는 보상 갭이나 시간 범위에 대한 사전 지식 없이도 순서 최적의 누적 손실을 달성한다.

ABSTRACT

Online learning in a two-sided matching market, with demand side agents continuously competing to be matched with supply side (arms), abstracts the complex interactions under partial information on matching platforms (e.g. UpWork, TaskRabbit). We study the decentralized serial dictatorship setting, a two-sided matching market where the demand side agents have unknown and heterogeneous valuation over the supply side (arms), while the arms have known uniform preference over the demand side (agents). We design the first decentralized algorithm -- UCB with Decentralized Dominant-arm Deletion (UCB-D3), for the agents, that does not require any knowledge of reward gaps or time horizon. UCB-D3 works in phases, where in each phase, agents delete \emph{dominated arms} -- the arms preferred by higher ranked agents, and play only from the non-dominated arms according to the UCB. At the end of the phase, agents broadcast in a decentralized fashion, their estimated preferred arms through {\em pure exploitation}. We prove both, a new regret lower bound for the decentralized serial dictatorship model, and that UCB-D3 is order optimal.

연구 동기 및 목표

  • 중앙 조율자가 없는 두 측 마켓에서 에이전트들이 제한된 수요 측 자원(암)을 놓고 경쟁하는 탈중앙화된 온라인 매칭 문제에 도전한다.
  • 진술의 진실성과 전역 정보가 필요로 하는 중심 집중 모델의 한계를 극복한다. 이는 개인정보 보호, 투명성 및 확장성 문제로 인해 실용적이지 않다.
  • 지역 관측만을 사용하는 탈중앙화된 알고리즘을 설계하여 부분 정보 하에서 진실성 있고 안정적인 매칭을 가능하게 한다.
  • 보상 갭이나 시간 범위에 대한 사전 지식 없이도 시간 범위 내에서 비선형 이하의 누적 손실(이론적으로 로그 수준)을 달성한다.
  • 순서 기반 독재 모델에서 안정성과 유일한 안정 매칭으로의 수렴에 대한 이론적 보장을 수립한다.

제안 방법

  • 각 단계에서 상위 신뢰도 기반(Upper Confidence Bound, UCB)을 사용해 암 선택을 수행하는 탐색과 이용을 반복하는 단계 기반 알고리즘인 UCB-D3를 제안한다.
  • 새로운 암 제거 메커니즘 도입: 각 단계에서 높은 순위의 에이전트가 선호하는 '열 劣한 암'을 식별하고 제거함으로써 충돌 위험을 줄인다.
  • 각 단계 종료 시에 추정된 선호 암을 탈중앙화된 방식으로 브로드캐스트하여 중앙 조율 없이도 에이전트가 지식을 갱신할 수 있도록 한다.
  • 에이전트 간의 균일한 순위 유지로, 순서 기반 독재 메커니즘에 따라 높은 순위의 에이전트가 매칭 우선권을 확보한다.
  • 에이전트들이 시간이 지남에 따라 암 선호도를 정교화하는 단계 기반 구조를 적용하여 안정된 매칭으로 수렴하도록 한다.
  • 새로운 누적 손실 하한선을 증명하고 UCB-D3가 이 하한선을 로그 인자 수준까지 충족함으로써 알고리즘이 순서 최적임을 보장한다.

실험 결과

연구 질문

  • RQ1중앙 조율자가 없는 두 측 매칭 밴딧 설정에서 탈중앙화된 알고리즘이 보상 갭이나 시간 범위에 대한 사전 지식 없이도 비선형 누적 손실을 달성할 수 있는가?
  • RQ2탈중앙화된 순서 기반 독재 모델에서 누적 손실의 기본 한계(하한선)는 무엇인가?
  • RQ3보상 갭이나 시간 범위에 대한 지식 없이도 에이전트들이 충돌을 피하고 안정된 매칭으로 수렴할 수 있는 방법은 무엇인가?
  • RQ4열 劣한 암 제거가 탈중앙화된 경쟁 밴딧에서 누적 손실 감소와 수렴성 향상에 미치는 역할은 무엇인가?
  • RQ5제안된 알고리즘인 UCB-D3는 탈중앙화된 순서 기반 독재 모델에서 순서 최적의 누적 손실을 달성하는가?

주요 결과

  • UCB-D3는 탈중앙화된 순서 기반 독재 모델에서 순서 최적의 누적 손실을 달성하며, 유도된 누적 손실 하한선을 로그 인자 수준까지 충족한다.
  • 열 劣한 암을 전략적으로 제거함으로써 충돌로 인한 누적 손실을 줄이는 데 기여함으로써, 탈중앙화된 ETC 기준보다 성능이 뛰어나다.
  • 실험 결과에 따르면 에이전트들이 유한한 수의 단계 이후 안정된 매칭 파트너 암을 지속적으로 추천하게 되며, 낮은 순위의 에이전트는 평형에 도달하는 데 더 오랜 시간이 소요된다.
  • 히트맵 시각화 결과 시스템이 안정된 평형 상태에 도달함을 확인하였으며, 이는 무작위적이지만 유한한 시간 이후에 에이전트들이 안정된 매칭 암을 일관되게 추천함을 의미한다.
  • OSB(One-Step Best) 사례에서는 UCB-D3가 ETC보다 충돌로 인한 누적 손실을 크게 줄였으며, 탈중앙화 환경에서 피할 수 없는 충돌로 인해 중심 집중 UCB에 비해 略적으로 뒤지더라도 성능이 뛰어나다.
  • 비-OSB 및 OSB 사례를 포함한 다양한 설정에서 알고리즘이 강건하게 작동하며, 30회의 시뮬레이션 시행 및 95% 신뢰구간에서 일관된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.