Skip to main content
QUICK REVIEW

[논문 리뷰] Decentralized, Communication- and Coordination-free Learning in Structured Matching Markets

Chinmay Maheshwari, Eric Mazumdar|arXiv (Cornell University)|2022. 06. 06.
Game Theory and Voting Systems인용 수 4
한 줄 요약

이 논문은 구조적 이원 매칭 시장에서 에이전트들이 상호작용을 통해 다른 이들의 전략을 알지 못한 채 선호도를 학습하는 분산형, 통신 및 협업 없음 학습 알고리즘을 제안한다. α-가역 선호도 구조 하에서 시간 영역에 대해 로그 성장률의 손실을 달성하며, 안정된 매칭 설정에서 경쟁이 성능을 심각하게 떨어뜨리지 않음을 입증한다.

ABSTRACT

We study the problem of online learning in competitive settings in the context of two-sided matching markets. In particular, one side of the market, the agents, must learn about their preferences over the other side, the firms, through repeated interaction while competing with other agents for successful matches. We propose a class of decentralized, communication- and coordination-free algorithms that agents can use to reach to their stable match in structured matching markets. In contrast to prior works, the proposed algorithms make decisions based solely on an agent's own history of play and requires no foreknowledge of the firms' preferences. Our algorithms are constructed by splitting up the statistical problem of learning one's preferences, from noisy observations, from the problem of competing for firms. We show that under realistic structural assumptions on the underlying preferences of the agents and firms, the proposed algorithms incur a regret which grows at most logarithmically in the time horizon. Our results show that, in the case of matching markets, competition need not drastically affect the performance of decentralized, communication and coordination free online learning algorithms.

연구 동기 및 목표

  • 에이전트들이 선호도에 대한 사전 지식이 없는 경쟁적인 이원 매칭 시장에서의 온라인 학습 문제를 해결한다.
  • 통신, 협업, 전역 시장 상태 관찰 없이 작동하는 알고리즘을 설계하여 확장성과 프라이버시를 보장한다.
  • 자기 이기심을 가진 다른 에이전트들의 경쟁에도 불구하고 안정된 매칭 수렴과 최소한의 손실을 달성한다.
  • 에이전트와 기업의 선호도에 대한 현실적인 구조적 가정 하에 손실 성장률에 대한 이론적 보장을 수립한다.

제안 방법

  • 학습 문제를 노이즈 있는 매칭 유틸리티로부터의 통계적 학습과 다른 에이전트와의 충돌 처리를 위한 경쟁적 매칭으로 분해한다.
  • 이중 단계 알고리즘을 사용: 첫 번째 단계에서는 개인 선호도 추정을 위한 톰슨 샘플링 또는 UCB 기반 탐색; 두 번째 단계에서는 경험적 유틸리티 추정치에 기반한 안정된 매칭 선택 메커니즘을 구현한다.
  • 유일한 안정된 매칭과 분석 가능한 손실 분석을 보장하기 위해 α-가역 선호도 구조(예: 순차 독재, 교차 금지 조건 등)를 활용한다.
  • 기업 행동을 최면적 유틸리티 최적화자로 모델링하여 요청을 받은 중에서 가장 순위가 높은 에이전트를 수락한다.
  • 집중 불등식과 마팅게일 추론을 사용해 충돌 빈도와 선택 빈도를 분석함으로써 손실을 한정한다.
  • 성공적인 매칭, 기각, 열악한 기업의 제거를 위한 지표를 도입하여 학습 진행 상황과 손실 구성 요소를 추적한다.

실험 결과

연구 질문

  • RQ1통신 및 협업 없이도 선형 정보가 부족한 이원 온라인 매칭 시장에서 분산형 알고리즘이 안정된 매칭 수렴을 달성할 수 있는가?
  • RQ2이러한 환경에서 탐색(선호도 학습)과 경쟁(기각 방지) 사이의 근본적 트레이드오프는 무엇인가?
  • RQ3경쟁은 구조적 매칭 시장에서 분산 학습 알고리즘의 손실에 어떤 영향을 미치는가?
  • RQ4통신 없이도 협업 없이 다른 에이전트의 행동을 전부 관찰하지 않아도 로그 성장률의 손실을 달성할 수 있는가?
  • RQ5선호도에 대한 어떤 구조적 가정 하에 유일한 안정된 매칭이 존재하며, 이러한 가정은 효율적 학습을 어떻게 가능하게 하는가?

주요 결과

  • 제안된 알고리즘은 α-가역 선호도 구조 하에서 시간 영역 T에 대해 최대 로그 성장률로 손실이 발생하며, 구체적으로 O(log T)의 손실 한계를 확보한다.
  • 열악한 기업에 대해서는 손실이 O(1/Δ² log(1/Δ) + log T) 이하로 제한되며, 여기서 Δ는 안정된 매칭과 열악한 기업 간 유틸리티 격차이다.
  • 알고리즘은 분산 운영을 유지한다: 에이전트들은 자신의 거절 기록과 매칭 결과 기록에만 기반해 결정을 내린다.
  • 협업 없고 통신 없이 설계되어 대규모 온라인 시장에서의 확장성과 프라이버시를 보장한다.
  • 실제 플랫폼에서 흔한 순차 독재 및 교차 금지 조건과 같은 현실적인 시장 구조를 지원한다.
  • 노이즈 있는 매칭 피드백 기반으로 유틸리티의 경험적 평균을 갱신하며, 전역적 협업 없이도 탐색과 이용의 균형을 효과적으로 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.