Skip to main content
QUICK REVIEW

[논문 리뷰] Repeated Bilateral Trade Against a Smoothed Adversary

Nicolò Cesa‐Bianchi, Tommaso Cesari|arXiv (Cornell University)|2023. 02. 21.
Game Theory and ApplicationsDecision Sciences인용 수 3
한 줄 요약

이 논문은 판매자와 구매자의 평가가 적응적으로 선택되는 σ-스무쓰한 적대자에 대비한 반복적 이중 거래를 연구한다. 서로 다른 가격을 설정할 수 있을 때 부분 피드백 하에서 T^{3/4}의 정규화를 달성하는 새로운 학습 알고리즘을 제안하며, 놀라운 하한을 통해 이 속도가 최적임을 증명한다. 이는 부분 피드백 설정에서 기존의 √T 및 T^{2/3} 영역을 초월한다.

ABSTRACT

We study repeated bilateral trade where an adaptive $σ$-smooth adversary generates the valuations of sellers and buyers. We provide a complete characterization of the regret regimes for fixed-price mechanisms under different feedback models in the two cases where the learner can post either the same or different prices to buyers and sellers. We begin by showing that the minimax regret after $T$ rounds is of order $\sqrt{T}$ in the full-feedback scenario. Under partial feedback, any algorithm that has to post the same price to buyers and sellers suffers worst-case linear regret. However, when the learner can post two different prices at each round, we design an algorithm enjoying regret of order $T^{3/4}$ ignoring log factors. We prove that this rate is optimal by presenting a surprising $T^{3/4}$ lower bound, which is the main technical contribution of the paper.

연구 동기 및 목표

  • σ-스무쓰한 적대자 하에서 반복적 이중 거래의 온라인 학습을 연구하며, 이는 i.i.d. 및 최악의 경우 설정을 일반화한다.
  • 다양한 피드백 모델 하에서 고정 가격 메커니즘의 최소 최대 정규화를 규명한다.
  • 학습자가 부분 피드백 하에서 구매자와 판매자에게 다른 가격을 설정할 수 있을 때, 비선형 정규화가 달성 가능한지 결정한다.
  • 이 설정에서 T^{3/4} 정규화 속도의 최적성은 입증한다.

제안 방법

  • 논문은 판매자와 구매자의 평가의 연합 분포가 σ-스무쓰한 분포를 따르는 스무쓰한 적대자 모델을 도입하여 시간에 따른 제한된 적대적 변동을 보장한다.
  • Exp3 알고리즘의 변형인 Blind-Exp3를 설계하며, 이는 격자 기반 탐색 전략과 중요도 가중 보상을 사용하여 거래 수익을 추정한다.
  • 알고리즘은 이산화된 가격 격자 위에서 가중치를 유지하고, 추정된 수익 기반으로 지수 가중치 업데이트를 수행하며, 탐색은 파라미터 γ로 제어된다.
  • 핵심 기술적 구성 요소는 폭발 방지를 위한 유한한 보상 추정기 ˆrt(i)로, 이는 이용 및 탐색을 통합하여 추정된 수익의 집중성을 보장한다.
  • 파rameter 제약 조건 (2ηK/γ ≤ 1) 하에서 로그 및 지수 부등식을 활용하여 정규화 한계를 유도한다.
  • 정보 이론적 추론을 사용하여 새로운 T^{3/4} 하한을 증명하며, 상한의 날카로움을 입증한다.

실험 결과

연구 질문

  • RQ1학습자가 스무쓰한 적대자와 부분 피드백만을 받을 때, 반복적 이중 거래에서 비선형 정규화를 달성할 수 있는가?
  • RQ2학습자가 부분 피드백 하에서 구매자와 판매자에게 다른 가격을 설정할 수 있을 때, 최적의 정규화 속도는 무엇인가?
  • RQ3T^{3/4} 정규화 속도는 날카로운가, 아니면 스무쓰한 적대자 모델 하에서 더 향상시킬 수 있는가?
  • RQ4이 설정에서 최소 최대 정규화는 기존의 부분 피드백 모델(예: 부분 모니터링 또는 피드백 그래프)과 비교해 어떻게 다른가?

주요 결과

  • 완전한 피드백 하에서 고정 가격 메커니즘의 최소 최대 정규화는 Θ(√T)이며, 표준 온라인 학습 결과와 일치한다.
  • 구매자와 판매자에게 동일한 가격을 설정해야 할 경우, 부분 피드백 하에서 어떤 알고리즘도 최악의 경우 선형 정규화를 겪는다.
  • 구매자와 판매자에게 다른 가격을 설정할 수 있을 경우, 제안된 Blind-Exp3 알고리즘이 로그 인자 무시 기준으로 T^{3/4} 수준의 정규화를 달성한다.
  • 논문은 T^{3/4} 하한을 입증하여 이 속도가 최적임을 증명하며, 향상시킬 수 없음을 보여준다.
  • 결과는 이전의 부분 피드백 모델에서 관찰된 √T 대비 T^{2/3}의 이원론을 초월하는 새로운 정규화 영역을 드러낸다.
  • 분석 결과 스무쓰한 적대자 모델은 i.i.d. 가정을 초월하여 부분 피드백 하에서도 비선형 정규화를 가능하게 하며, 학습 가능성의 범위를 확장함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.