[논문 리뷰] Fairness of Exposure in Stochastic Bandits
이 논문은 확률적 다항 보상 밴딧 및 선형 밴딧 환경에서 노출 할당의 공정성 문제를 해결하기 위해 FairX 밴딧 프레임워크를 제안한다. 이 프레임워크는 각 보상의 공정성에 비례하여 보상이 주어지도록 보장한다. 공정성 재해와 보상 재해 목표를 도입하고, 하위선형 재해 경계를 확보하면서도 공정성 기반의 노출를 보장하는 공정한 UCB 및 톰슨 샘플링 알고리즘을 개발하였다. 이는 합성 및 실세계 데이터셋 모두에서 검증되었다.
Contextual bandit algorithms have become widely used for recommendation in online systems (e.g. marketplaces, music streaming, news), where they now wield substantial influence on which items get exposed to the users. This raises questions of fairness to the items -- and to the sellers, artists, and writers that benefit from this exposure. We argue that the conventional bandit formulation can lead to an undesirable and unfair winner-takes-all allocation of exposure. To remedy this problem, we propose a new bandit objective that guarantees merit-based fairness of exposure to the items while optimizing utility to the users. We formulate fairness regret and reward regret in this setting, and present algorithms for both stochastic multi-armed bandits and stochastic linear bandits. We prove that the algorithms achieve sub-linear fairness regret and reward regret. Beyond the theoretical analysis, we also provide empirical evidence that these algorithms can fairly allocate exposure to different arms effectively.
연구 동기 및 목표
- 기존 밴딧 알고리즘에서 발생하는 승자독점 노출 문제를 해결하기 위해, 높은 보상 보상이 공정하게 선별되는 것을 방지한다.
- 각 보상의 공정성에 비례하여 노출가 이루어지도록 공정성 할당을 정량화하며, 이는 평균 보상의 증가 함수로 정의된 보상의 기준을 기반으로 한다.
- 밴딧 학습에서 이중 목표로 공정성 재해와 보상 재해를 도입하고 분석한다.
- 확률적 다항 보상 및 선형 밴딧에 대해 공정한 UCB 및 톰슨 샘플링 알고리즘을 설계하고 이론적으로 분석한다.
- 제안된 알고리즘이 낮은 보상 재해를 유지하면서도 공정한 노출 할당을 달성하는지 실증적으로 검증한다.
제안 방법
- 보상의 기준을 보상의 평균 보상에 대한 증가 함수로 정의하고, 밴딧 정책 하에서의 선택 확률로 노출를 정의한다.
- 실제 노출가 기준에 비례한 노출에서의 편차로 공정성 재해를 정의하고, 최적의 사용자 유용성에서의 편차로 보상 재해를 정의한다.
- 기준과 노출 불균형을 기반으로 한 공정성 인식의 신뢰구간 조정을 통합한 공정한 UCB 알고리즘을 설계한다.
- 기대 노출에서의 공정성을 유지하도록 조정된 사후 분포에서 샘플링하는 공정한 톰슨 샘플링 알고리즘을 설계한다.
- 선형 모델과 릿지 회귀를 사용한 파rameter 추정을 통해 공정한 UCB 및 TS 프레임워크를 확률적 선형 밴딧 설정으로 확장한다.
- 모든 알고리즘에 대해 그리드 서치를 통해 초모델 하이퍼파ram터를 설정하며, 이는 탐색 가중치, 사전 분산, 정규화 항목을 포함한다.
실험 결과
연구 질문
- RQ1사용자 유용성을 최대화하면서도 보상의 기준에 비례한 공정한 노출 할당을 보장할 수 있는 밴딧 알고리즘을 설계할 수 있는가?
- RQ2제안된 FairX 밴딧 프레임워크에서 공정성과 보상의 이론적 재해 경계는 무엇인가?
- RQ3기본적인 밴딧과 비교해 공정성 인식 알고리즘은 노출의 공정성과 사용자 반응 최적화 측면에서 어떻게 성능을 내는가?
- RQ4선형 밴딧에서의 모델 잘못 지정이 공정성 재해의 수렴에 영향을 미치는가? 그리고 이를 어떻게 완화할 수 있는가?
- RQ5공정성 인식 알고리즘은 다양한 실세계 및 합성 데이터셋에서 하위선형 공정성 및 보상 재해를 유지할 수 있는가?
주요 결과
- 제안된 공정한 UCB 및 공정한 TS 알고리즘은 확률적 다항 보상 및 선형 밴딧 설정 모두에서 하위선형 공정성 재해와 보상 재해를 달성한다.
- 공정성 재해는 보상의 최소 기준과 기준 함수의 리프시츠 상수에 의존하며, 이론적 하한선이 유도되었다.
- 효모 및 mediamill 데이터셋에서의 실증 결과는 FairX 알고리즘이 보상 기반의 공정성을 효과적으로 제어하면서도 낮은 보상 재해를 유지함을 보여준다.
- Yahoo! 데이터셋에서 FairX 알고리즘은 5일 간의 윈도우에서 하이퍼파ram터를 튜닝하고 다음 5일 동안 테스트한 결과에서도 강력한 공정성과 낮은 재해를 유지한다.
- 잘 지정된 선형 모델 설정(효모에서 유래한 합성 데이터)에서 공정성 재해는 이론적으로 예측된 대로 √T 스케일링을 따르며 수렴함을 확인하였다. 이는 이론적 경계가 정확함을 확인한다.
- 이론적 재해 경계는 유사하지만 실무에서는 TS 기반 알고리즘이 UCB 기반 알고리즘보다 계산상의 이점이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.