[논문 리뷰] Group Fairness in Bandit Arm Selection
이 논문은 집단 수준의 편향 항목을 학습함으로써 암호화된 보상에서 사회적 편향을 보정하는 GroupFairTopInterval를 제안한다. 이는 민감 집단 간 자원 할당의 공정성을 높이는 데 기여한다. 이론적 리그레트 경계를 제공하고, 합성 및 실세계 데이터셋에서 개선된 공정성과 성능을 실험적으로 검증한다.
We propose a novel formulation of group fairness with biased feedback in the contextual multi-armed bandit (CMAB) setting. In the CMAB setting, a sequential decision maker must, at each time step, choose an arm to pull from a finite set of arms after observing some context for each of the potential arm pulls. In our model, arms are partitioned into two or more sensitive groups based on some protected feature(s) (e.g., age, race, or socio-economic status). Initial rewards received from pulling an arm may be distorted due to some unknown societal or measurement bias. We assume that in reality these groups are equal despite the biased feedback received by the agent. To alleviate this, we learn a societal bias term which can be used to both find the source of bias and to potentially fix the problem outside of the algorithm. We provide a novel algorithm that can accommodate this notion of fairness for an arbitrary number of groups, and provide a theoretical bound on the regret for our algorithm. We validate our algorithm using synthetic data and two real-world datasets for intervention settings wherein we want to allocate resources fairly across groups.
연구 동기 및 목표
- 사회적 또는 측정 요인으로 인해 편향된 피드백이 존재하는 맥락 기반 다중 손잡이 밴딧에서 집단 공정성을 해결하기 위해.
- 보호된 집단 간 잠재적인 사회적 편향을 고려한 보상 및 리그레트의 새로운 정의를 체계화하기 위해.
- 낮은 리그레트와 개별 손잡이 간 차별화를 유지하면서도 이 편향을 학습하고 보정하는 알고리즘을 개발하기 위해.
- 자원 할당 개입 환경을 포함한 합성 데이터 및 실세계 데이터셋에서 접근법을 검증하기 위해.
제안 방법
- 집단 수준의 사회적 편향 항목을 추정하여 관측된 보상을 보정하는 새로운 보상 정의를 제안한다.
- 민감 집단 간 공정성 제약 조건을 통합한 리그레트 공식을 도입한다.
- 상한 신뢰도 구간을 사용하여 편향 보정 보상을 적용함으로써 탐색과 이용을 균형 잡는 GroupFairTopInterval 알고리즘을 설계한다.
- 집단 공정성을 고려하면서 최적의 손잡이를 식별하기 위해 간격 추정 기법을 활용한다.
- 과거 피드백 기반으로 선형 모델을 사용해 편향 항목을 추정하며, 관측이 편향되더라도 현실적으로 집단 간 효과가 동일하다는 가정을 한다.
- 기존의 표준 CMAB 방법을 확장하여 추정된 편향을 사용해 신뢰도 구간을 조정함으로써 공정성을 통합한다.
실험 결과
연구 질문
- RQ1맥락 기반 밴딧에서 편향된 피드백이 존재할 경우 집단 공정성은 어떻게 공식화할 수 있는가?
- RQ2편향의 크기 정보 없이도 알고리즘이 사회적 편향을 학습하고 보정할 수 있는가?
- RQ3편향된 피드백 하에서 공정성 인식 밴딧 알고리즘의 이론적 리그레트 경계는 무엇인가?
- RQ4기존의 공정성 접근법과 비교해 제안된 알고리즘은 공정성과 성능 측면에서 어떻게 다른가?
- RQ5알고리즘이 여전히 높은 성능을 보이는 개별 손잡이를 구별하면서도 공정성을 유지할 수 있는가?
주요 결과
- 제안된 GroupFairTopInterval 알고리즘은 손잡이 수의 제곱근과 편향 보정 정확도의 역수에 비례하는 이론적 리그레트 경계를 달성한다.
- 합성 데이터에서의 실험 결과, 기존의 표준 밴딧 기반 알고리즘 대비 집단 수준의 보상 격차가 크게 감소함을 확인했다.
- 마이크로 렌딩 및 인재 확보를 포함한 실세계 데이터셋에서, 경쟁적인 누적 보상과 함께 더 나은 공정성 지표를 달성했다.
- 알고리즘이 피드백에서 사회적 편향 항목을 성공적으로 학습하여, 기준 보상이 없이도 보정을 가능하게 했다.
- 편의적 임계값 설정 및 균일한 무작위 집단 선택보다 공정성과 리그레트 성능 측면에서 뛰어난 성능을 보였다.
- 지연되거나 노이즈가 있는 기준 피드백에 대해서도 강인하여, 대출 자금 지원이나 채용과 같은 장기적 의사결정 시스템에 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.