Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Armed Bandits with Fairness Constraints for Distributing Resources to Human Teammates

Houston Claure, Yifang Chen|arXiv (Cornell University)|2019. 06. 30.
Advanced Bandit Algorithms Research참고 문헌 61인용 수 4
한 줄 요약

이 논문은 로봇이 인간 팀원들 사이에서 자원(예: 주의, 부품)을 분배하면서 시간이 지남에 따라 그들의 능력 수준을 학습할 수 있도록, 공정성 제약 조건이 적용된 다익선 밴드잇 알고리즘을 제안한다. 각 팀원에 대해 최소 선택 빈도를 확보함으로써, 팀 성과를 희생시키지 않으면서도 특히 능력이 낮은 개인들 사이에서 신뢰를 향상시킨다. 이는 25%, 33%, 50%의 공정성 제약 조건을 적용한 대규모 테트리스 사용자 연구를 통해 입증되었다.

ABSTRACT

How should a robot that collaborates with multiple people decide upon the distribution of resources (e.g. social attention, or parts needed for an assembly)? People are uniquely attuned to how resources are distributed. A decision to distribute more resources to one team member than another might be perceived as unfair with potentially detrimental effects for trust. We introduce a multi-armed bandit algorithm with fairness constraints, where a robot distributes resources to human teammates of different skill levels. In this problem, the robot does not know the skill level of each human teammate, but learns it by observing their performance over time. We define fairness as a constraint on the minimum rate that each human teammate is selected throughout the task. We provide theoretical guarantees on performance and perform a large-scale user study, where we adjust the level of fairness in our algorithm. Results show that fairness in resource distribution has a significant effect on users' trust in the system.

연구 동기 및 목표

  • 자원 배분이 불균형할 경우 신뢰를 약화시킬 수 있는 인간-로봇 팀에서의 자원 배분 문제를 해결하기 위해.
  • 다익선 밴드잇 프레임워크 내에서 각 인간 팀원에 대해 최소 선택 빈도 제약 조건으로 공정성을 수학적으로 정의하기 위해.
  • 팀원의 능력 수준을 학습하는 것과 공정성 제약 조건을 동시에 고려한 이론적 알고리즘을 개발하기 위해.
  • 공정성이 인간이 팀의 신뢰도와 팀 성과를 어떻게 인식하는지에 미치는 영향을 평가하기 위해.
  • 자원 배분의 공정성이 전체 팀 성과를 떨어뜨리지 않으면서도 신뢰를 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 자원 배분 문제를 다익선 밴드잇으로 모델링하여, 각 팔은 인간 팀원을 나타내고, 보상은 능력 수준을 반영하는 확률적 값으로 간주한다.
  • 각 팔이 기대값으로 최소한의 빈도로 선택되도록 보장하는 확률적 UCB 기반 알고리즘을 제안한다.
  • 모든 시점에서 최소 선택 빈도를 엄격히 준수하는 결정론적 변형을 도입한다.
  • 공정성 제약 조건을 고려한 새로운 리그레트 측정법을 정의하고, 이론적 리그레트 경계를 제공한다.
  • 알고리즘이 성과와 공정성 제약 조건에 따라 블록 조각을 두 플레이어에게 할당하는 테트리스 기반 사용자 연구를 수행한다.
  • 최소 할당 빈도를 조절하기 위해 세 가지 공정성 조건(25%, 33%, 50%)을 사용하여 인식과 성과 결과를 평가한다.

실험 결과

연구 질문

  • RQ1각 팀원에 대해 최소 선택 빈도를 적용할 경우, 사용자들이 협업 시스템의 공정성과 신뢰도에 어떻게 인식하는가?
  • RQ2더 높은 성능를 보이는 팀원이 덜 선택되더라도 자원 배분의 공정성이 팀 성과에 영향을 미치는가?
  • RQ3다익선 밴드잇 알고리즘이 이론적 제약 조건을 통해 공정성을 보장하면서도 높은 팀 성과를 유지할 수 있는가?
  • RQ4능력이 낮은 팀원은 자원 할당이 제약을 받을 경우, 능력이 높은 팀원과 비교해 어떻게 공정성을 인식하는가?
  • RQ5자율 시스템이 자원 배분 결정을 내릴 때, 인식된 공정성이 인간의 신뢰에 얼마나 중대한 영향을 미치는가?

주요 결과

  • 33% 공정성 조건에 속한 참가자들은 25% 조건에 비해 시스템에 대해 훨씬 더 높은 신뢰를 보였으며, 특히 능력이 낮은 플레이어들 사이에서 두드러졌다.
  • 강한 플레이어를 덜 자주 선택함에도 불구하고, 중앙값 점수로 측정된 팀 성과는 공정성 수준이 높을수록 향상되었으며, 50% 조건에서 가장 높은 중앙값 점수를 기록했다.
  • 25% 조건에서는 강한 플레이어와 약한 플레이어 간의 턴 할당 격차가 커서 인식된 공정성이 크게 떨어졌고, 반면 50% 조건에서는 참여가 균등했으며 공정성 인식도 높았다.
  • 공정성 조건 간 전체 팀 성과에 유의미한 감소가 없었으며, 이는 공정성이 성과를 떨어뜨린다는 가설을 뒷받침하지 못했다.
  • 연구 결과, 공정성 인식은 결과의 동등성뿐 아니라 참가자의 참여 균형에 대한 인식과 강하게 연관되어 있었으며, 강한 플레이어들도 선택 빈도가 낮아도 시스템을 불공정하다고 느끼지 않았다.
  • 이론적 리그레트 경계는 공정성 제약 조건이 적용된 알고리즘이 제약 조건이 없는 UCB와 유사한 성능을 보이며, 동일한 조건 하에서 오라클보다도 더 나쁜 리그레트를 기록하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.