[논문 리뷰] Effects of algorithmic flagging on fairness: quasi-experimental evidence from Wikipedia
이 연구는 위키백과 모더레이션에서 알고리즘 기반 플래그가 사회적 신호(예: 사용자 등록 여부 또는 프로필 존재 여부)에 대한 의존도를 줄임으로써 공정성에 어떤 영향을 미치는지 조사한다. RCFilters 데이터를 바탕으로 한 준실험적 회귀 이분법 설계를 활용하여, 알고리즘 플래그가 편집의 되돌리기 가능성을 높이고, 특히 정착한 편집자들에 의해 이루어진 편집에 대해 이를 증가시키며, 되돌리기 빈도를 감소시켜 양심적인 기여자들에게 더 나은 공정성을 제공하는 것으로 나타났다. 다만 효과는 사회적 신호의 종류에 따라 다를 수 있다.
Online community moderators often rely on social signals such as whether or not a user has an account or a profile page as clues that users may cause problems. Reliance on these clues can lead to "overprofiling'' bias when moderators focus on these signals but overlook the misbehavior of others. We propose that algorithmic flagging systems deployed to improve the efficiency of moderation work can also make moderation actions more fair to these users by reducing reliance on social signals and making norm violations by everyone else more visible. We analyze moderator behavior in Wikipedia as mediated by RCFilters, a system which displays social signals and algorithmic flags, and estimate the causal effect of being flagged on moderator actions. We show that algorithmically flagged edits are reverted more often, especially those by established editors with positive social signals, and that flagging decreases the likelihood that moderation actions will be undone. Our results suggest that algorithmic flagging systems can lead to increased fairness in some contexts but that the relationship is complex and contingent.
연구 동기 및 목표
- 온라인 커뮤니티 모더레이션에서 알고리즘 기반 플래그가 사회적 신호(예: 등록 여부 또는 프로필 존재 여부)에 대한 과도한 의존도를 줄이는지 평가하는 것.
- 사회적 신호가 양호한 사용자에 대해 편향을 줄임으로써 알고리즘 기반 플래그가 더 공정한 모더레이션 결과를 이끌어내는지 평가하는 것.
- 알고리즘 플래그가 정착한 또는 등록된 사용자의 편집에 대해 모더레이터 행동에 미치는 인과적 영향을 조사하는 것.
- 다양한 사회적 신호(예: 등록 상태, 사용자 페이지 존재 여부)가 알고리즘 기반 플래그와 상호작용하여 모더레이션의 공정성에 어떤 영향을 미치는지 탐구하는 것.
- 실험적 간섭 없이도 실제 사회기술적 시스템에서 인과적 추론을 위한 방법론 프레임워크를 개발하는 것.
제안 방법
- RCFilters 시스템 내 임의의 임계값을 기반으로 한 준실험적 회귀 이분법 설계를 활용하였다.
- 손상 가능성이 높은 편집을 식별하기 위해 ORES에서 생성한 기계학습 점수를 활용하였다.
- 플래그 임계값을 초과하거나 미달하는 편집에 대한 모더레이터 행동(예: 되돌리기, 취소 작업)을 분석하였다.
- 다양한 사회적 신호(예: 등록자 대비 비등록자, 사용자 페이지 유무)를 가진 사용자가 작성한 편집의 모더레이션 결과를 비교하였다.
- 알고리즘 기반 플래그가 모더레이터 행동에 미치는 영향을 추정하기 위해 인과적 추론 기법을 적용하였다.
- 재현 가능성을 확보하기 위해 하버드 데이터베이스에서 제공하는 복제 데이터셋(ORES 점수, 임계값, 수정 데이터 포함)을 사용하였다.
실험 결과
연구 질문
- RQ1알고리즘 기반 플래그가 사용자 등록 상태나 사용자 페이지 유무와 같은 사회적 신호에 대한 의존도를 줄여 과잉 대응을 감소시키는가?
- RQ2알고리즘 기반 플래그는 정착한 편집자에게서 편집이 되돌아갈 가능성을 어떻게 영향을 미치는가?
- RQ3모더레이션 조치가 되돌아가는 것의 가능성이 감소하는가? 이는 결정의 안정성 향상을 의미한다.
- RQ4다양한 유형의 사회적 신호가 알고리즘 기반 플래그와 상호작용하여 모더레이션의 공정성에 어떤 영향을 미치는가?
- RQ5플래그 임계값이 모더레이션 결과에 임의성을 도입하는 정도는 어느 정도인가?
주요 결과
- 알고리즘 기반 플래그가 부여된 편집은 특히 긍정적인 사회적 신호를 지닌 등록된 편집자로부터 작성된 편집일수록 되돌려질 가능성이 높았다.
- 정착한 편집자로부터 작성된 플래그 편집은 플래그가 부여되지 않은 편집보다 더 높은 비율로 되돌아갔으며, 이는 사회적 신호에 대한 과도한 의존도 감소를 시사한다.
- 플래그가 부여된 편집에 대한 모더레이터 조치는 되돌아가지 않을 가능성이 더 높아, 결정의 안정성 향상과 논란 감소를 나타낸다.
- 플래그의 공정성 영향은 사회적 신호의 종류에 따라 달라졌다: 비등록자에 대해서는 과잉 대응이 감소했지만, 사용자 페이지가 없는 사용자에 대해서는 과잉 대응이 증가했다.
- 플래그 시스템에서 임의의 임계값이 사용됨으로써, 임계값을 약간 초과한 편집에 대해 비례하지 않는 주의가 집중되어, 모더레이션 결과에 임의성이 도입되었다.
- 결과적으로 알고리즘 기반 플래그가 일부 맥락에서는 공정성을 향상시킬 수 있지만, 사회적 신호의 종류에 따라 편향을 악화시킬 가능성도 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.