Skip to main content
QUICK REVIEW

[논문 리뷰] On Testing for Biases in Peer Review

Ivan Stelmakh, Nihar B. Shah|arXiv (Cornell University)|2019. 12. 31.
Expert finding and Q&A systems인용 수 15
한 줄 요약

이 논문은 Tomkins 등이 수행한 대규모 피어리뷰 실험에서 사용된 통계적 검정 방법론에 대한 심각한 결함을 규명하며, 심리적 평가자 오차, 모델 불일치, 校정 오차 등의 현실적인 조건 하에서 그들의 검정이 유의수준 오류(거짓 양성)를 통제하지 못함을 보여준다. 이는 비모수적 검정 기반의 새로운 강력한 가설 검정 프레임워크를 제안하며, 이는 불일치 및 수량 검정 기반으로 구성되어 있어 최소한의 가정 하에 조건부 가짜 경고 비율을 통제하고 의미 있는 검출 능력을 확보한다. 이는 미세한 편향이나 측정 오차가 존재하는 경우에도 유의하다.

ABSTRACT

We consider the issue of biases in scholarly research, specifically, in peer review. There is a long standing debate on whether exposing author identities to reviewers induces biases against certain groups, and our focus is on designing tests to detect the presence of such biases. Our starting point is a remarkable recent work by Tomkins, Zhang and Heavlin which conducted a controlled, large-scale experiment to investigate existence of biases in the peer reviewing of the WSDM conference. We present two sets of results in this paper. The first set of results is negative, and pertains to the statistical tests and the experimental setup used in the work of Tomkins et al. We show that the test employed therein does not guarantee control over false alarm probability and under correlations between relevant variables coupled with any of the following conditions, with high probability, can declare a presence of bias when it is in fact absent: (a) measurement error, (b) model mismatch, (c) reviewer calibration. Moreover, we show that the setup of their experiment may itself inflate false alarm probability if (d) bidding is performed in non-blind manner or (e) popular reviewer assignment procedure is employed. Our second set of results is positive and is built around a novel approach to testing for biases that we propose. We present a general framework for testing for biases in (single vs. double blind) peer review. We then design hypothesis tests that under minimal assumptions guarantee control over false alarm probability and non-trivial power even under conditions (a)--(c) as well as propose an alternative experimental setup which mitigates issues (d) and (e). Finally, we show that no statistical test can improve over the non-parametric tests we consider in terms of the assumptions required to control for the false alarm probability.

연구 동기 및 목표

  • Tomkins 등이 수행한 대규모 WSDM 피어리뷰 실험에서 사용된 가설 검정의 통계적 타당성을 철저히 평가하는 것.
  • 실제 세계의 일반적인 조건인 평가자 오차와 모델 불일치 하에서 원래의 검정이 유의수준 오류(거짓 양성 비율)를 통제하지 못함을 입증하는 것.
  • 단일 및 이중 맹검 피어리뷰에서 편향을 탐지하기 위한 새로운 통계적 프레임워크를 개발하여, 통제된 가짜 경고 비율과 의미 있는 탐지 능력을 보장하는 것.
  • 비맹검토 제도와 일반적인 평가자 배정 절차로 인한 거짓 양성 비율의 과다 증가를 줄이기 위한 개선된 실험 설계를 제안하는 것.
  • 유의수준 오류 통제를 위해 필요한 가정의 측면에서 제안된 비모수적 검정의 이론적 최적성(optimality)을 확립하는 것.

제안 방법

  • 단일 맹검과 이중 맹검 조건에서의 평가자 점수를 비교하여 체계적 편향을 탐지하는 불일치 기반 검정을 제안한다.
  • 다양한 조건에서 평가자 결정을 집계하여 귀무가설 하에서 예상되는 행동과의 이탈을 탐지하는 수량 기반 검정을 도입한다.
  • 귀무가설(편향 없음)과 대립가설(편향 존재) 하에서 평가자 결정 확률을 수식적으로 기술하기 위해 일반화된 로지스틱 모델을 사용한다.
  • 모든 가능한 평가자-논문 배정이 귀무가설 하에서 동일한 확률로 발생하도록 하는 랜덤화된 배정 절차를 적용하여 유효한 통계적 추론을 가능하게 한다.
  • 전체 확률의 법칙을 적용하여 조건부 결과를 모든 가능한 구성에 대해 무조건적 유의수준 오류 통제로 확장한다.
  • 제안된 비모수적 검정이 유의수준 오류 통제를 위해 필요한 가정에서 최적임을 입증하며, 이는 다른 어떤 검정도 이를 초월할 수 없음을 보여준다.

실험 결과

연구 질문

  • RQ1Tomkins 등이 수행한 WSDM 실험에서 사용된 통계적 검정이 평가자 오차와 모델 불일치와 같은 현실적인 조건 하에서도 유의수준 오류를 신뢰성 있게 통제하는가?
  • RQ2최소한의 가정 하에 유의수준 오류 통제와 의미 있는 검출 능력을 보장하는 새로운 가설 검정 프레임워크를 설계할 수 있는가?
  • RQ3비맹검토 제도와 일반적인 평가자 배정 절차와 같은 요소들이 편향 탐지에서 거짓 양성 비율에 어떤 영향을 미치는가?
  • RQ4유의수준 오류 통제를 위해 필요한 가정의 수준에서 어떤 통계적 검정의 성능에 이론적 한계가 존재하는가?
  • RQ5측정 오차나 평가자 校정 오차로 인해 점수가 왜곡되더라도 제안된 검정이 미세한 편향을 탐지할 수 있는가?

주요 결과

  • Tomkins 등이 사용한 검정은 현실적인 조건, 예를 들어 평가자 오차와 모델 불일치 하에서, 유의수준 오류를 통제하지 못하며, 거짓 양성 비율이 0.5 또는 그 이상에 이르기도 한다.
  • 제안된 불일치 및 수량 검정은 측정 오차, 모델 불일치, 평가자 校정 오차가 존재하는 경우에도 최소한의 가정 하에 유의수준 오류 통제를 보장한다.
  • 새로운 실험 설계는 비맹검토 제도와 일반적인 평가자 배정 절차로 인한 가짜 경고 비율 과다 증가를 완화한다.
  • 제안된 비모수적 검정은 이론적으로 최적이다: 다른 어떤 검정도 더 낮은 가정 수준으로 유의수준 오류 통제를 달성할 수 없다.
  • 시뮬레이션 결과, 제안된 검정은 상관된 평가자 점수와 노이즈 있는 추정치 하에서도 높은 탐지 능력을 유지하며 원래 방법을 능가한다.
  • 강력한 모수적 가정 위반에 대해 강인한 프레임워크이므로, 다양한 평가자 행동을 반영하는 실제 피어리뷰 환경에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.