Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring agreement among several raters classifying subjects into one or more (hierarchical) categories: A generalization of Fleiss' kappa

Filip Moons, Ellen Vandervieren|arXiv (Cornell University)|2023. 03. 22.
Reliability and Agreement in Measurement인용 수 7
한 줄 요약

이 논문은 다수의 평가자가 주어진 대상을 하나 이상의 명목적 카테고리(계층적 또는 가중치가 부여된 카테고리 포함)로 분류할 때 상호 평가자 신뢰도를 측정하는 일반화된 Fleiss의 캅파 통계량을 제안한다. 이는 평가자가 다수의 카테고리를 할당할 경우에도, 선택과 비선택 양쪽에서의 일치를 고려함으로써 우연의 일치를 보정한 신뢰도 측정을 보장하며, 단일 카테고리 분류 상황에서는 Fleiss의 캅파와 일致성을 유지한다.

ABSTRACT

Cohen's and Fleiss' kappa are well-known measures of inter-rater agreement, but they restrict each rater to selecting only one category per subject. This limitation is consequential in contexts where subjects may belong to multiple categories, such as psychiatric diagnoses involving multiple disorders or classifying interview snippets into multiple codes of a codebook. We propose a generalized version of Fleiss' kappa, which accommodates multiple raters assigning subjects to one or more nominal categories. Our proposed $κ$ statistic can incorporate category weights based on their importance and account for hierarchical category structures, such as primary disorders with sub-disorders. The new $κ$ statistic can also manage missing data and variations in the number of raters per subject or category. We review existing methods that allow for multiple category assignments and detail the derivation of our measure, proving its equivalence to Fleiss' kappa when raters select a single category per subject. The paper discusses the assumptions, premises, and potential paradoxes of the new measure, as well as the range of possible values and guidelines for interpretation. The measure was developed to investigate the reliability of a new mathematics assessment method, of which an example is elaborated. The paper concludes with a worked-out example of psychiatrists diagnosing patients with multiple disorders. All calculations are provided as R script and an Excel sheet to facilitate access to the new $κ$ tatistic.

연구 동기 및 목표

  • 기존의 Cohen의 캅파나 Fleiss의 캅파와 같은 상호 평가자 신뢰도 측정법의 한계를 해결하기 위해, 평가자가 각 대상에 정확히 하나의 카테고리만 할당해야 한다는 요구 조건을 없애는 것.
  • 다수의 카테고리 할당을 허용하면서도, 해석 가능성과 통계적 엄밀함을 유지하는 우연의 일치를 보정한 신뢰도 측정법을 개발하는 것.
  • 카테고리 간 계층적 종속성(예: 주요 장애와 관련된 부속 장애)과 일치 계산에 있어 카테고리의 가중치를 통합하는 것.
  • 각 대상에 대해 단일 카테고리만 할당될 경우, 기존의 Fleiss의 캅파와 일致성을 유지하는 것.
  • 정신의학 진단 및 교육 평가와 같이 다수의 진단 또는 기준이 일반적인 연구 분야에서의 실용적 적용을 가능하게 하는 것.

제안 방법

  • 제안된 캅파 통계량은 관측된 일치도 $ P_o $ 를 평가자 간 쌍별 일치의 평균으로 계산하며, 다수의 카테고리 할당에 따라 조정한다.
  • 우연의 일치도 $ P_e $ 는 모든 평가자와 대상에 대해 카테고리 할당의 주변 확률에 기반하여 정의된다.
  • 대칭적 일치 정의를 사용: 두 평가자가 동일한 카테고리를 모두 선택하거나 모두 생략할 경우 일치로 간주하며, 카테고리 수에 관계없이 적용된다.
  • Fleiss의 공식을 일반화하여 $ x_{ic} $ 가 주어진 대상 $ i $ 에 대해 카테고리 $ c $ 를 할당한 평가자의 수를 나타내도록 하며, $ \sum_c x_{ic} > J $ 인 경우에도 적용 가능하도록 한다.
  • 가중치가 부여된 카테고리(예: 임상적 중요도 기반)와 계층적 구조(예: 부모 카테고리가 선택되어야만 자식 카테고리가 이용 가능)를 지원한다.
  • 결측치와 각 대상 또는 카테고리에 대한 평가자 수의 변동을 처리하여 실제 데이터에 대한 강건성을 확보한다.
Figure 1: NVivo advocates the pooled Cohen’s kappa approach in the provided Excel sheets to get an overall $\kappa$ of the coding process.
Figure 1: NVivo advocates the pooled Cohen’s kappa approach in the provided Excel sheets to get an overall $\kappa$ of the coding process.

실험 결과

연구 질문

  • RQ1평가자가 각 대상에 정확히 하나의 카테고리가 아니라 여러 카테고리를 할당할 경우, 상호 평가자 신뢰도는 어떻게 측정할 수 있는가?
  • RQ2카테고리가 계층적 또는 가중치가 부여된 경우, 적절한 우연의 일치를 보정한 일치 계수는 무엇인가?
  • RQ3비율적 중첩 또는 우연의 일치를 보정한 상관계수와 같은 기존 방법과 비교해 볼 때, 제안된 측정법은 일관성과 해석 가능성 측면에서 어떻게 다른가?
  • RQ4각 대상에 대해 단일 카테고리만 할당될 경우, 제안된 통계량이 Fleiss의 캅파와 동치성을 유지할 수 있는가?
  • RQ5신뢰도 분석에서 비선택(즉, 두 평가자가 동일한 카테고리를 모두 생략함)에 대한 일치를 忽略할 경우의 실용적 영향은 무엇인가?

주요 결과

  • 각 대상에 대해 모든 평가자가 정확히 하나의 카테고리를 할당할 경우, 제안된 캅파 통계량은 Fleiss의 캅파로 축소되어 기존 방법과의 일치성을 보장한다.
  • 선택과 비선택 양쪽에서의 일치를 고려함으로써, 비선택을 忽略하는 방법들에서 발생하는 편향을 방지한다.
  • 예: 주요 정신질환과 관련된 부속 장애를 포함한 계층적 카테고리 구조를 지원하며, 카테고리 간 종속성을 모델링한다.
  • 가중치가 부여된 카테고리를 통합할 수 있어, 연구자가 맥락에 따라 카테고리에 다른 중요도 수준을 부여할 수 있다.
  • 결측치와 각 대상 또는 카테고리에 대한 평가자 수의 변동을 처리하여 실용적 적용 범위를 넓힌다.
  • 저자들은 도입을 촉진하기 위해 R 패키지를 개발할 계획이며, 시뮬레이션 연구를 통해 기존 방법보다 낮은 평균제곱오차를 보일 것으로 예상한다.
Figure 2: Example question of the math assessment tool
Figure 2: Example question of the math assessment tool

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.