Skip to main content
QUICK REVIEW

[논문 리뷰] Inter-Rater: Software for analysis of inter-rater reliability by permutating pairs of multiple users

Daniel J. Arenas|arXiv (Cornell University)|2018. 09. 15.
Reliability and Agreement in Measurement참고 문헌 10인용 수 8
한 줄 요약

이 논문은 다수의 평가자 간의 상호 평가 신뢰도 분석을 향상시키기 위해 여러 평가자 쌍을 순열화하여 개별 평가자의 집단에 대한 일치도를 정량화하는 파이썬 기반 소프트웨어 도구인 Inter-Rater를 소개한다. 이는 기존 방법을 개선하여 평가자 개개인의 신뢰도 지표를 유지하면서 Fleiss의 카파를 계산함으로써 체계적 리뷰 및 의료 진단과 같은 분야에서 평가자의 일관성에 대한 더 깊은 통찰을 가능하게 한다.

ABSTRACT

Inter-Rater quantifies the reliability between multiple raters who evaluate a group of subjects. It calculates the group quantity, Fleiss kappa, and it improves on existing software by keeping information about each user and quantifying how each user agreed with the rest of the group. This is accomplished through permutations of user pairs. The software was written in Python, can be run in Linux, and the code is deposited in Zenodo and GitHub. This software can be used for evaluation of inter-rater reliability in systematic reviews, medical diagnosis algorithms, education applications, and others.

연구 동기 및 목표

  • 다수의 평가자 설정에서 개별 평가자 신뢰도 평가에 대한 기존 도구의 한계를 해결하기 위해.
  • 집단 수준의 신뢰도 지표를 계산하는 동안 개별 평가자 정보를 유지하는 방법을 개발하기 위해.
  • 각 평가자가 그룹의 나머지 구성원과 얼마나 일치하는지 정량화하여 상호 평가 신뢰도의 해석 가능성을 향상시키기 위해.
  • 건강 과학, 교육 및 체계적 리뷰 분야의 연구자들이 사용할 수 있는 투명하고 오픈소스 솔루션을 제공하기 위해.
  • 평가자 쌍 간의 순열 기반 비교를 사용하여 상호 평가 신뢰도 분석을 강력하게 수행할 수 있도록 하기 위해.

제안 방법

  • 소프트웨어는 다수의 평가자 간 상호 평가 신뢰도의 주요 측정 지표로 Fleiss의 카파를 계산한다.
  • 평가자 쌍의 순열을 사용하여 각 개별 평가자의 집단에 대한 일치 기여도를 고립하고 정량화한다.
  • 각 평가자의 일치도는 다른 모든 평가자들의 평균 일치도와 비교하여 재표본화 접근법을 사용해 평가된다.
  • 이 방법은 표준 카파 계산에서 흔히 발생하는 집계 손실을 방지하면서 각 평가자의 성과에 대한 완전한 추적 가능성을 유지한다.
  • 구현은 파이썬으로 이루어졌으며 리눅스 시스템과 호환되어 재현 가능성과 접근성을 보장한다.
  • 소스 코드는 깃허브와 젠도에 호스팅되어 있어 오픈 액세스 및 버전 제어가 가능하다.

실험 결과

연구 질문

  • RQ1다수의 평가자 설정에서 개별 평가자 성과 정보를 유지하면서 상호 평가 신뢰도를 어떻게 평가할 수 있는가?
  • RQ2평가자 쌍의 순열화가 다수의 평가자 설정에서 일관성 없는 평가자를 더 잘 탐지하는 데에 얼마나 기여하는가?
  • RQ3순열 기반 접근법이 표준 Fleiss의 카파보다 더 세밀한 통찰을 제공할 수 있는가?
  • RQ4해당 소프트웨어의 접근 방식은 기존 도구와 해석 가능성 및 사용성 측면에서 어떻게 비교되는가?
  • RQ5체계적 리뷰나 의료 진단과 같은 연구 분야에서 이 방법이 측정 가능한 이점을 제공하는가?

주요 결과

  • 소프트웨어는 개별 평가자 일치도 지표를 유지하면서도 Fleiss의 카파를 성공적으로 계산한다.
  • 평가자 쌍의 순열화는 집단 공감대에서 크게 벗어나 있는 평가자를 식별하는 데에 기여한다.
  • 표준 도구가 평가자 성과를 집계하는 데 비해 이 방법은 더 세분화된 신뢰도 평가를 제공한다.
  • 소프트웨어는 리눅스 환경에서 기능하고 작동 가능하여 재현 가능한 연구 워크플로우를 지원한다.
  • 소스 코드가 깃허브와 젠도에 공개되어 있어 장기적인 접근성과 커뮤니티 기여를 보장한다.
  • 이 방법은 체계적 리뷰, 의료 진단 및 교육 평가를 포함한 다양한 분야에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.