[논문 리뷰] Can The Crowd Identify Misinformation Objectively? The Effects of Judgment Scale and Assessor's Background
이 연구는 비전문가인 커뮤니티 작업자들이 다수의 판단 척도를 사용하여 정치적 발언의 진실성을 신뢰성 있게 평가할 수 있는지 조사한다. 상호 평가자 간 일致도가 낮음에도 불구하고, 척도 간 집계된 커뮤니티 레이블은 전문가 사실 확인 평가와 강한 상관관계를 보이며, 평가자의 암묵적 정치 성향은 특히 이민 정책과 같은 극단적인 이슈에서 판단 정확성에 크게 영향을 미친다.
Truthfulness judgments are a fundamental step in the process of fighting misinformation, as they are crucial to train and evaluate classifiers that automatically distinguish true and false statements. Usually such judgments are made by experts, like journalists for political statements or medical doctors for medical statements. In this paper, we follow a different approach and rely on (non-expert) crowd workers. This of course leads to the following research question: Can crowdsourcing be reliably used to assess the truthfulness of information and to create large-scale labeled collections for information credibility systems? To address this issue, we present the results of an extensive study based on crowdsourcing: we collect thousands of truthfulness assessments over two datasets, and we compare expert judgments with crowd judgments, expressed on scales with various granularity levels. We also measure the political bias and the cognitive background of the workers, and quantify their effect on the reliability of the data provided by the crowd.
연구 동기 및 목표
- 비전문가 커뮤니티 작업자가 정치적 발언의 진실성 평가에 대해 얼마나 신뢰할 수 있는지 평가하는 것.
- 다양한 판단 척도의 세분성 수준이 진실성 평가 품질에 어떤 영향을 미치는지 검토하는 것.
- 평가자의 정치적 배경과 인지 능력이 판단 정확성에 어떤 영향을 미치는지 조사하는 것.
- 커뮤니티에서 생성된 진실성 레이블을 전문가 사실 확인 평가와 비교하는 것.
- 커뮤니티 작업자가 위성정보를 평가할 때 사용하는 자료원과 전략을 이해하는 것.
제안 방법
- 미국 기반의 작업자들을 대상으로 한 대규모 커뮤니티 소싱 실험을 수행하여 미국 및 호주 정치인들의 발언에 대한 진실성 평가를 실시함.
- 사실 확인 작업 중 정보 접근을 표준화하기 위해 제어된 맞춤형 웹 검색 엔진을 사용함.
- 세 가지 진실성 판단 척도를 적용: S3(진실/거짓/중립), S6(3점 척도), S100(100점 연속 척도).
- 평가자의 정치적 입장(명시적 및 암묵적), 인지 능력, 발언과의 지리적 관련성에 대한 데이터를 수집함.
- 정치 성향이 판단 구분 능력에 미치는 영향을 분석하기 위해 통계적 검정(Kruskal-Wallis H, Dunn의 사후 검정)을 적용함.
- 신호 대 잡음 비율을 향상시키고 전문가 레이블과의 상관관계를 평가하기 위해 인접한 범주를 융합하여 커뮤니티 평가를 집계함.
실험 결과
연구 질문
- RQ1RQ1: 사용된 평가 척도가 정치적 발언에 대한 진실성 레이블을 커뮤니티 소싱을 통해 수집하는 데 적합한가?
- RQ2RQ2: 커뮤니티 레이블과 전문가 레이블 간의 관계와 일致도, 그리고 다양한 척도로 수집된 레이블 간의 관계는 어떠한가?
- RQ3RQ3: 커뮤니티 작업자가 온라인 위성정보를 식별할 때 어떤 자료원을 사용하는가?
- RQ4RQ4: 평가자의 배경이 온라인 위성정보를 객관적으로 식별하는 데 어떤 영향을 미치고, 그 역할은 무엇인가?
주요 결과
- 모든 척도(S3, S6, S100)에서 커뮤니티 작업자 간 상호 평가자 간 일치도가 낮았지만, 집계된 평가 결과는 전문가 평가와 유의미한 상관관계를 보였다.
- 판단 척도의 선택이 진실성 평가의 총체적 품질에 영향을 주지 않았으며, 모든 척도가 진실/거짓의 구분을 동일하게 잘 포착함을 확인함.
- 남부 미국 국경에 벽을 건설하는 것을 반대하는 작업자들이 진실과 거짓을 구분하는 데 유의미하게 높은 판단 정확도를 보였음(p=0.007).
- 암묵적 정치 성향—특히 이민 정책에 대한 성향—은 판단 품질에 통계적으로 유의미한 영향을 미쳤음(p=0.004, PolitiFact 발언 기준), 반면 명시적 정당 소속은 영향을 미치지 않았음.
- 작업자들은 검색 결과 1페이지의 자료원을 주로 활용하여 사실 확인 과정에서 전략적인 정보 탐색 행동을 보였음.
- 기후 변화 문제에 대한 입장을 둘러싼 판단 품질에 유의미한 차이가 관찰되지 않아, 이슈에 따라 편향 효과가 다를 수 있음을 시사함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.