Skip to main content
QUICK REVIEW

[논문 리뷰] The COVID-19 Infodemic: Can the Crowd Judge Recent Misinformation Objectively?

Kevin Roitero, Michael Soprano|arXiv (Cornell University)|2020. 08. 13.
Misinformation and Its Impacts참고 문헌 33인용 수 4
한 줄 요약

이 연구는 최근의 코로나19 관련 허위 정보에 대해 전문가가 아닌 군중 작업자들이 객관적으로 진실성을 평가할 수 있는지 조사한다. 맞춤형 검색 인터페이스와 행동 로깅을 활용하여 저자들은 군중 작업이 신뢰할 수 있는 진실성 평가를 산출함을 발견하였으며, 특히 작업자들이 선택한 웹 소스에서 텍스트를 복사할 경우 그 효과가 뚜렷하며, 작업자 배경과 행동이 평가 품질과 유의미하게 상관관계가 있음을 확인하여 향후 집계 방법 향상에 새로운 신호를 제공한다.

ABSTRACT

Misinformation is an ever increasing problem that is difficult to solve for the research community and has a negative impact on the society at large. Very recently, the problem has been addressed with a crowdsourcing-based approach to scale up labeling efforts: to assess the truthfulness of a statement, instead of relying on a few experts, a crowd of (non-expert) judges is exploited. We follow the same approach to study whether crowdsourcing is an effective and reliable method to assess statements truthfulness during a pandemic. We specifically target statements related to the COVID-19 health emergency, that is still ongoing at the time of the study and has arguably caused an increase of the amount of misinformation that is spreading online (a phenomenon for which the term "infodemic" has been used). By doing so, we are able to address (mis)information that is both related to a sensitive and personal issue like health and very recent as compared to when the judgment is done: two issues that have not been analyzed in related work. In our experiment, crowd workers are asked to assess the truthfulness of statements, as well as to provide evidence for the assessments as a URL and a text justification. Besides showing that the crowd is able to accurately judge the truthfulness of the statements, we also report results on many different aspects, including: agreement among workers, the effect of different aggregation functions, of scales transformations, and of workers background / bias. We also analyze workers behavior, in terms of queries submitted, URLs found / selected, text justifications, and other behavioral data like clicks and mouse actions collected by means of an ad hoc logger.

연구 동기 및 목표

  • 지속 중인 코로나19 패닉 기간 동안 최근의 민감한 건강 관련 허위 정보에 대해 전문가가 아닌 군중 작업자들이 객관적으로 진실성 여부를 평가할 수 있는지 평가하기.
  • 작업자 배경, 인지적 행동, 정보 탐색 패턴이 진실성 평가 품질에 미치는 영향을 분석하기.
  • URL 선택, 텍스트 정당화 패턴, 상호작용 로그와 같은 행동 신호가 작업자 정확도를 예측하고 집계 방법을 향상시키는 데 어떻게 기여할 수 있는지 조사하기.
  • 특히 진실성 척도의 극단적인 범주(예: '바지에 불이 붙은 것' 및 '거짓')에서 전문가가 검증한 레이블과 비교해 군중 작업 레이블의 신뢰성을 평가하기.
  • 향후 허위 정보 탐지 및 진실성 평가 연구를 지원하기 위해 수집한 데이터셋과 행동 로그를 공개하기.

제안 방법

  • 군중 작업자들은 맞춤형으로 제작된 검색 인터페이스를 사용하여 최근의 8개의 코로나19 관련 문장의 진실성 여부를 평가하도록 요청받았으며, 이 과정에서 클릭, 마우스 움직임, 입력 행동 등 모든 상호작용이 로깅되었다.
  • 작업자들은 5점 척도로 진실성 평가를 제공하였고, URL과 텍스트 정당화를 함께 제출하였으며, 웹 소스에서 근거를 인용하도록 의무화되었다.
  • 연구는 상호작용 데이터를 상세히 기록하기 위해 행동 로깅을 활용하였으며, 정당화 내용이 선택된 URL에서 복사되었는지 여부도 기록하였다.
  • 작업자 품질은 전문가가 검증한 레이블과 비교하여 평가되었으며, 정확도는 예측 오차와 CEM${}^{ ext{ORD}}$ 점수로 측정되었다.
  • 레이블 품질 향상을 위해 집계 함수와 척도 변환을 시험하였고, 작업자 정치적 자가 정체성은 편향 영향을 평가하는 데 사용되었다.
  • 통계 분석을 통해 클릭, 마우스 동작, 텍스트 정당화 패턴과 같은 행동 패턴이 평가 정확도와 오차 분포에 어떻게 영향을 미치는지 분석하였다.

실험 결과

연구 질문

  • RQ1비전문가 군중 작업자들이 코로나19 팬데믹 기간 동안 최근의 건강 관련 허위 정보의 진실성 여부를 객관적으로 평가할 수 있는가?
  • RQ2작업자 배경과 자가 보고한 정치적 성향은 평가 품질과 어떻게 상관관계가 있는가?
  • RQ3URL 선택, 텍스트 복사, 정당화 패턴과 같은 행동 신호 중 어떤 것이 작업자 정확도를 예측하는가?
  • RQ4집계된 군중 평가가 전문가가 검증한 진실성 레이블과 얼마나 유사한가, 특히 '바지에 불이 붙은 것' 또는 '거짓'과 같은 극단적인 범주에서 얼마나 정확한가?
  • RQ5클릭, 마우스 동작, 텍스트 정당화 패턴과 같은 행동 데이터는 향후 진실성 레이블링을 위한 집계 방법 향상에 어떻게 활용될 수 있는가?

주요 결과

  • 군중 작업자들은 최근의 코로나19 문장의 진실성 여부를 객관적으로 평가하는 데 강력한 능력을 보였으며, 집계된 군중 레이블과 전문가 레이블 간의 높은 일치도를 보였지만, '바지에 불이 붙은 것'과 '거짓'이라는 두 극단적 범주에서는 예외였다.
  • 선택된 URL에서 텍스트를 정당화 내용에 복사한 작업자들은 예측 오차가 유의미하게 낮고 CEM${}^{ ext{ORD}}$ 점수가 높았으며(0.62 대비 0.58), 이는 더 나은 평가 품질을 의미한다.
  • 예측 오차의 분포는 비대칭적이었으며, 특히 '거짓' 또는 '바지에 불이 붙은 것'으로 레이블이 지정된 문장에서 진실성의 과대 평가(양의 오차)가 더 자주 발생했다.
  • 작업자들은 사실 확인 및 건강 관련 웹사이트를 포함한 여러 소스를 활용하였고, 정당화 행동이 정확도와 강하게 상관관계가 있었다.
  • 작업자들이 보고한 정치적 배경은 레이블 품질을 예측하는 데 유의미한 신호로 나타나, 인구통계적 요소가 평가 신뢰성에 영향을 미칠 수 있음을 시사한다.
  • 텍스트 복사 및 소스 인용 패턴과 같은 행동 신호는 향후 군중 기반 진실성 평가의 집계 방법 향상에 유망하고 측정 가능한 지표로 기여할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.