Skip to main content
QUICK REVIEW

[논문 리뷰] On Analyzing Antisocial Behaviors Amid COVID-19 Pandemic

Md. Rabiul Awal, Rui Cao|arXiv (Cornell University)|2020. 07. 21.
Hate Speech and Cyberbullying Detection참고 문헌 32인용 수 6
한 줄 요약

이 논문은 대규모 COVID-19 관련 트윗 데이터셋(4000만 건 이상)에서 반사회적 행동을 레이블링하기 위해 어휘 기반 탐지와 구글의 Perspective API를 결합한 자동 주석 프레임워크를 제안한다. 연구는 새로운 폭력적 어휘, 취약 대상, 그리고 이벤트 기반의 독성 콘텐츠 급증을 규명하였으며, 향후 연구를 지원하기 위해 공개된 데이터셋을 기여한다.

ABSTRACT

The COVID-19 pandemic has developed to be more than a bio-crisis as global news has reported a sharp rise in xenophobia and discrimination in both online and offline communities. Such toxic behaviors take a heavy toll on society, especially during these daunting times. Despite the gravity of the issue, very few studies have studied online antisocial behaviors amid the COVID-19 pandemic. In this paper, we fill the research gap by collecting and annotating a large dataset of over 40 million COVID-19 related tweets. Specially, we propose an annotation framework to annotate the antisocial behavior tweets automatically. We also conduct an empirical analysis of our annotated dataset and found that new abusive lexicons are introduced amid the COVID-19 pandemic. Our study also identified the vulnerable targets of antisocial behaviors and the factors that influence the spreading of online antisocial content.

연구 동기 및 목표

  • 코로나19 팬데믹 기간 동안 온라인 반사회적 행동을 연구하는 데 있어 주로 주석이 부족한 데이터셋으로 인해 발생하는 핵심 연구 격차를 메우기 위해.
  • 혐오 발언 및 모욕적 언어와 같은 반사회적 행동을 위한 대규모 소셜 미디어 콘텐츠를 레이블링할 수 있는 자동화되고 확장 가능한 주석 프레임워크를 개발하기 위해.
  • 팬데믹 기간 동안 온라인 논의에서 반사회적 행동의 성격, 대상, 확산 양상에 대해 실증적으로 분석하기 위해.
  • 향후 연구를 지원하기 위해 코로나19 팬데믹 맥락에서 반사회적 행동에 대한 대규모이고 공개된, 정밀하게 주석 처리된 데이터셋을 제공하기 위해.

제안 방법

  • 키워드 기반 크롤링과 시간대 필터링을 사용하여 코로나19 팬데믹과 관련된 4000만 건 이상의 트위터 게시물을 수집한다.
  • 어휘 기반 방법을 사용해 알려진 반사회적 비속어 및 표현을 매칭하고, 사전 훈련된 독성 분류기(구글의 Perspective API)를 통합하여 자동 주석 프레임워크를 제안한다.
  • 두 방법의 출력을 통합하여 데이터셋 내 반사회적 콘텐츠에 대한 최종 공감대 기반 주석을 생성한다.
  • 어휘 패턴, 대상 인구 통계, 반사회적 콘텐츠의 시간적 동역학에 중점을 두어 주석 처리된 데이터셋을 실증 분석에 활용한다.
  • 실제 사건과 연관된 반사회적 행동의 급증을 규명하기 위해 통계적 및 시간적 분석을 수행한다.

실험 결과

연구 질문

  • RQ1코로나19 팬데믹 기간 동안 온라인 논의에서 새로운 폭력적 어휘 패턴은 무엇이며, 어떤 새로운 폭력적 어휘가 등장했는가?
  • RQ2팬데믹 기간 동안 소셜 미디어에서 반사회적 행동의 주요 대상은 누구인가?
  • RQ3실제 세계의 사건은 소셜 미디어에서 반사회적 콘텐츠의 시간적 확산과 강도에 어떻게 영향을 미치는가?
  • RQ4리트윗 또는 정치적 발언과 같은 요소들은 독성 콘텐츠의 급속한 확산에 어떤 기여를 하는가?

주요 결과

  • 연구는 팬데믹 기간 동안 온라인 논의에서 새로운 폭력적 어휘가 나타났음을 규명하였으며, 특히 특정 국적과 정치적 인물들을 대상으로 한 경우가 많았다.
  • 중국인 공동체는 초기 팬데믹 단계 기간 동안 인종차별적이고 차별적인 콘텐츠의 주요 대상이었다.
  • 반사회적 콘텐츠는 뚜렷한 시간적 급증을 보였으며, 도널드 트럼프의 하이드록시클로르로퀸 권고 및 인도에서의 종교 모임 발언 등 주요 정치적 사건과 연관된 급격한 증가가 있었다.
  • 트위터의 리트윗 기능은 영향력 있는 계정에서 유래한 경우에 특히 반사회적 콘텐츠의 확산과 증폭에 중요한 역할을 했다.
  • 데이터셋은 반사회적 트윗 비율이 매일 4%에서 9% 사이를 오갔으며, 영향력 있는 사건 기간에는 이 범위를 초월하는 급증이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.