Skip to main content
QUICK REVIEW

[논문 리뷰] Finding Social Media Trolls: Dynamic Keyword Selection Methods for Rapidly-Evolving Online Debates

Anqi Liu, Maya Srikanth|arXiv (Cornell University)|2019. 11. 13.
Advanced Text Analysis Techniques참고 문헌 10인용 수 4
한 줄 요약

이 논문은 #MeToo 운동과 같이 빠르게 변화하는 소셜미디어 논의에서 지속적으로 변화하는 온라인 괴롭힘과 도xing을 탐지하기 위해 단어 임베딩을 사용한 동적 키워드 선택 방법을 제안한다. 시드 키워드에 대해 GloVe 임베딩을 활용함으로써 의미적으로 관련성이 있는 새로운 키워드를 식별하고 도메인 특화된 언어적 차이를 탐지함으로써, 트위터나 레딧과 같은 플랫폼에서 혐오 발언 및 폭력적 콘텐츠에 대한 더 효과적이고 유연한 모니터링을 가능하게 한다.

ABSTRACT

Online harassment is a significant social problem. Prevention of online harassment requires rapid detection of harassing, offensive, and negative social media posts. In this paper, we propose the use of word embedding models to identify offensive and harassing social media messages in two aspects: detecting fast-changing topics for more effective data collection and representing word semantics in different domains. We demonstrate with preliminary results that using the GloVe (Global Vectors for Word Representation) model facilitates the discovery of new and relevant keywords to use for data collection and trolling detection. Our paper concludes with a discussion of a research agenda to further develop and test word embedding models for identification of social media harassment and trolling.

연구 동기 및 목표

  • 혐오 발언과 도xing을 포함한 급격히 변화하는 온라인 논의를 포괄하는 데 있어 정적 키워드 검색의 한계를 해결하기 위해.
  • 수동 레이블링에 의존도를 줄이고 폭력적 콘텐츠 분석 시 윤리적 우려를 피할 수 있는 투명하고 반자동화된 동적 키워드 탐색 방법을 개발하기 위해.
  • 단어 임베딩을 활용해 의미적 이동과 플랫폼 간 도메인 특화 용어를 포착함으로써 악성 언어 탐지 능력을 향상시키기 위해.
  • 사전에 용어 변화를 알지 못하는 상태에서도 연구자가 실시간으로 변화하는 논의를 추적할 수 있도록 새로운 관련 키워드를 식별함으로써.
  • 향후 네트워크 기반의 정서 및 상호작용 패턴 분석을 위한 기반을 마련하여 온라인 커뮤니티에서 지지적 행동과 폭력적 행동을 구분할 수 있도록 하기 위해.

제안 방법

  • 소셜미디어 텍스트 내 단어 간 의미 관계를 표현하기 위해 사전에 훈련된 GloVe 단어 임베딩을 사용한다.
  • 코사인 유사도와 K-평균 군집화를 적용하여 시드 세트의 단어들(예: 'MeToo', 'survivor', 'harassment')에서 의미적으로 관련된 키워드를 식별한다.
  • 다른 커뮤니티(예: 트위터 #MeToo, 레딧의 Red Pill 서브레딧)의 데이터를 기반으로 도메인 특화 단어 임베딩을 훈련하여 'female'과 'male' 같은 단어의 의미적 표현 차이를 포착한다.
  • 시드 단어에 대해 유사도가 높은 상위 단어들을 활용해 어휘 일치 외에도 의미적 관련성에 기반한 동적 키워드 목록 확장을 수행한다.
  • 위키피디아, Gigaword5, 트위터 #MeToo, 레딧 Red Pill 등 다양한 도메인의 임베딩을 비교하여 성과 권력의 개념적 프레임워크가 어떻게 다를지 탐지한다.
  • 의미 유사도와 군집화를 기반으로 새로운 후보 키워드를 순위 매기는 파이프라인을 개발하여 키워드 폭발을 방지하기 위한 체계적 순위 매기기 계획을 수립한다.

실험 결과

연구 질문

  • RQ1단어 임베딩 모델이 #MeToo 운동과 같은 급격히 변화하는 온라인 논의에서 새로운 관련 키워드를 효과적으로 식별할 수 있는가?
  • RQ2트위터와 Red Pill 서브레딧과 같은 다른 온라인 커뮤니티 간에 'female'과 'male'과 같은 핵심 단어의 의미 표현 방식은 어떻게 다를까?
  • RQ3임베딩 기반 동적 키워드 선택이 정적 키워드 방법에 비해 얼마나 뛰어나게 발달하는 도xing과 혐오 발언을 탐지할 수 있는가?
  • RQ4도메인 특화 단어 임베딩을 통해 차별받는 집단과 적대적인 집단이 온라인 논의에서 성과 권력에 대해 어떻게 다른 개념적 구조로 프레임을 설정하는지 드러낼 수 있는가?
  • RQ5반자동화되고 투명한 키워드 탐색 방법은 인간 레이블링 의존도를 줄이면서도 악성 콘텐츠 탐지 정확도를 유지하는 데 얼마나 기여할 수 있는가?

주요 결과

  • 트위터 #MeToo 데이터에 기반한 단어 임베딩이 원래 시드 세트에 포함되지 않은 의미적으로 관련된 키워드들, 예를 들어 'survivor', 'harassment', 'abuse', 'support'를 성공적으로 식별했다.
  • K-평균 군집화 분석을 통해 'Epstein' 중심의 군집과 'Kavanaugh' 중심의 군집 등 서로 다른 주제적 군집이 드러났으며, 이는 #MeToo 운동 기간 동안 논의 주제의 변화를 반영했다.
  • 도메인 특화 임베딩은 뚜렷한 의미적 차이를 보였다: Red Pill 서브레딧에서는 'female'이 'plight', 'negative', 'sexual'과 관련지어졌고, #MeToo에서는 'female'이 'survivor', 'victim', 'abuse'와 연결되었다.
  • Red Pill 서브레딧의 임베딩에서는 'male'이 'alpha', 'beta', 'physical', 'emotional'과 연결되어 중립적이거나 #MeToo 코퍼스와는 다른 이념적·언어적 구조를 반영했다.
  • 위키피디아와 Gigaword5의 사전 훈련된 임베딩은 유용한 기준이 되었으며, 커뮤니티 특화 임베딩과 비교해 더 중립적이고 일반적인 의미적 연관성을 보였다.
  • 이 방법은 이전에 발견되지 않은 키워드와 언어 패턴을 드러내는 데 성공했으며, 이는 온라인 폭력 행위에 대한 확장 가능하고 적응 가능한 모니터링의 강력한 잠재력을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.