Skip to main content
QUICK REVIEW

[논문 리뷰] Panning for gold: Lessons learned from the platform-agnostic automated detection of political content in textual data

Mykola Makhortykh, Ernesto de León|arXiv (Cornell University)|2022. 07. 01.
Hate Speech and Cyberbullying Detection인용 수 5
한 줄 요약

이 논문은 다양한 온라인 플랫폼에서 텍스트 데이터의 정치적 내용을 탐지하기 위한 플랫폼에 종속되지 않는 방법을 사전 기반, 지도 학습 기반 기계학습, 신경망 접근 방식을 사용해 평가한다. 결과적으로 청소된 데이터에서는 신경망 및 기계학습 모델이 사전 방법을 능가하지만, 노이즈가 있는 데이터에서는 사전 방법이 더 뛰어난 내성성을 보이며, 어간 추출이나 불용어 제거와 같은 전처리 기법의 영향이 미미하다.

ABSTRACT

The growing availability of data about online information behaviour enables new possibilities for political communication research. However, the volume and variety of these data makes them difficult to analyse and prompts the need for developing automated content approaches relying on a broad range of natural language processing techniques (e.g. machine learning- or neural network-based ones). In this paper, we discuss how these techniques can be used to detect political content across different platforms. Using three validation datasets, which include a variety of political and non-political textual documents from online platforms, we systematically compare the performance of three groups of detection techniques relying on dictionaries, supervised machine learning, or neural networks. We also examine the impact of different modes of data preprocessing (e.g. stemming and stopword removal) on the low-cost implementations of these techniques using a large set (n = 66) of detection models. Our results show the limited impact of preprocessing on model performance, with the best results for less noisy data being achieved by neural network- and machine-learning-based models, in contrast to the more robust performance of dictionary-based models on noisy data.

연구 동기 및 목표

  • 온라인 텍스트 데이터에서 정치적 콘텐츠를 탐지하기 위한 자동화되고 플랫폼에 종속되지 않는 방법을 개발하고 평가하는 것.
  • 다양한 온라인 플랫폼에서 사전 기반, 지도 학습 기반 기계학습, 신경망 기반의 세 가지 탐지 기법의 성능을 평가하는 것.
  • 어간 추출, 불용어 제거 등 데이터 전처리 기법(예: 어간 추출, 불용어 제거)이 모델 정확도와 내성성에 미치는 영향을 분석하는 것.
  • 특히 노이즈가 많은 텍스트와 청소된 텍스트의 조건에서 어떤 접근 방식이 가장 우수한 성능을 보이는지 확인하는 것.
  • 연구자들이 정치적 커뮤니케이션 연구를 위해 탐지 모델을 선택하고 튜닝하는 데 실용적인 통찰을 제공하는 것.

제안 방법

  • 본 연구는 세 가지 탐지 기법 유형을 활용한다: 규칙 기반 사전 매칭, 지도 학습 기반 기계학습(예: 로지스틱 회귀, 랜덤 포레스트), 딥 러닝 모델(예: BERT 기반 분류기).
  • 정확도 평가를 위해 정치적 및 비정치적 콘텐츠를 포함한 세 가지 검증 데이터셋을 활용해 총 66개의 탐지 모델을 훈련 및 평가한다.
  • 어간 추출, 불용어 제거, 표제어 추출 등의 조합을 포함해 전처리 방법을 체계적으로 다양화하여 모델 성능에 미치는 영향을 평가한다.
  • 모델 평가는 F1 점수, 정밀도, 재현율 등의 표준 NLP 지표를 사용해 보류된 테스트 세트에서 수행된다.
  • 청결도 수준(청결한 텍스트 대 노이즈가 많은 텍스트)에 따라 모델 성능을 비교하며, 플랫폼 별 및 교차 플랫폼 평가 설정을 통해 분석한다.
  • 연구는 사회 미디어 및 뉴스 플랫폼 간 일반화 가능성을 확보하기 위해 플랫폼에 종속되지 않는 평가 프레임워크를 사용한다.

실험 결과

연구 질문

  • RQ1다양한 온라인 플랫폼에서 사전 기반, 기계학습, 신경망 모델의 정치적 콘텐츠 탐지 성능는 어떻게 비교되는가?
  • RQ2일반적인 텍스트 전처리 기법(예: 어간 추출, 불용어 제거)은 정치적 콘텐츠 탐지 모델의 성능에 어떤 영향을 미치는가?
  • RQ3노이즈가 많은 텍스트에서 어떤 모델 유형이 가장 우수한 성능을 보이며, 청결한 텍스트에서는 어떤 모델이 뛰어난가?
  • RQ4다양한 언어 스타일과 콘텐츠 유형을 가진 다양한 온라인 플랫폼 간에 탐지 모델의 일반화 능력은 어느 정도인가?
  • RQ5데이터 품질(노이즈 수준)이 다양한 탐지 기법의 효과성에 미치는 영향은 어느 정도인가?

주요 결과

  • 신경망 및 기계학습 모델은 청결한 데이터에서 최고의 성능을 보이며, 최적의 설정에서 F1 점수는 0.85를 초과한다.
  • 사전 기반 모델은 노이즈가 많은 데이터에 더 뛰어난 내성성을 보이며, 텍스트 품질이 낮아져도 안정적인 성능을 유지한다.
  • 어간 추출 및 불용어 제거와 같은 전처리 기법이 모든 모델 유형에서 모델 성능에 미치는 영향은 미미하다.
  • 교차 플랫폼 평가에서는 훈련 데이터와 다른 플랫폼에 적용할 경우 모델 성능이 떨어지는 경향을 보이며, 도메인 이동 문제를 드러낸다.
  • 가장 뛰어난 성능을 보인 모델은 일반적으로 파인튜닝된 BERT 기반 아키텍처이며, 청결한 플랫폼 전용 데이터에서는 전통적인 기계학습 모델을 능가한다.
  • 모든 상황에서 성능을 향상시키는 유일한 전처리 파이프라인은 존재하지 않으며, 이는 전처리 전략이 데이터 특성에 맞게 맞춤형으로 설정되어야 함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.