[논문 리뷰] Dataset of Propaganda Techniques of the State-Sponsored Information Operation of the People's Republic of China
이 논문은 중국 공화국 정부 배경을 가진 트위터 계정에서 유래한 중국어를 사용하는 다국어, 다중 레이블 프로パ간다 기법 데이터셋을 소개한다. 다중 레이블 텍스트 분류를 위해 미세조정된 BERT를 사용하여 모델은 80.35%의 정확도와 85.43%의 마이크로-F1 스코어를 기록했으며, 클래스 불균형에도 불구하고 뛰어난 성능을 보이며 다국어 및 다중 플랫폼 프로파간다 탐지 연구의 기반을 마련한다.
The digital media, identified as computational propaganda provides a pathway for propaganda to expand its reach without limit. State-backed propaganda aims to shape the audiences' cognition toward entities in favor of a certain political party or authority. Furthermore, it has become part of modern information warfare used in order to gain an advantage over opponents. Most of the current studies focus on using machine learning, quantitative, and qualitative methods to distinguish if a certain piece of information on social media is propaganda. Mainly conducted on English content, but very little research addresses Chinese Mandarin content. From propaganda detection, we want to go one step further to provide more fine-grained information on propaganda techniques that are applied. In this research, we aim to bridge the information gap by providing a multi-labeled propaganda techniques dataset in Mandarin based on a state-backed information operation dataset provided by Twitter. In addition to presenting the dataset, we apply a multi-label text classification using fine-tuned BERT. Potentially this could help future research in detecting state-backed propaganda online especially in a cross-lingual context and cross platforms identity consolidation.
연구 동기 및 목표
- 중국어에서의 주석 처리된 프로파간다 기법 데이터셋 부족 문제를 해결하기 위해, 특히 국가 주도 정보 작전을 대상으로 한다.
- 중국어 소셜 미디어 콘텐츠에 적용된 세분화된 다중 레이블 프로파간다 기법 데이터셋을 제공하기 위해.
- 표준화된 다국어 데이터셋을 제공하여 국가 배경의 프로파간다에 대한 다국어 및 다중 플랫폼 연구를 가능하게 하기 위해.
- 중국어 콘텐츠에 대해 미세조정된 BERT 모델을 훈련하고 평가하여 영어 외의 맥락에서의 프로파간다 탐지 능력을 향상시키기 위해.
- 국가 배경 콘텐츠의 언어적 특징을 분석하여 향후 연구를 지원하기 위해 정체성 통합, 정보 기원 추적, 입장 탐지에 기여하기 위해.
제안 방법
- 2019년 7월 트위터에서 공개한 중국 공화국 연계 트위터 계정에서 유래한 9,950개의 중국어 문장을 기반으로 데이터셋을 구축했다.
- 기존 문헌을 바탕으로 21개의 프로파간다 기법을 정의하였으며, '공포에 호소하기', '감성 어휘 사용', '스테레오타입' 등의 기법 포함.
- 다중 레이블 주석 체계를 적용하여 각 문장이 여러 프로파간다 기법에 동시에 태그될 수 있도록 하였다.
- 20차원의 선형층과 드롭아웃 레이어를 사용하여 정규화를 수행하는 방식으로 BERT 모델을 미세조정하였다.
- 최적의 수렴을 위해 Adam 옵timizer를 사용하고, BCEWithLogitsLoss를 적용하며, 1e-5의 낮은 학습률로 2 에포크 동안 훈련하였다.
- 80/20 훈련-테스트 분할 기반으로 정확도, 마이크로 평균 F1 스코어, 매크로 평균 F1 스코어를 사용하여 성능을 평가하였다.
실험 결과
연구 질문
- RQ1중국 공화국 정부 배경 트위터 계정에서 생산된 중국어 콘텐츠에서 체계적으로 사용되는 프로파간다 기법은 무엇인가?
- RQ2미세조정된 BERT 모델은 중국어 텍스트에서 다중 프로파간다 기법을 동시에 분류하는 데 얼마나 효과적인가?
- RQ3데이터셋의 클래스 불균형이 다중 레이블 프로파간다 분류 모델의 성능에 미치는 영향은 어느 정도인가?
- RQ4중국어 프로파간다의 언어적 특징을 활용하여 정보 기원을 추적하거나 다양한 플랫폼 간 계정을 연결할 수 있는가?
- RQ5중국 공화국 정부 배경 프로파간다의 언어 패턴은 영어 또는 다른 언어와 어떻게 다를까?
주요 결과
- 모델은 두 에포크 동안 훈련 손실이 0.71102에서 0.05953으로 감소하여 빠른 수렴을 보였다.
- 테스트 세트에서 전체 정확도는 80.352%를 기록하여 다중 레이블 작업에서 뛰어난 일반화 능력을 입증했다.
- 마이크로 평균 F1 스코어는 85.431%에 도달하여 모든 샘플에 대해 집계된 방식으로 강력한 성능을 보였다.
- 매크로 평균 F1 스코어는 20.803%였으며, 클래스 불균형으로 인해 개별 레이블 간 성능 변동성이 뚜렷하게 드러났다.
- 데이터셋은 21개의 프로파간다 기법에 대해 9,950개 문장을 주석 처리하였으며, 한 레이블은 발생 빈도가 0이었고, 이는 데이터 불균형을 강하게 보여준다.
- 중국 공화국 정부 배경 작전의 주요 타깃은 해외에 거주하는 중국인, 인권 변호사, 홍콩 시위자들이었으며, 이는 알려진 디스정보 캠페인과 일치한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.