[논문 리뷰] Modeling Islamist Extremist Communications on Social Media using Contextual Dimensions: Religion, Ideology, and Hate
이 논문은 도메인 특화 지식 기반을 활용하여 종교, 이데올로기, 증오의 세 가지 별개의 차원—즉, 종교, 이데올로기, 증오—을 기반으로 티커에서 이슬람 민족주의자 급진주의 콘텐츠를 분석하는 맥락 인식형 다차원 계산 모델을 제안한다. 랜덤 포레스트 및 나이브 베이즈 분류기와 통합함으로써, 기준 모델 대비 정밀도가 10.2% 향상되었으며, 잘못된 레이블링을 크게 줄이고, 반라디칼리제이션 노력의 실질적 구현에 있어 신뢰성을 높였다.
Terror attacks have been linked in part to online extremist content. Although tens of thousands of Islamist extremism supporters consume such content, they are a small fraction relative to peaceful Muslims. The efforts to contain the ever-evolving extremism on social media platforms have remained inadequate and mostly ineffective. Divergent extremist and mainstream contexts challenge machine interpretation, with a particular threat to the precision of classification algorithms. Our context-aware computational approach to the analysis of extremist content on Twitter breaks down this persuasion process into building blocks that acknowledge inherent ambiguity and sparsity that likely challenge both manual and automated classification. We model this process using a combination of three contextual dimensions -- religion, ideology, and hate -- each elucidating a degree of radicalization and highlighting independent features to render them computationally accessible. We utilize domain-specific knowledge resources for each of these contextual dimensions such as Qur'an for religion, the books of extremist ideologues and preachers for political ideology and a social media hate speech corpus for hate. Our study makes three contributions to reliable analysis: (i) Development of a computational approach rooted in the contextual dimensions of religion, ideology, and hate that reflects strategies employed by online Islamist extremist groups, (ii) An in-depth analysis of relevant tweet datasets with respect to these dimensions to exclude likely mislabeled users, and (iii) A framework for understanding online radicalization as a process to assist counter-programming. Given the potentially significant social impact, we evaluate the performance of our algorithms to minimize mislabeling, where our approach outperforms a competitive baseline by 10.2% in precision.
연구 동기 및 목표
- 소셜 미디어에서 종교적 언어가 종종 급진주의 이데올로기에 악용되는 바, 이슬람 급진주의자 사용자를 정확하게 식별하는 데 도전하는 것.
- 급진주의 커뮤니케이션에서 맥락의 모호성과 의미적 희박성에 대응하지 못하는 기존 분류 방법의 한계를 극복하는 것.
- 종교, 이데올로기, 증오를 통해 온라인 라디칼리제이션의 점진적이고 설득적인 과정을 모델링하는 강력한 다차원 프레임워크를 개발하는 것.
- 도메인 특화 지식 자원과 맥락적 신호를 통합함으로써 비급진주의자 사용자에 대한 잘못된 레이블링을 줄이는 것.
- 급진주의 서사가 라디칼리제이션의 다양한 단계에서 어떻게 진화하는지 정밀한 이해를 제공함으로써 효과적인 반라디칼리제이션 프로그램을 지원하는 것.
제안 방법
- 연구는 세 가지 도메인 특화 지식 자원을 구축한다: 종교를 위한 쿠르아ーン, 급진주의 이데올로그들의 저작물, 사회적 미디어 증오 발언 코퍼스.
- 사용자 콘텐츠를 종교, 이데올로기, 증오의 세 가지 맥락적 차원으로 모델링하며, 각각을 분류를 위한 별개의 특징 공간으로 간주한다.
- 이 방법은 레이블이 부여된 트윗 데이터셋을 기반으로 한 감독 학습 기반 기계 학습을 활용하며, 랜덤 포레스트(RF) 및 나이브 베이즈(NB) 분류기를 사용한다.
- 특징 공학에는 종교적, 이데올로기적, 증오적 표현의 의미적 뉘앙스를 포착하기 위해 도메인 특화 코퍼스에서 유도된 맥락 기반 임bedding을 포함한다.
- 성능 평가에는 정밀도, 재현율, F1 점수, AUC를 사용하며, 다차원 모델과 단일 차원 기준 모델을 비교한다.
- 제외 전략은 세 가지 맥락적 차원 간 일관성 없는 정렬을 보이는 사용자를 잘못 레이블링된 것으로 간주하고 제거한다.
실험 결과
연구 질문
- RQ1종교, 이데올로기, 증오는 소셜 미디어에서 이슬람 급진주의 커뮤니케이션에서 어떻게 별개이면서도 상호 연관된 차원으로 작용하는가?
- RQ2다양한 맥락적 차원을 통합할 경우, 단일 차원 접근 방식에 비해 급진주의 사용자 분류의 정밀도와 신뢰성은 얼마나 향상되는가?
- RQ3종교, 이데올로기, 증오의 상대적 기여도는 온라인 라디칼리제이션의 다양한 단계에서 어떻게 변화하는가?
- RQ4맥락 인식 모델은 종교적 언어를 사용하지만 급진주의 의도가 없는 비급진주의자 사용자에 대한 잘못된 분류를 줄일 수 있는가?
- RQ5기존 기준 방법에 비해 다차원 모델링은 트위터에서 급진주의 콘텐츠 탐지에 있어 얼마나 높은 성능 향상을 이룰 수 있는가?
주요 결과
- 삼차원 모델은 기준 모델 대비 정밀도에서 10.2% 향상되어 비급진주의자 사용자에 대한 잘못된 레이블링 위험을 크게 줄였다.
- 종교와 증오를 조합한 이차원 모델(RH)이 AUC 0.90을 기록하며 삼차원 모델과 다른 이차원 모델을 모두 앞섰다.
- 삼차원 랜덤 포레스트 모델은 거짓 경고율(FPR) 0.65일 때 진짜 양성률(TPR) 0.93에 도달하여 높은 정밀도 제약 조건 하에서도 뛰어난 성능을 보였다.
- 세 차원 모두 포함 시켰을 경우 전체 성능이 가장 우수했으며, 기준 모델 대비 재현율은 8.5% 향상되고 F1 점수는 10.7% 향상되었다.
- 삼차원 나이브 베이즈 모델의 ROC 곡선은 FPR 0.83일 때 TPR 1.0으로 수렴했고, 이차원 모델은 FPR 0.97일 때 TPR 1.0에 도달하여 정밀도에서 9.8% 향상된 것으로 나타났다.
- 종교적 언어와 증오 언어는 이데올로기 자체보다 더 강력한 분류 기준으로 밝혀졌으며, 이는 급진주의 정당화 서사에서 빈번한 공존을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.