[논문 리뷰] Detecting Radical Text over Online Media using Deep Learning
이 논문은 레이블이 부여된 텍스트 61,601건(극단주의, 비극단주의, 무관)으로 구성된 데이터셋을 사용하여 온라인 미디어에서 극단주의 콘텐츠를 탐지하기 위해 LSTM 기반 딥러닝 모델을 제안한다. 이 방법은 극단주의 콘텐츠 분류에서 85.9%의 정밀도를 달성하여 SVM 및 랜덤 포레스트와 같은 전통적인 기계학습 방법을 뛰어넘으며, 대규모로 극단주의 텍스트를 식별하는 데 딥러닝의 효과성을 입증한다.
Social Media has influenced the way people socially connect, interact and opinionize. The growth in technology has enhanced communication and dissemination of information. Unfortunately,many terror groups like jihadist communities have started consolidating a virtual community online for various purposes such as recruitment, online donations, targeting youth online and spread of extremist ideologies. Everyday a large number of articles, tweets, posts, posters, blogs, comments, views and news are posted online without a check which in turn imposes a threat to the security of any nation. However, different agencies are working on getting down this radical content from various online social media platforms. The aim of our paper is to utilise deep learning algorithm in detection of radicalization contrary to the existing works based on machine learning algorithms. An LSTM based feed forward neural network is employed to detect radical content. We collected total 61601 records from various online sources constituting news, articles and blogs. These records are annotated by domain experts into three categories: Radical(R), Non-Radical (NR) and Irrelevant(I) which are further applied to LSTM based network to classify radical content. A precision of 85.9% has been achieved with the proposed approach
연구 동기 및 목표
- 소셜미디어 플랫폼에서 ISIS 및 지하드 이슬람주의 공동체와 같은 극단주의 단체의 온라인 급성장하는 급성장 위협을 다루기 위해.
- 전통적인 기계학습 방법이 극단주의 텍스트의 의미적 뉘앙스를 포착하는 데 한계가 있음을 극복하기 위해 딥러닝을 활용하기 위해.
- 뉴스, 블로그, 소셜미디어 게시물에서 극단주의 콘텐츠를 자동으로 탐지하고 확장 가능한 시스템을 개발하기 위해.
- 워드 임베딩을 활용한 장기 기억 순환 신경망을 통해 기존 기술을 뛰어넘는 분류 정확도를 향상시키기 위해.
- 소셜미디어 플랫폼 및 보안 기관이 극단주의 콘텐츠를 사전에 식별하고 제거하는 데 지원하기 위해.
제안 방법
- 연구는 극단주의 콘텐츠 탐지에 적합한 순차적 의존성을 모델링하기 위해 LSTM 기반 피드포워드 신경망을 사용한다.
- 텍스트 입력을 표현하기 위해 워드 임베딩을 사용하여 수동적 특징 공학 없이 의미적 표현을 학습할 수 있도록 한다.
- 뉴스, 기사, 블로그에서 수집한 61,601건의 기록을 도메인 전문가가 세 가지 클래스로 분류한 데이터셋을 확보했다: 극단주의(R), 비극단주의(NR), 무관(I).
- 성능 평가를 위해 정밀도, 재현율, F-점수, 카파 계수를 사용하며, 훈련-테스트 세트 비율(예: 80:20)을 다양하게 설정해 모델을 훈련시켰다.
- 기존의 기계학습 방법과의 성능 비교를 위해 텀-문서 행렬을 사용한 SVM, 랜덤 포레스트, 최대 엔트로피(MaxEnt) 분류기와의 비교를 수행했다.
- 예측 안정성과 모델 수렴 여부 평가를 위해 테스트 중 평균 제곱오차(MSE)를 모니터링했다.
실험 결과
연구 질문
- RQ1LSTM 기반 딥러닝 모델은 기존 기계학습 알고리즘보다 온라인 텍스트에서 극단주의 콘텐츠 탐지에 더 뛰어난 성능을 보일 수 있는가?
- RQ2워드 임베딩과 순차적 모델링의 통합이 극단주의 텍스트 탐지의 분류 정확도를 어떻게 향상시키는가?
- RQ3극단주의 텍스트 분류에서 모델 일반화와 과적합 방지를 균형 잡기 위해 최적의 훈련 세트 비율은 무엇인가?
- RQ4의미가 모호하거나 다수의 시각이 혼합된 텍스트를 처리할 경우 모델의 성능은 어떻게 저하되는가?
- RQ5다양한 종류의 무관한 콘텐츠가 존재할 경우 다중 클래스 분류에서 모델의 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 LSTM 기반 모델은 극단주의 콘텐츠 분류에서 85.96%의 정밀도를 기록하여 SVM(53.50%), 랜덤 포레스트(73.50%), MaxEnt(69.50%)를 뛰어넘었다.
- 모델은 카파 계수 0.796을 기록하여 전문가 앙케이트자 간의 상당한 일치도를 보였다.
- 80:20 훈련-테스트 세트 비율에서 최대 정확도 73.44%를 기록했으며, 이 비율을 초월하면 과적합 현상이 관찰되었다.
- 3개 클래스 분류(R, NR, I)에서는 정확도가 34.23%로 떨어졌으며, 주로 '무관' 카테고리의 높은 이질성과 모호성 때문이었다.
- 테스트 중 평균 제곱오차(MSE) 곡선은 안정적인 예측 행동을 보여주어 극단주의 콘텐츠에 대한 일관된 모델 성능을 확인했다.
- 보안 민감한 응용 분야에서 거짓 경고를 최소화하는 데 중요한 정밀도 측정치에서 모델가 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.