[논문 리뷰] Who Falls for Online Political Manipulation?
이 연구는 2016년 미국 선거 기간 동안 러시아 토르트 콘텐츠를 퍼뜨릴 수 있는 사용자를 예측하기 위해 기계학습 모델을 개발한다. 정치적 이념, 봇 가능성 점수, 사용자 활동 지표를 활용하여 퍼트리기 쉬운 사용자를 식별하는 데 96% AUC를 달성했으며, 이는 이러한 특징이 온라인 정치적 조작에 취약함을 매우 잘 예측할 수 있음을 보여준다.
Social media, once hailed as a vehicle for democratization and the promotion of positive social change across the globe, are under attack for becoming a tool of political manipulation and spread of disinformation. A case in point is the alleged use of trolls by Russia to spread malicious content in Western elections. This paper examines the Russian interference campaign in the 2016 US presidential election on Twitter. Our aim is twofold: first, we test whether predicting users who spread trolls' content is feasible in order to gain insight on how to contain their influence in the future; second, we identify features that are most predictive of users who either intentionally or unintentionally play a vital role in spreading this malicious content. We collected a dataset with over 43 million elections-related posts shared on Twitter between September 16 and November 9, 2016, by about 5.7 million users. This dataset includes accounts associated with the Russian trolls identified by the US Congress. Proposed models are able to very accurately identify users who spread the trolls' content (average AUC score of 96%, using 10-fold validation). We show that political ideology, bot likelihood scores, and some activity-related account meta data are the most predictive features of whether a user spreads trolls' content or not.
연구 동기 및 목표
- 러시아 토르트 콘텐츠를 퍼뜨리는 사용자를 그들이 퍼뜨리기 전에 예측할 수 있는가를 조사하기 위해.
- 의도적으로 또는 무의식적으로 악성 정치 콘텐츠를 퍼뜨리는 사용자를 구분하는 데 가장 예측력 있는 특징을 특정하기 위해.
- 소셜 미디어에서 가짜 정보의 확산을 완화하기 위한 조기 경고 시스템 개발을 지원하기 위해.
- 정치적 이념, 봇 행동, 사용자 활동이 조작에 취약함에 미치는 영향을 이해하기 위해.
제안 방법
- 2016년 9월 16일부터 11월 9일까지 570만 명의 사용자로부터 4,300만 건의 선거 관련 트윗을 키워드 및 해시태그 기반의 트위터 API 쿼리를 통해 수집하였다.
- 미국 의회가 제공한 221개의 러시아 토르트 계정 목록과 데이터셋을 대조하여 그들이 게시한 콘텐츠를 식별하였다.
- 정치적 이념, 팔로워 수, 트윗 수, 봇 가능성 점수 등의 사용자 수준 특징을 기반으로 기울기 부스팅 등 여러 기계학습 분류기 모델을 훈련시켰다.
- 모델 성능 평가를 위해 10겹 교차검증을 사용하였으며, 주요 평가 지표로는 수치적 영역 아래 면적(AUC)을 사용하였다.
- 정치적 이념과 봇 점수와 같은 특징의 중요도와 모델 행동을 해석하기 위해 부분 의존 분석을 실시하였다.
- 균형 잡힌 부분집합과 전체 데이터셋 모두에서 결과를 검증하였으며, 결측치가 있는 경우도 포함하여 정확도를 확보하였다.
실험 결과
연구 질문
- RQ12016년 미국 선거 기간 동안 러시아 토르트 콘텐츠를 퍼뜨릴 수 있는 사용자를 예측할 수 있는가?
- RQ2사용자 수준의 특징 중에서 러시아 토르트 콘텐츠를 퍼뜨릴 가능성을 가장 잘 예측하는 것은 무엇인가?
- RQ3정치적 이념, 봇 행동, 사용자 활동 수준이 조작에 취약함에 미치는 영향은 어떠한가?
- RQ4기계학습 모델이 토르트 콘텐츠를 퍼뜨리는 사용자와 그렇지 않은 사용자를 얼마나 잘 구분할 수 있는가?
주요 결과
- 모델은 기울기 부스팅을 사용하여 전체 특징 세트를 활용할 경우, 러시아 토르트 콘텐츠를 퍼뜨리는 사용자와 그렇지 않은 사용자를 식별하는 데 평균 AUC 점수가 96%에 도달하였다.
- 정치적 이념이 가장 예측력 있는 특징였으며, 보수 성향을 가진 사용자가 토르트 콘텐츠를 더 많이 퍼뜨릴 가능성이 높았다.
- 봇 가능성 점수와 사용자 활동 지표(예: 트윗 수, 팔로워 수)는 상위 예측 특징에 속했다.
- 토르트 콘텐츠를 퍼뜨리는 사용자들은 일반적으로 활동성이 높았고(많은 트윗을 게재함), 봇 가능성 점수가 높았으며, 더 보수적이었지만, 원본 게시물 수와 팔로워 수는 적은 편이었다.
- 결측치가 있는 행을 제외한 경우를 포함하여 전체 데이터셋에서도 모델 성능이 높게 유지되었으며(90% 이상 AUC), 이는 모델의 강건성을 보여주었다.
- 부분 의존도 플롯은 정치적 이념이 모델 예측에 가장 강한 영향을 미쳤으며, 그 다음으로 팔로워 수와 계정 연수가 영향을 미쳤음을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.