Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Troll Behavior via Inverse Reinforcement Learning: A Case Study of Russian Trolls in the 2016 US Election

Luca Luceri, Silvia Giordano|arXiv (Cornell University)|2020. 01. 28.
Spam and Phishing Detection인용 수 18
한 줄 요약

이 논문은 2016년 미국 선거 기간 동안 러시아 토글 계정을 탐지하기 위해 관찰된 온라인 행동의 배경이 되는 동기를 추론하는 역강화학습(IRL) 접근법을 제안한다. 이 방법은 활동 흐름 데이터만을 사용하여 89.1%의 AUC를 달성하며, 사용자 피드백과 무관한 콘텐츠 공유와 같은 특징적인 동기 패턴을 드러낸다.

ABSTRACT

Since the 2016 US Presidential election, social media abuse has been eliciting massive concern in the academic community and beyond. Preventing and limiting the malicious activity of users, such as trolls and bots, in their manipulation campaigns is of paramount importance for the integrity of democracy, public health, and more. However, the automated detection of troll accounts is an open challenge. In this work, we propose an approach based on Inverse Reinforcement Learning (IRL) to capture troll behavior and identify troll accounts. We employ IRL to infer a set of online incentives that may steer user behavior, which in turn highlights behavioral differences between troll and non-troll accounts, enabling their accurate classification. As a study case, we consider the troll accounts identified by the US Congress during the investigation of Russian meddling in the 2016 US Presidential election. We report promising results: the IRL-based approach is able to accurately detect troll accounts (AUC=89.1%). The differences in the predictive features between the two classes of accounts enables a principled understanding of the distinctive behaviors reflecting the incentives trolls and non-trolls respond to.

연구 동기 및 목표

  • 최근 봇 탐지 기술의 발전에도 불구하고 여전히 식별이 어려운 인간이 운영하는 토글 계정을 탐지하는 데 있어 열려 있는 과제를 해결하기 위해.
  • 사용자 활동 흐름과 상호작용을 분석하여 토글 행동을 이끄는 배경적인 동기를 모델링하기 위해.
  • 라벨이 부여된 신원 정보나 외부 메타데이터에 의존하지 않고도 관찰 가능한 온라인 행동만을 사용하여 일반화 가능하고 해석 가능한 방법을 개발하기 위해.
  • 악성 영향력 캠페인을 체계적으로 탐지할 수 있도록 토글 사용자와 일반 사용자 간의 동기적 차이에 대한 통찰을 제공하기 위해.
  • IRL 기반 행동 모델링을 바탕으로 정치, 건강, 사회 분야 등 다양한 분야에서 국가 지원 토글을 탐지할 수 있는 기반을 마련하기 위해.

제안 방법

  • 관찰된 사용자 행동의 배경이 되는 보상 함수를 추론하기 위해 역강화학습(IRL)을 활용하여 특정 행동을 이끄는 동기가 무엇인지 모델링하기 위해.
  • 유추된 보상 구조를 감독 분류를 위한 행동 특징으로 사용하여 토글 계정과 비토글 계정을 분류하기 위해.
  • 상호작용 역학과 피드백 민감도를 포착하기 위해 온라인 행동 시퀀스(예: 재트윗, 댓글, 좋아요)를 기반으로 IRL 모델을 훈련하기 위해.
  • 미국 의회에서 러시아의 인터넷 연구 아카데미(IRA)와 관련이 있는 것으로 확인한 2,752개의 트위터 계정 데이터셋을 IRL 프레임워크에 적용하기 위해.
  • 추정된 보상 값을 이진 분류기의 입력 특징으로 사용하여 토글 계정과 유기적 사용자 행동을 구분하기 위해.
  • 특정 동기와 연결된 탐지된 행동 패턴을 통해 모델의 해석 가능성을 확보하여 eXplainable AI(XAI) 원칙을 준수하기 위해.

실험 결과

연구 질문

  • RQ1역강화학습(IRL)이 소셜 미디어에서 토글 행동을 이끄는 숨겨진 동기를 효과적으로 드러낼 수 있는가?
  • RQ2토글 계정의 유추된 동기적 구조는 일반 사용자와 어떻게 다를까?
  • RQ3IRL 기반 행동 특징이 활동 흐름 데이터만을 사용해 국가 지원 토글 계정을 높은 정확도로 분류하는 데 성공할 수 있는가?
  • RQ4일반 사용자에 비해 토글 사용자는 사회적 피드백(예: 좋아요, 재트윗)에 얼마나 민감하게 반응하는가?
  • RQ5IRL 기반 접근법은 다양한 플랫폼과 악성 온라인 행동 유형에 일반화 가능한가?

주요 결과

  • IRL 기반 접근법은 활동 흐름 데이터만을 사용하여 러시아 토글 계정과 비토글 계정을 구분하는 데 89.1%의 AUC를 달성했다.
  • 토글 계정은 사용자 피드백(예: 재트윗, 좋아요)과 무관하게 행동하는 경향을 보이며, 참여도보다 콘텐츠 배포에 집중하고 있음을 시사한다.
  • 토글 사용자는 상호작용 결과에 관계없이 일관되게 콘텐츠를 공유하는 패턴을 보이며, 전략적이고 동기 기반의 배포 모델을 취하고 있음을 나타낸다.
  • 유추된 보상 함수는 토글 사용자와 일반 사용자 간의 행동 차이를 드러내었으며, 특히 사회적 피드백과 상호작용 역학에 대한 반응에서 뚜렷한 차이를 보였다.
  • 클릭스트림 기반 모델은 토글 계정과 일반 사용자를 구분하지 못했으며, 기존 행동 클러스터링 접근법의 한계를 보여주었다.
  • IRL 모델은 악성 계정을 탐지하기 위해 그들의 배경 동기를 드러내는 해석 가능하고 일반화 가능한 프레임워크를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.