Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Social Media Analysis for Gang Violence Prevention

Philipp Blandfort, Desmond U. Patton|arXiv (Cornell University)|2018. 07. 23.
Hate Speech and Cyberbullying Detection인용 수 11
한 줄 요약

이 논문은 시카고의 가담된 청소년들이 올린 소셜미디어 게시물에서 정서적 위기, 상실, 약물 사용과 같은 정서사회적 코드를 다중모달 기반으로 탐지하기 위한 접근법을 제안한다. 텍스트와 이미지 양 모달리티를 융합함으로써 단일 모달리티 모델 대비 평균 평균 정밀도에서 18%의 상대적 향상을 달성하여, 폭력 예방을 위한 조기 간병에 다중모달 분석의 가치를 입증한다.

ABSTRACT

Gang violence is a severe issue in major cities across the U.S. and recent studies [Patton et al. 2017] have found evidence of social media communications that can be linked to such violence in communities with high rates of exposure to gang activity. In this paper we partnered computer scientists with social work researchers, who have domain expertise in gang violence, to analyze how public tweets with images posted by youth who mention gang associations on Twitter can be leveraged to automatically detect psychosocial factors and conditions that could potentially assist social workers and violence outreach workers in prevention and early intervention programs. To this end, we developed a rigorous methodology for collecting and annotating tweets. We gathered 1,851 tweets and accompanying annotations related to visual concepts and the psychosocial codes: aggression, loss, and substance use. These codes are relevant to social work interventions, as they represent possible pathways to violence on social media. We compare various methods for classifying tweets into these three classes, using only the text of the tweet, only the image of the tweet, or both modalities as input to the classifier. In particular, we analyze the usefulness of mid-level visual concepts and the role of different modalities for this tweet classification task. Our experiments show that individually, text information dominates classification performance of the loss class, while image information dominates the aggression and substance use classes. Our multimodal approach provides a very promising improvement (18% relative in mean average precision) over the best single modality approach. Finally, we also illustrate the complexity of understanding social media data and elaborate on open challenges.

연구 동기 및 목표

  • 시카고의 가담된 청소년들로부터 공개된 트윗(이미지 포함)을 체계적으로 수집하고 주석을 달기 위한 프레임워크를 개발한다.
  • 사회사업 간병 및 폭력으로 이어지는 경로에 관련된 정서사회적 코드(폭력, 상실, 약물 사용)를 식별하고 주석을 달기 위한 목표를 설정한다.
  • 텍스트 전용, 이미지 전용, 다중모달 접근법의 정밀도를 평가하여 정서사회적 코드 분류 성능을 비교한다.
  • 중위 수준의 시각적 개념과 각 모달리티의 기여도가 분류 성능 향상에 기여하는 방식을 분석한다.
  • 개인식별자 제거, 데이터 암호화, 지역 사회 전문가의 검증 참여를 통해 윤리적인 데이터 처리를 확보한다.

제안 방법

  • 시카고의 가담된 청소년들로부터 1,851건의 공개 트윗(텍스트 및 관련 이미지 포함)을 수집하였다.
  • 사회사업 연구자 및 전문가 팀이 정서사회적 코드(폭력, 상실, 약물 사용)와 시각적 개념을 주석 처리하였다.
  • 딥 러닝 기반의 시각적 및 텍스트적 특징 추출 모델을 활용하여 텍스트 전용, 이미지 전용, 또는 양 모달리티를 모두 사용하는 분류기 모델을 훈련하고 비교하였다.
  • 지역적 시각적 개념(예: 손짓, 무기, 약물 관련 기구)을 글로벌 이미지 특징과 융합하여 폭력 및 약물 사용 탐지 성능을 향상시켰다.
  • 텍스트와 이미지 예측 결과를 융합하는 다중모달 융합 전략을 적용하여 전체 분류 성능을 향상시켰다.
  • 문화적 맥락과 상징적 제스처에 대한 이해 부족으로 발생하는 주석 불일치 문제를 해결하기 위해 도메인 전문가와의 반복 검증 절차를 수행하였다.

실험 결과

연구 질문

  • RQ1정서사회적 코드—폭력, 상실, 약물 사용—은 가담된 청소년들의 다중모달 소셜미디어 콘텐츠에서 어떻게 나타나는가?
  • RQ2각 정서사회적 코드 탐지에 있어 텍스트와 이미지 모달리티의 상대적 기여도는 어떠한가?
  • RQ3중위 수준의 시각적 개념은 트윗에서 폭력 및 약물 사용 탐지에 얼마나 기여하는가?
  • RQ4다중모달 융합 기반 접근법은 단일 모달리티 기반 접근법보다 정서사회적 코드 분류에 있어 어떻게 비교되는가?
  • RQ5고폭력 지역 사회의 문화적으로 뉘앙스가 농후한 소셜미디어 콘텐츠 주석 처리 및 해석 과정에서의 주요 과제는 무엇인가?

주요 결과

  • 상실 코드 탐지에서는 텍스트 전용 분류가 이미지 전용 분류를 뛰어넘었으며, 이는 정서적 고통 탐지에 있어 텍스트적 신호가 더 신뢰할 수 있음을 시사한다.
  • 폭력 및 약물 사용 탐지에서는 이미지 전용 분류가 텍스트 전용 분류를 뛰어넘었으며, 이는 폭력적 또는 위험한 행동 탐지에 있어 시각적 신호가 더 정보가 많음을 보여준다.
  • 다중모달 융합 기반 접근법은 최고의 단일 모달리티 방법 대비 평균 평균 정밀도에서 18%의 상대적 향상을 달성하여 두 모달리티 간 강력한 상호보완성이 있음을 입증한다.
  • 주석자 간 및 주석자와 도메인 전문가 간의 불일치는 주로 문화적 지식 부족—특히 가담된 조직의 정체성, 지역적 랜드마크, 상징적 손짓에 대한 이해 부족—으로 인해 발생하였다.
  • 도메인 전문가의 상징적 제스처(예: 모욕을 나타내는 특정 손짓) 이해가 폭력성 평가에 상당한 영향을 미쳐, 맥락 기반 전문 지식의 중요성을 입증하였다.
  • 강력한 성능 향상에도 불구하고 자동 분류 기술은 여전히 문화적 뉘앙스에 의해 제한되며, 주석 처리 및 검증 과정에서 인간 전문가의 역할이 대체 불가능함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.