Skip to main content
QUICK REVIEW

[논문 리뷰] Analysis of Social Media Data using Multimodal Deep Learning for Disaster Response

Ferda Ofli, Firoj Alam|arXiv (Cornell University)|2020. 04. 14.
Public Relations and Crisis Communication참고 문헌 31인용 수 69
한 줄 요약

본 논문은 트위터 텍스트와 첨부 이미지를 융합한 다중 모달 딥러닝 아키텍처를 제안하여 CrisisMMD의 재난 대응 분류 태스크를 개선하고 단일 모달 기준선을 능가한다.

ABSTRACT

Multimedia content in social media platforms provides significant information during disaster events. The types of information shared include reports of injured or deceased people, infrastructure damage, and missing or found people, among others. Although many studies have shown the usefulness of both text and image content for disaster response purposes, the research has been mostly focused on analyzing only the text modality in the past. In this paper, we propose to use both text and image modalities of social media data to learn a joint representation using state-of-the-art deep learning techniques. Specifically, we utilize convolutional neural networks to define a multimodal deep learning architecture with a modality-agnostic shared representation. Extensive experiments on real-world disaster datasets show that the proposed multimodal architecture yields better performance than models trained using a single modality (e.g., either text or image).

연구 동기 및 목표

  • 소셜 미디어로부터 텍스트 및 시각적 신호를 모두 활용하여 견고한 재난 대응 분석의 동기를 제시한다.
  • 다중 모달 융합이 텍스트 또는 이미지 단일 모델보다 더 나은 예측을 제공하는지 조사한다.
  • CrisisMMD에서 정보성(informativeness) 및 인도적 분류(humanitarian categorization)라는 두 가지 태스크에 대해 다중 모달 및 단일 모달의 기준선을 제공한다.
  • 다중 모달 재난 데이터 분석의 도전과제와 향후 방향을 탐구한다.

제안 방법

  • 텍스트와 이미지를 위한 두 개의 평행 네트워크를 구성한다: 사전 학습된 word2vec 임베딩을 사용하는 CNN 기반 텍스트 모델과 ImageNet에서 사전 학습된 VGG16 기반 이미지 모델.
  • 다중 필터 크기와 맥스풀링이 있는 5계층 CNN에서 고수준 텍스트 특징을 추출하고, 이어서 밀집층(dense layers)을 사용한다.
  • 작업 특화 소프트맥스용으로 수정된 최종 계층을 포함한 VGG16의 penultimate fc2 특징에서 이미지 특징을 추출한다.
  • 두 모달리티의 1,000차원 은닉 표현을 연결(concatenating)하여 공유 표현을 생성하고, 그 뒤에 예측을 위한 밀집층과 소프트맥스를 적용한다.
  • 세 가지 설정을 학습한다: (i) 텍스트-단일, (ii) 이미지-단일, (iii) 다중 모달(텍스트+이미지); 고정된 테스트 세트에서 평가한다.
  • Adam 최적화기, 이른 중지(얼리 스토핑), 텍스트 및 이미지 데이터에 대한 일반 전처리(preprocessing)를 사용한다.

실험 결과

연구 질문

  • RQ1다중 모달 표현이 단일 모달 접근법보다 재난 관련 소셜 미디어의 정보성 분류를 개선할 수 있는가?
  • RQ2다중 모달 모델이 텍스트-단일 또는 이미지-단일 모델보다 인도적 분류를 개선할 수 있는가?
  • RQ3 CrisisMMD 데이터셋의 두 가지 태스크에 대해 다중 모달 융합의 비교 이득은 무엇인가?
  • RQ4소셜 미디어 게시물에서 텍스트와 이미지 데이터가 서로 충돌하는 신호를 정렬하는 데 어떤 도전이 발생하는가?

주요 결과

  • 다중 모달 모델은 정보성에서 F1=84.2를 달성하여 텍스트 단일(80.9) 및 이미지 단일(83.2)을 모두 상회한다.
  • 인도적 분류에서 다중 모달 모델은 F1=78.3으로 텍스트 단일(67.7) 및 이미지 단일(76.3)을 능가한다.
  • 이미지 단일 모델은 일반적으로 두 태스크에서 텍스트 단일 모델을 능가하지만, 다중 모달 융합은 이미지 단일 기준선 대비 정보성에서 약 1%, 인도적에서 약 2%의 추가 이득을 제공한다.
  • CrisisMMD에서의 학습은 두 태스크에 대해 단일 모달 및 다중 모달의 기준선 결과를 하나의 연구에서 제공한다.
  • 저자들은 더 크고 더 최적화된 아키텍처와 더 풍부한 융합 전략으로 개선의 여지가 크다고 언급한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.