Skip to main content
QUICK REVIEW

[논문 리뷰] Using Twitter Data to Determine Hurricane Category: An Experiment

Songhui Yue, Jyothsna Kondari|arXiv (Cornell University)|2023. 08. 10.
Public Relations and Crisis Communication참고 문헌 8인용 수 5
한 줄 요약

이 연구는 허리케인 하비와 이브라 동안 발생한 지리적 태그가 부착된 트위터 트윗을 분석하여 허리케인 카테고리를 예측하기 위해 트위터 데이터를 사용하는 것을 제안한다. 레이블이 부여된 트윗 데이터에 Word2Vec과 Bag-of-Words를 적용하여, 소셜 미디어 활동과 실제 허리케인 강도 사이에 중간 정도의 양의 상관관계를 확인하였으며, 공개 소셜 미디어 콘텐츠를 활용한 실시간 재해 심각도 추정의 타당한 방법을 입증한다.

ABSTRACT

Social media posts contain an abundant amount of information about public opinion on major events, especially natural disasters such as hurricanes. Posts related to an event, are usually published by the users who live near the place of the event at the time of the event. Special correlation between the social media data and the events can be obtained using data mining approaches. This paper presents research work to find the mappings between social media data and the severity level of a disaster. Specifically, we have investigated the Twitter data posted during hurricanes Harvey and Irma, and attempted to find the correlation between the Twitter data of a specific area and the hurricane level in that area. Our experimental results indicate a positive correlation between them. We also present a method to predict the hurricane category for a specific area using relevant Twitter data.

연구 동기 및 목표

  • 소셜 미디어 활동과 허리케인 카테고리 심각도 사이의 상관관계를 조사하는 것.
  • 실시간 트위터 데이터를 사용하여 허리케인 카테고리를 예측하는 모델을 개발하는 것.
  • 향후 연구를 위해 레이블이 부여된 허리케인 관련 트윗 데이터셋을 제작하고 공개하는 것.
  • Word2Vec과 Bag-of-Words와 같은 자연어 처리 기법이 재해 심각도 예측에 얼마나 효과적인지 평가하는 것.
  • 예측 정확도에 영향을 미치는 요소들, 예를 들어 지역별 언어 및 트윗 수와 같은 요소들을 탐색하는 것.

제안 방법

  • 2017년 8월 17일부터 9월 16일까지의 지리적 태그가 부착된 트위터 데이터 1개월 분량을 수집(해시태그 #Harvey 또는 #Irma 포함).
  • 지역적 위치와 해당 허리케인 카테고리(예: 1–5급)에 따라 트윗을 필터링하고 주석을 붙임.
  • 텍스트 표현을 위해 Word2Vec과 Bag-of-Words(BOW)를 사용하여 벡터 표현을 생성함.
  • 트윗 벡터에서 허리케인 카테고리를 예측하기 위해 다수의 분류 알고리즘을 적용함.
  • 모델 성능 평가를 위해 교차 검증과 별도의 테스트 세트를 사용함.
  • 지역별 용어(예: '텍사스', '플로리다')를 제거했을 때 예측 정확도에 미치는 영향을 탐색함.

실험 결과

연구 질문

  • RQ1트위터 데이터의 양과 허리케인 강도 사이에 통계적으로 유의미한 상관관계가 존재하는가?
  • RQ2소셜 미디어 데이터를 사용하여 특정 지리적 지역의 허리케인 카테고리를 예측할 수 있는가?
  • RQ3다른 자연어 처리 특징 추출 방법(Word2Vec 대비 BOW)이 예측 정확도에 어떤 영향을 미치는가?
  • RQ4지역별 키워드가 교차 허리케인 예측에 얼마나 간섭하는가?
  • RQ5신뢰할 수 있는 카테고리 예측을 달성하기 위해 필요한 최소 트윗 수는 얼마인가?

주요 결과

  • 허리케인 하비와 이브라의 실제 카테고리와 트윗의 양과 정서 사이에 중간 정도의 양의 상관관계가 발견됨.
  • 교차 허리케인 예측이 아닌 내부 허리케인 교차 검증을 사용할 경우 예측 정확도가 크게 향상됨.
  • 지역별 용어(예: '로크포트', '플로리다')의 존재가 모델의 일반화 능력을 저하시켜, 이러한 용어를 필터링할 필요가 있음을 시사함.
  • Word2Vec 기반 벡터가 허리케인 심각도와 관련된 의미 관계를 BOW보다 더 잘 포착함.
  • 예측 성능은 지역별 트윗 수에 민감하게 반응하여, 신뢰할 수 있는 추론을 위해 최소 기준치를 설정할 필요가 있음을 시사함.
  • 연구팀은 공개 재사용을 위해 위치와 카테고리로 주석이 부여된 188,721건의 허리케인 관련 트윗으로 구성된 레이블이 부여된 데이터셋을 공개함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.