[論文レビュー] Using Twitter Data to Determine Hurricane Category: An Experiment
本研究では、ハリーベイおよびアイルマハリケーン発生時における位置タグ付きツイートを分析することで、ツイッターのデータを用いてハリケーンのカテゴリを予測する手法を提案する。ラベル付きツイートデータにWord2VecおよびBag-of-Wordsを適用した結果、ソーシャルメディア活動と実際のハリケーンの強度の間に中程度の正の相関が確認され、公開のソーシャルメディアコンテンツを用いたリアルタイムでの災害深刻度推定の有効な手法であることが示された。
Social media posts contain an abundant amount of information about public opinion on major events, especially natural disasters such as hurricanes. Posts related to an event, are usually published by the users who live near the place of the event at the time of the event. Special correlation between the social media data and the events can be obtained using data mining approaches. This paper presents research work to find the mappings between social media data and the severity level of a disaster. Specifically, we have investigated the Twitter data posted during hurricanes Harvey and Irma, and attempted to find the correlation between the Twitter data of a specific area and the hurricane level in that area. Our experimental results indicate a positive correlation between them. We also present a method to predict the hurricane category for a specific area using relevant Twitter data.
研究の動機と目的
- ソーシャルメディア活動とハリケーンのカテゴリ深刻度の相関関係を調査すること。
- リアルタイムのツイッターのデータを用いてハリケーンカテゴリを予測するモデルを構築すること。
- 今後の研究のためのラベル付きハリケーン関連ツイートデータセットの作成および公開すること。
- 自然言語処理技術(例:Word2VecおよびBag-of-Words)が災害深刻度予測に与える有効性を評価すること。
- 予測精度に影響を与える要因(例:地域特有の言語、ツイート数)を検討すること。
提案手法
- 2017年8月17日から9月16日までの1か月間の位置タグ付きツイッターのデータを収集(ハッシュタグ#Harveyまたは#Irmaを含む)。
- 地理的場所および対応するハリケーンカテゴリ(例:1〜5クラス)に基づいてツイートをフィルタリングおよびラベル付けした。
- テキスト表現のためのベクトル表現をWord2VecおよびBag-of-Words(BOW)を用いて生成した。
- ツイートベクトルからハリケーンカテゴリを予測する複数の分類アルゴリズムを適用した。
- モデルのパフォーマンスを評価するために交差検証およびホールドアウトテストセットを用いた。
- 地域特有の語彙(例:'Texas'、'Florida')を削除した場合の予測精度への影響を検討した。
実験結果
リサーチクエスチョン
- RQ1ツイッターのデータ量とハリケーンの強度との間に統計的に有意な相関があるか?
- RQ2ソーシャルメディアデータを用いて特定の地理的地域におけるハリケーンのカテゴリを予測できるか?
- RQ3異なる自然言語処理特徴抽出手法(Word2Vec対BOW)が予測精度に与える影響は何か?
- RQ4地域特有のキーワードが、ハリケーン間予測にどの程度干渉するか?
- RQ5信頼性のあるカテゴリ予測を達成するために必要なツイートの最小数は何か?
主な発見
- ハリケーン・ハリーベイおよびアイルマにおいて、ツイートの件数および感情分析の結果と、実際のハリケーンカテゴリとの間に中程度の正の相関が確認された。
- ハリケーン内での交差検証を用いた場合、ハリケーン間予測よりも予測精度が顕著に向上した。
- 地域特有の語彙(例:'Rockport'、'Florida')の存在がモデルの汎化能力を低下させたため、このような語彙のフィルタリングが求められることが示された。
- Word2Vecに基づくベクトル表現は、ハリケーン深刻度に関連する意味的関係をBOWよりも優れた性能で捉えていた。
- ツイート数が場所ごとに変動することにより、予測性能が影響を受けることが判明し、信頼性のある推論のための最小閾値を定める必要があることが示された。
- 本研究では、188,721件のハリケーン関連ツイートから成るラベル付きデータセットを公開し、場所およびカテゴリごとにラベル付けされたものを研究者による再利用を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。