Skip to main content
QUICK REVIEW

[論文レビュー] On Identifying Disaster-Related Tweets: Matching-based or Learning-based?

Hien To, Sumeet Agrawal|arXiv (Cornell University)|May 4, 2017
Public Relations and Crisis Communication参考文献 27被引用数 9
ひとこと要約

本論文は、コアキーワードとクラウドソーシングを用いたハッシュタグの最適化により、キーワードおよびハッシュタグマッチングを拡張することで、学習ベースの手法よりも高品質で解釈可能な結果が得られる、改善されたマッチングベースの手法を提案している。11の災害データセットにおいて、マッチングベースの手法は、特に災害のピーク期にタイムリーで関連性の高いメッセージを捉える能力において、学習ベースの手法を上回った。

ABSTRACT

Social media such as tweets are emerging as platforms contributing to situational awareness during disasters. Information shared on Twitter by both affected population (e.g., requesting assistance, warning) and those outside the impact zone (e.g., providing assistance) would help first responders, decision makers, and the public to understand the situation first-hand. Effective use of such information requires timely selection and analysis of tweets that are relevant to a particular disaster. Even though abundant tweets are promising as a data source, it is challenging to automatically identify relevant messages since tweet are short and unstructured, resulting to unsatisfactory classification performance of conventional learning-based approaches. Thus, we propose a simple yet effective algorithm to identify relevant messages based on matching keywords and hashtags, and provide a comparison between matching-based and learning-based approaches. To evaluate the two approaches, we put them into a framework specifically proposed for analyzing disaster-related tweets. Analysis results on eleven datasets with various disaster types show that our technique provides relevant tweets of higher quality and more interpretable results of sentiment analysis tasks when compared to learning approach.

研究の動機と目的

  • 短く、非公式なソーシャルメディアの投稿において、関連する災害関連ツイートを特定する課題に対処すること。
  • マッチングベースと学習ベースのアプローチが、災害関連ツイートを分類する上で、どの程度効果的であるかを比較すること。
  • コアキーワードマッチングとクラウドソーシングを用いて関連するハッシュタグのセットを拡張することで、災害ツイートの特定における再現率と品質を向上させること。
  • 研究機関や一般の研究者による利用を目的として、11の新しい地理的タグ付き災害ツイートデータセットを公開・作成すること。
  • マッチングベースの手法が、学習ベースのモデルよりも解釈性の高い感情分析結果を生み出せることを示すこと。

提案手法

  • 各災害タイプ(例:'earthquake'、'flood')に対して事前に定義されたコアキーワードのセットを用いて、ツイートをマッチングする。
  • コアキーワードに一致するように、ツイートコーパスから候補となるハッシュタグを自動で抽出する。
  • クラウドソーシングを用いて、不適切なハッシュタグを除外することで、精度を向上させる。
  • 最終的なコアキーワードと精錬済みハッシュタグのセットを用いて、関連する災害関連ツイートをマッチングし、抽出する。
  • 補足的な学習ベースのアプローチでは、word2vec、TF-IDF、LSI、ロジスティック回帰を用いてツイートを分類する。
  • 両手法の評価には再現率を主な指標とし、各手法の出力を相互に検証用の真値として用いる。

実験結果

リサーチクエスチョン

  • RQ1マッチングベースと学習ベースのアプローチは、再現率と結果の品質の観点から、災害関連ツイートの特定においてどの程度異なるか?
  • RQ2関連するハッシュタグのセットを拡張することで、マッチングベースのツイート特定における再現率はどの程度向上するか?
  • RQ3スパムツイートの存在は、災害関連ツイートにおける感情分析の信頼性にどのような影響を及えるか?
  • RQ4マッチングベースのアプローチは、学習ベースのモデルに比べて、より解釈性の高い感情分析結果を生み出せるか?
  • RQ5両手法の性能は、災害タイプ(例:地震、洪水、野火)によってどのように変化するか?

主な発見

  • マッチングベースの手法は、11の災害データセットすべてで学習ベースの手法よりも高い再現率スコアを達成しており、関連するツイートをより効果的に特定できていることが示された。
  • 改善されたマッチングベースの手法は、従来のマッチングアプローチに比べて、関連するツイート数を最大80%まで増加させた。
  • 学習ベースの手法は、関連のないツイートの割合が高く、感情分析結果に歪みをもたらし、実際の災害影響のトレンドを隠蔽する要因となった。
  • スパムツイートを除外した後、感情分析におけるポジティブおよびネガティブツイートの数が、実際の災害イベントとより正確に時系列的に一致するようになった。
  • ニューヨークストームデータセットでは、10日目に観察された感情の異常ピークは、50人のスパマーが一斉に同一の内容を投稿したことに起因していた。
  • マッチングベースの手法は、災害ピーク時におけるネガティブ感情の急増を明確に示す解釈性の高い感情マップを生成したのに対し、学習ベースの手法はそのような明確なトレンドを捉えられなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。