Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Modal Machine Learning for Flood Detection in News, Social Media and Satellite Sequences

Kashif Ahmad, Konstantin Pogorelov|arXiv (Cornell University)|Oct 7, 2019
Anomaly Detection Techniques and Applications参考文献 11被引用数 4
ひとこと要約

本稿は、MediaEval 2019 チャレンジにおいて、ニュース、ソーシャルメディア、および衛星画像の複数モードの機械学習フレームワークを提示する。事前学習された畳み込みニューラルネットワーク(AlexNet、VGG、ResNet)からの深層特徴と、色およびシーンレベル特徴を早期統合および後期統合によって統合し、ニュース画像のトピック分類のF1スコアは82.63、衛星画像ベースの洪水検出のF1スコアは58.82を達成した。

ABSTRACT

In this paper we present our methods for the MediaEval 2019 Mul-timedia Satellite Task, which is aiming to extract complementaryinformation associated with adverse events from Social Media andsatellites. For the first challenge, we propose a framework jointly uti-lizing colour, object and scene-level information to predict whetherthe topic of an article containing an image is a flood event or not.Visual features are combined using early and late fusion techniquesachieving an average F1-score of82.63,82.40,81.40and76.77. Forthe multi-modal flood level estimation, we rely on both visualand textual information achieving an average F1-score of58.48and46.03, respectively. Finally, for the flooding detection in time-based satellite image sequences we used a combination of classicalcomputer-vision and machine learning approaches achieving anaverage F1-score of58.82%

研究の動機と目的

  • ニュース記事、ソーシャルメディア投稿、および衛星画像シーケンスといった多様なデータソースを用いた洪水イベント検出のためのマルチモーダルシステムの開発。
  • 視覚的およびテキスト特徴を用いて、ニュース画像における洪水関連コンテンツの分類を高い精度で実施する課題に対処。
  • 洪水関連画像において、人が膝上まで水の中に立っているかどうかを検出することで、ソーシャルメディア画像における洪水レベルを推定。
  • ハイブリッドコンピュータビジョンおよび機械学習アプローチを用いて、時系列の衛星画像シーケンスにおける洪水イベントの検出。
  • 衛星シーケンスにおける雲カバー、季節的変化、画像のずれといったデータ制限を克服する。

提案手法

  • ImageNetおよびPlacesデータセットで事前学習された畳み込みニューラルネットワーク(AlexNet、VGG、ResNet)を用いて、物体およびシーンレベルの理解のための深層視覚特徴を抽出。
  • 分類性能の向上を図るため、特徴を早期統合(特徴ベクトルの連結)および後期統合(単純平均およびPSOベースの重み付き平均)によって統合。
  • LIREライブラリを用いて色およびテクスチャ特徴を統合し、グローバル画像表現のための共同複合記述子(JCD)を適用。
  • 洪水レベル推定のため、2段階の視覚的手法を適用:まず深層特徴を用いて洪水 vs. 非洪水画像を分類し、次にOpenPoseを用いて人体キーポintsを検出することで、膝高さに対する水位を評価。
  • テキスト分析のため、ボックスト・オブ・ワード(BoW)およびLSTMモデルを適用し、洪水関連コンテンツに基づいて記事を分類。
  • 衛星シーケンスのため、複数段階の画像処理パイプラインを適用:しきい値による雲マスク処理、128×128へのリサイズ、HSV色空間への変換、S/Vチャネルマスク処理、モルフォロジカルフィルタリング、およびグレイレベル同時発生行列(GLCM)を用いたテクスチャ分析の後、ランダムフォレスト分類を実施。

実験結果

リサーチクエスチョン

  • RQ1色、物体、シーンといったマルチスケールの視覚的特徴を早期および後期統合することで、ニュース画像における洪水検出精度が向上するか?
  • RQ2視覚的およびテキスト的特徴は、ソーシャルメディアコンテンツにおける洪水レベル推定において、どの程度相補的か?
  • RQ3雲カバーおよび画像のずれを伴う衛星画像シーケンスにおける洪水検出に、古典的手法の画像処理パイプライン(モルフォロジカルフィルタリングおよびテクスチャ分析)はどの程度有効か?
  • RQ4PSOベースの後期統合は、等重量平均または早期統合戦略に比べ、マルチモーダル洪水検出において優れているか?
  • RQ5OpenPoseによる人体キーポイント検出は、洪水関連画像において、人が膝上まで水の中に立っているかどうかを信頼性高く示せるか?

主な発見

  • PSOベースの後期統合手法は、NITDタスクでF1スコア82.63を達成し、等重量統合(82.40)および早期統合(76.77)を上回る最高のスコアを記録した。
  • JCDベースの色特徴を統合したところ、性能向上が見られず、わずかにスコアが低下し、色特徴を含む実行ではF1スコアが81.40に低下した。
  • 視覚ベースの洪水レベル推定はF1スコア58.48を達成し、BoWおよびLSTMモデルを用いたテキストアプローチ(46.03)を顕著に上回った。
  • 衛星ベースの洪水検出システムは、CSSタスクでF1スコア58.82を達成し、雲カバーおよび画像のずれといった課題にもかかわらず、有効性を示した。
  • 本システムは、洪水に起因する変化と季節的植生の成長を区別できず、類似する視覚的変化における一般化能力の制限を示した。
  • 再サンプリングされたデータセットを用いたアンサンブル学習により、特にレアクラス(洪水関連画像)の性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。