[論文レビュー] PM-GANs: Discriminative Representation Learning for Action Recognition Using Partial-modalities
本論文は、部分的モダリティ(特に赤外線入力から可視光スペクトル特徴を生成する)のみを用いて、行動認識のための判別的なフルモダリティ表現を学習する、新しい生成的対抗ネットワークであるPM-GANsを提案する。本手法は、新しい公開赤外線-可視行動データセットで78%の精度を達成し、4つの最先端手法を上回った。
Data of different modalities generally convey complimentary but heterogeneous information, and a more discriminative representation is often preferred by combining multiple data modalities like the RGB and infrared features. However in reality, obtaining both data channels is challenging due to many limitations. For example, the RGB surveillance cameras are often restricted from private spaces, which is in conflict with the need of abnormal activity detection for personal security. As a result, using partial data channels to build a full representation of multi-modalities is clearly desired. In this paper, we propose a novel Partial-modal Generative Adversarial Networks (PM-GANs) that learns a full-modal representation using data from only partial modalities. The full representation is achieved by a generated representation in place of the missing data channel. Extensive experiments are conducted to verify the performance of our proposed method on action recognition, compared with four state-of-the-art methods. Meanwhile, a new Infrared-Visible Dataset for action recognition is introduced, and will be the first publicly available action dataset that contains paired infrared and visible spectrum.
研究の動機と目的
- プライバシーまたは環境的制約により、行動認識において1つのモダリティ(例:赤外線)しか利用できない状況における課題に対処すること。
- 異種モダリティ(例:赤外線と可視光)間の転送可能な表現を学習し、欠落したデータ特徴を再構築すること。
- 部分的な入力モダリティのみを用いても、判別的なフルモダリティ表現を構築し、行動認識性能を向上させること。
- 行動認識用に初めての公開可能なペアド赤外線および可視動画データセットを提供すること。
提案手法
- 赤外線特徴を合成された可視光スペクトル特徴に変換するための条件付き生成的対抗ネットワーク(cGAN)を訓練する。
- 実際の可視特徴と生成された特徴を区別するための識別器を用い、現実的な特徴分布を強制する。
- 生成された可視特徴と実際の赤外線特徴を組み合わせ、分類のためのフルモダリティ表現を形成する。
- 敵対的学習を用いて特徴生成と行動分類を同時に最適化する判別的予測ヘッドを採用する。
- 2段階の訓練戦略を採用:まず再構成損失を用いて生成器を事前学習し、その後生成器と識別器を共同で微調整する。
- 分類の前に赤外線特徴と生成された可視特徴を連結する統合戦略を適用し、エンド・ツー・エンド学習を可能にする。
実験結果
リサーチクエスチョン
- RQ1生成モデルは、行動認識において1つの利用可能なモダリティ(例:赤外線)から欠落したモダリティ(例:可視光)特徴を効果的に再構築できるか?
- RQ2異なる環境的条件(例:季節の変化)下でも、生成された表現はどれほど一般化できるか?
- RQ3推論時に部分的モダリティしか利用できない状況で、提案されたPM-GANsフレームワークは最先端手法を上回る性能を示すか?
- RQ4敵対的学習は、不完全なデータから導かれるフルモダリティ表現の判別力にどれほど向上効果をもたらすか?
主な発見
- PM-GANsは、提案された赤外線-可視データセットで78%の行動認識精度を達成し、4つの最先端手法を上回った。
- 生成されたRGB特徴は、実際の赤外線特徴のみを使用した場合(74.17%の精度)を上回り、効果的なモダリティ転送を示した。
- 別途用意された冬期データセットでテストしたところ、赤外線と生成されたRGB特徴のみを用いても80.28%の精度を達成し、優れた一般化性能を示した。
- 混同行列から、『パンチ』と『プッシュ』のような類似した行動が頻繁に誤分類されていることが判明し、微細な行動の識別に課題があることが示された。
- 2ストリーム3D-CNNベースラインは74.67%の精度を示したのに対し、PM-GANsは78%の最高精度を達成し、その優位性を確認した。
- 提案手法により、実際の可視データにアクセスできない状況でも、1つのモダリティのみを用いてもフルモダリティ表現学習が可能であることが実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。