[論文レビュー] From Third Person to First Person: Dataset and Baselines for Synthesis and Retrieval
本論文は、同期されたエゴセントリック(第一人称)およびエクスターセントリック(第三人称)ビデアペアを含む、新規の合成および実世界データセットを紹介し、第三人称視点からの第一人称画像生成のための条件付きGANベースのフレームワークを提案する。合成データから実データへのドメイン適応が、クロスビュー検索性能を向上させることを示し、ドメイン適応を用いた2ストリームCNNにより、実エゴセントリックデータで30.82%のトップ1精度を達成した。
First-person (egocentric) and third person (exocentric) videos are drastically different in nature. The relationship between these two views have been studied in recent years, however, it has yet to be fully explored. In this work, we introduce two datasets (synthetic and natural/real) containing simultaneously recorded egocentric and exocentric videos. We also explore relating the two domains (egocentric and exocentric) in two aspects. First, we synthesize images in the egocentric domain from the exocentric domain using a conditional generative adversarial network (cGAN). We show that with enough training data, our network is capable of hallucinating how the world would look like from an egocentric perspective, given an exocentric video. Second, we address the cross-view retrieval problem across the two views. Given an egocentric query frame (or its momentary optical flow), we retrieve its corresponding exocentric frame (or optical flow) from a gallery set. We show that using synthetic data could be beneficial in retrieving real data. We show that performing domain adaptation from the synthetic domain to the natural/real domain, is helpful in tasks such as retrieval. We believe that the presented datasets and the proposed baselines offer new opportunities for further research in this direction. The code and dataset are publicly available.
研究の動機と目的
- 同期録画を伴う新規データセットの作成を通じて、エゴセントリック(第一人称)およびエクスターセントリック(第三人称)ビデオドメインのギャップを埋めること。
- 視野や視点の大幅な違いがあるにもかかわらず、条件付きGANを用いて第三人称視点からの第一人称ビデオ合成を可能にすること。
- 合成データを用いたドメイン適応により、実エゴセントリックデータに対するクロスビュー検索性能を向上させること。
- エゴセントリックおよびエクスターセントリックドメイン間で学習された、ビューアンインヴァリアント表現の有効性を、検索および行動認識の観点から評価すること。
提案手法
- ゲームエンジンを用いて大規模な合成データセットを収集し、エゴセントリック/エクスターセントリックカメラの姿勢および人間の行動に対してフレームレベルのアノテーションを付与する。
- 多様な人間の行動を記録した、ボディマウント(エゴセントリック)およびスタティック(エクスターセントリック)カメラの同期録画を用いて、小規模な実世界データセットを構築する。
- シーンおよびポーズを条件として、エクスターセントリック入力画像からエゴセントリック画像を合成するための条件付きGAN(cGAN)を訓練する。
- 光流(2チャネル)およびRGB(3チャネル)入力を用いて、ビューアンインヴァリアント特徴を学習するための2ストリーム3D CNNを設計する。
- 合成データで訓練した検索ネットワークを、実エゴセントリックデータで微調整することでドメイン適応を適用し、一般化性能を向上させる。
- 最後の全結合層から抽出した特徴量を用いてSVMを適用し、ビューアンインヴァリアンスおよび行動認識性能を評価する。
実験結果
リサーチクエスチョン
- RQ1視覚的オーバーラップが限られている状況下でも、条件付きGANが実用的で妥当な第一人称ビューを効果的に合成できるか?
- RQ2合成第一人称データが、実エゴセントリックデータにおけるクロスビュー検索性能をどの程度向上させられるか?
- RQ3ディープニューラルネットワークが、エゴセントリックおよびエクスターセントリックビデオドメイン間で一般化可能なビューアンインヴァリアント表現を学習できるか?
- RQ4合成データから実データへのドメイン適応が、エゴセントリック・エクスターセントリッククロスビュー設定における検索精度にどのように影響するか?
- RQ5第一人称および第三人称の両方の視点特徴を組み合わせることで、単独の視点を使用する場合に比べ、行動認識性能が向上するか?
主な発見
- 提案されたcGANベースの合成ネットワークは、エクスターセントリック入力から現実的で高レベルの意味的整合性を保った第一人称ビューを効果的にハローシネートした。
- 合成データで訓練し、実データで微調整した検索ネットワークを用いることで、実エゴセントリックデータにおける検索性能が30.82%のトップ1精度まで向上した。
- 実RGBデータで訓練した検索ネットワークは42.58%のトップ1精度を達成し、合成データのみのベースラインを上回った。これは、実データによる微調整の価値を示している。
- 合成データから実データへのドメイン適応により、検索性能が向上し、合成データで訓練し実データで微調整したネットワークが最良の結果(30.82%)を達成した。
- 検索ネットワークが学習したビューアンインヴァリアント表現は、行動認識精度を保持しており、両視点特徴を統合したSVMは実データで30.82%の精度を示し、一部のケースでは単独視点分類器を上回った。
- 合成光流で訓練した検索ネットワークは、実エゴセントリックデータで32.31%のトップ1精度を達成した。これは、合成データが動きに基づく検索に効果的に寄与できることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。