[論文レビュー] Disentangled Person Image Generation
本稿では、前景、背景、ポーズの独立した表現を、マルチブランチ再構成ネットワークを用いて学習した後、ノイズから埋め込みへのマッピングの adversarial 学習によって、分離された人物画像合成のための2段階生成フレームワークを提案する。この手法により、制御可能な画像生成と操作が可能となり、合成データを用いた人物再識別(re-ID)で最先端の性能を達成した。
Generating novel, yet realistic, images of persons is a challenging task due to the complex interplay between the different image factors, such as the foreground, background and pose information. In this work, we aim at generating such images based on a novel, two-stage reconstruction pipeline that learns a disentangled representation of the aforementioned image factors and generates novel person images at the same time. First, a multi-branched reconstruction network is proposed to disentangle and encode the three factors into embedding features, which are then combined to re-compose the input image itself. Second, three corresponding mapping functions are learned in an adversarial manner in order to map Gaussian noise to the learned embedding feature space, for each factor respectively. Using the proposed framework, we can manipulate the foreground, background and pose of the input image, and also sample new embedding features to generate such targeted manipulations, that provide more control over the generation process. Experiments on Market-1501 and Deepfashion datasets show that our model does not only generate realistic person images with new foregrounds, backgrounds and poses, but also manipulates the generated factors and interpolates the in-between states. Another set of experiments on Market-1501 shows that our model can also be beneficial for the person re-identification task.
研究の動機と目的
- 前景、背景、ポーズなどの画像要因を明示的に分離することで、現実的で制御可能な人物画像の生成を可能にする。
- 各分離要因の操作可能な埋め込み特徴を学習する2段階フレームワークを開発する。
- ガウスノイズを学習済み埋め込み空間にマッピングすることで、高品質で多様な人物画像を生成し、新しい組み合わせのサンプリングを可能にする。
- 人物再識別タスクにおける分離表現の評価を行い、その判別力の高さを示す。
- 分離生成を用いて、人為的アノテーションに依存するのを減らすため、合成仮想マーケットデータセット(VM)を構築する。
提案手法
- マルチブランチ再構成ネットワークが、入力された人物画像を前景、背景、ポーズの分離された埋め込み特徴に符号化し、これらの特徴から元の画像を再構成する。
- 第2段階では、各要因のための学習済み埋め込み特徴分布へ標準ガウスノイズをマッピングする3つの別個のマッピング関数を adversarial に学習する。
- 生成器は第1段階の事前学習済みエンコーダーおよびデコーダーによってガイドされ、生成画像の整合性と現実性が保証される。
- 実際の埋め込み特徴(入力画像から得たもの)と偽の特徴(ノイズから得たもの)の分布を一致させるために adversarial 学習が適用される。
- 学習済み埋め込み空間からのサンプリングにより、要因を独立または共同で操作することが可能になる。
- 仮想 Market-1501 データセット(VM)は、前景特徴を固定し、背景およびポーズ特徴を変化させることで、合成学習ペアを生成する。
実験結果
リサーチクエスチョン
- RQ1前景、背景、ポーズの分離表現は、制御可能な人物画像生成を可能にするか?
- RQ2ノイズから埋め込みへの adversarial マッピング学習は、現実的で多様な人物画像を生成できるか?
- RQ3分離された埋め込み特徴は、人物再識別性能の向上に利用できるか?
- RQ4分離された操作によって生成された合成画像ペアは、re-ID モデルの有効な学習データとして機能するか?
- RQ5分離された特徴の品質は、re-ID タスクにおいて、既存の非教師ありまたは手作業特徴抽出器と比較してどうか?
主な発見
- 本モデルは、BodyROI7 特徴抽出器を唯一使用して Market-1501 データセットで最先端の re-ID 性能を達成し、ランク-1 正答率 0.338、mAP 0.107 を達成した。
- PCA を用いて特徴次元を低減した場合、ランク-1 正答率は 0.355 に向上し、WholeBody モデルを上回り、教師ありベースラインに近づいた。
- 分離されたサンプリングにより生成された仮想マーケット(VM)データセットは、ランク-1 正答率 0.338 を達成し、人為的アノテーションが施された DukeReID で学習したモデルと同等の性能を示した。
- プログレッシブな非教師あり学習(PUL)を適用した場合、VM データで学習したモデルはランク-1 正答率 0.369 を達成し、CUHK03 や DukeReID データセットで学習したモデルを上回った。
- VM データを用いて KISSME 評価指標を適用した場合、ランク-1 正答率は 0.375 を達成し、合成データが実際のアノテーションデータと同等またはそれを上回る性能を示した。
- 分離された特徴は生成的であるだけでなく、判別的でもあることが、人物再識別タスクにおける優れた性能から裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。