Skip to main content
QUICK REVIEW

[論文レビュー] Feature Space Transfer for Data Augmentation

Bo Liu, Wang, Xudong|arXiv (Cornell University)|Jan 13, 2018
Domain Adaptation and Few-Shot Learning参考文献 29被引用数 4
ひとこと要約

本稿では、ポーズおよび外観空間における連続的で滑らかな特徴軌道を学習する、深層エンコーダ・デコーダネットワークFATTENを提案する。エンド・トゥ・エンドの訓練によりマルチタスク損失を用いることで、FATTENはオブジェクトのポーズ間で特徴を転送し、SUN-RGBD上での少サンプルオブジェクト認識性能を、最先端手法に比べ最大5.8パーセンテージポイント向上させる。

ABSTRACT

The problem of data augmentation in feature space is considered. A new architecture, denoted the FeATure TransfEr Network (FATTEN), is proposed for the modeling of feature trajectories induced by variations of object pose. This architecture exploits a parametrization of the pose manifold in terms of pose and appearance. This leads to a deep encoder/decoder network architecture, where the encoder factors into an appearance and a pose predictor. Unlike previous attempts at trajectory transfer, FATTEN can be efficiently trained end-to-end, with no need to train separate feature transfer functions. This is realized by supplying the decoder with information about a target pose and the use of a multi-task loss that penalizes category- and pose-mismatches. In result, FATTEN discourages discontinuous or non-smooth trajectories that fail to capture the structure of the pose manifold, and generalizes well on object recognition tasks involving large pose variation. Experimental results on the artificial ModelNet database show that it can successfully learn to map source features to target features of a desired pose, while preserving class identity. Most notably, by using feature space transfer for data augmentation (w.r.t. pose and depth) on SUN-RGBD objects, we demonstrate considerable performance improvements on one/few-shot object recognition in a transfer learning setup, compared to current state-of-the-art methods.

研究の動機と目的

  • 大規模なポーズ変動下における畳み込みニューラルネットワーク(CNN)の一般化性能が、現実世界のデータサンプリングが疎であるために制限されることに対処する。
  • ポーズ多様体の連続性と滑らかさをモデル化できない、従来のデータ拡張手法の限界を克服する。
  • 分離された軌道関数を必要とせず、ポーズ変動間で特徴を転送できる統合的でエンド・トゥ・エンドで訓練可能なアーキテクチャを開発する。
  • 合成的に生成されたポーズ変動特徴を用いて特徴空間を豊かにすることで、少サンプルオブジェクト認識を向上させる。
  • パラメータ化されたポーズおよび外観多様体を用いて、スケーラブルで構造に配慮したデータ拡張を可能にする。

提案手法

  • FATTENはエンコーダ・デコーダアーキテクチャを採用し、エンコーダーが外観およびポーズ予測器に分岐する。
  • デコーダーは予測されたポーズおよび外観埋め込みを用いてターゲット特徴を生成し、連続的軌道マッピングを可能にする。
  • マルチタスク損失はカテゴリ不一致およびポーズ不一致をペナルティ化し、滑らかで連続的な特徴軌道を強制する。
  • 分離された特徴転送関数を事前学習することなく、エンド・トゥ・エンドで訓練することで、表現と転送の共同最適化を保証する。
  • ポーズおよび深度情報が、現実的でクラスを保持する特徴変化の生成をガイドするために明示的に入力として用いられる。
  • 学習の複雑性を低減しつつ構造的連続性を保持するため、ポーズ多様体をボックスに離散化する。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、1つのエンド・トゥ・エンドアーキテクチャ内で、オブジェクトのポーズ変動にわたる連続的で滑らかな特徴軌道を学習できるか?
  • RQ2外観およびポーズのパラメータ化によるポーズ多様体のモデリングは、少サンプル認識のためのデータ拡張を改善するか?
  • RQ3FATTENは、属性に配慮した拡張(AGA)および特徴の想起( hallucination)と比較して、大規模なポーズ変動下での一般化性能にどのように差をつけるか?
  • RQ4FATTENによる特徴空間転送は、1ショットおよび少サンプルオブジェクト認識精度をどの程度向上させるか?
  • RQ5FATTENは、新しいデータに対して再トレーニングを必要とせずに、未学習のオブジェクトクラスに一般化可能か?

主な発見

  • FATTENは、1ショットの$\tfrac{1}{10}$評価セット(クラスの$\tfrac{1}{10}$)でトップ1正解率44.99%を達成し、ベースラインのSVMに比べ11.25パーセンテージポイント優れている。
  • 同じセットにおいて、FATTENはAGAに比べ5.87パーセンテージポイント、特徴の想起に比べ9.56ポイント向上している。
  • 5ショット設定では、$\tfrac{1}{10}$で58.82%の正解率を達成し、AGAに比べ1.9%、想起に比べ8.51%向上している。
  • FATTENは、すべての3つの評価セット($\tfrac{1}{10}$、$\tfrac{1}{10}$、$\tfrac{1}{20}$)において、AGAおよび想起を一貫して上回っており、クラスの不均衡やショット数の減少に対して高いロバスト性を示している。
  • AGAに対する改善は、FATTENのエンド・トゥ・エンド訓練および連続的軌道モデリングによるものであり、独立した転送関数が引き起こす不連続性を回避している。
  • FATTENが明示的なポーズおよび深度の監視を用いることで、非パラメトリックな想起よりも情報量が多く、クラスを保持するデータ拡張が可能になっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。