Skip to main content
QUICK REVIEW

[論文レビュー] Compositional Hierarchical Tensor Factorization: Representing Hierarchical Intrinsic and Extrinsic Causal Factors

M. Alex O. Vasilescu, Eui Hyeok Kim|arXiv (Cornell University)|Nov 11, 2019
Tensor decomposition and applications参考文献 67被引用数 11
ひとこと要約

本論文は、全体と部分の統一的テンソルモデルを用いて、視覚的物体の外観における内在的要因(例:形状、反射率)と外在的要因(例:照明、視点)を分離するコンpositional階層的テンソル因子分解(CHTF)を提案する。最小限の合成データから統計的に不変な階層的表現を学習することで、LFWデータセットにおける顔認証精度が79.8%に達した。これはDeepFaceの97.35%に比べて100倍少ないデータ量を用いたにもかかわらず、顔の部分的遮蔽やデータ不足に対する頑健性を示している。

ABSTRACT

Visual objects are composed of a recursive hierarchy of perceptual wholes and parts, whose properties, such as shape, reflectance, and color, constitute a hierarchy of intrinsic causal factors of object appearance. However, object appearance is the compositional consequence of both an object's intrinsic and extrinsic causal factors, where the extrinsic causal factors are related to illumination, and imaging conditions. Therefore, this paper proposes a unified tensor model of wholes and parts, and introduces a compositional hierarchical tensor factorization that disentangles the hierarchical causal structure of object image formation, and subsumes multilinear block tensor decomposition as a special case. The resulting object representation is an interpretable combinatorial choice of wholes' and parts' representations that renders object recognition robust to occlusion and reduces training data requirements. We demonstrate ourapproach in the context of face recognition by training on an extremely reduced dataset of synthetic images, and report encouragingface verification results on two datasets - the Freiburg dataset, andthe Labeled Face in the Wild (LFW) dataset consisting of real world images, thus, substantiating the suitability of our approach for data starved domains.

研究の動機と目的

  • 視覚的物体を内在的および外在的因果要因によって支配される、階層的感知的全体と部分の再帰的構造としてモデル化すること。
  • 画像形成における階層的内在的および外在的因果要因を分離可能な統一テンソルフレームワークを構築すること。
  • 頑健性を高め、データ要件を低減するための解釈可能で組み合わせ可能な物体外観表現を構築すること。
  • 合成学習データを用いて、特に顔認識において低データ環境での手法の妥当性を検証すること。
  • 合成データのみで学習したにもかかわらず、実世界の制約のない画像への一般化を示すこと。

提案手法

  • 本手法は、階層的内在的(全体と部分)および外在的(照明、視点)因果要因の間のマルチラインア作用を用いて、物体外観をモデル化する。
  • マルチラインアブロックテンソル分解を一般化し、因果要因の分離を可能にするコンポジショナル階層的テンソル因子分解(CHTF)を導入する。
  • 要因分解された表現から合成された人物シグネチャを計算するためのマルチラインア射影アルゴリズムを用いる。
  • 顔画像は、テンプレートへのピecewiseアフィンワーピング、画像タイルにおける適応的ヒストグラム等化による照明正規化、ガウス/ラプラシアンフィルタを用いた畳み込みによる画像ピラミッドの構築により事前処理される。
  • ピラミッド層から部分をセグメンテーションし、重み付き最近傍者分類器を用いてシグネチャを計算する。
  • モデルは、15の視点および15の照明条件下でレンダリングされた100人の合成3D画像を用いて学習され、トレーニングには実世界データは一切使用されていない。

実験結果

リサーチクエスチョン

  • RQ1統一テンソルモデルは、視覚的物体における全体と部分の階層的構成を効果的に表現できるか?
  • RQ2コンポジショナル階層的テンソル因子分解は、画像形成における内在的および外在的因果要因を分離できるか?
  • RQ3このような分離された表現は、最小限の学習データで顔認証を頑健に実現できるか?
  • RQ4合成データのみで学習したにもかかわらず、実世界の制約のない顔画像への一般化は可能か?
  • RQ5データが極めて限られた状況で、深層学習モデルと比較して性能はどの程度か?

主な発見

  • 本手法は、実世界の制約のあるベンチマークであるLabeled Faces in the Wild(LFW)データセットで79.8%の顔認証精度を達成した。
  • この結果は、DeepFaceが同じデータセットで97.35%の精度を達成するのに対し、440万枚の画像を必要としたのに対し、本手法はその1%のデータ量での達成であった。
  • 分離された階層的表現のおかげで、部分的遮蔽およびポーズや照明の変動に対して頑健であることが示された。
  • 深層学習モデルが収束または一般化に失敗する可能性がある低データ環境において、本手法は標準的なCNNを上回った。
  • マルチラインア射影から導出された合成された人物シグネチャにより、多様な撮影条件下でも効果的な比較が可能であった。
  • これらの結果は、CHTFフレームワークが特にバイオメトリクスおよび物体認識分野においてデータが不足する分野に適していることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。