Skip to main content
QUICK REVIEW

[論文レビュー] Supervised COSMOS Autoencoder: Learning Beyond the Euclidean Loss!

Maneet Singh, Shruti Nagpal|arXiv (Cornell University)|Oct 15, 2018
Face recognition and analysis参考文献 56被引用数 5
ひとこと要約

本論文では、分類性能を向上させるために、コサイン類似度(方向的類似度)、マハラノビス距離(分布的一致性)、相互情報量(判別的特徴学習)を同時に最適化する、新しいマルチオブジェクティブなオートエンコーダー、Supervised COSMOS Autoencoder を提案する。このモデルは、MNIST、CIFAR-10、SVHN、CelebA、LFWA、Adience、IJB-A において、画像分類、属性予測、顔認識タスクで最先端の結果を達成した。

ABSTRACT

Autoencoders are unsupervised deep learning models used for learning representations. In literature, autoencoders have shown to perform well on a variety of tasks spread across multiple domains, thereby establishing widespread applicability. Typically, an autoencoder is trained to generate a model that minimizes the reconstruction error between the input and the reconstructed output, computed in terms of the Euclidean distance. While this can be useful for applications related to unsupervised reconstruction, it may not be optimal for classification. In this paper, we propose a novel Supervised COSMOS Autoencoder which utilizes a multi-objective loss function to learn representations that simultaneously encode the (i) "similarity" between the input and reconstructed vectors in terms of their direction, (ii) "distribution" of pixel values of the reconstruction with respect to the input sample, while also incorporating (iii) "discriminability" in the feature learning pipeline. The proposed autoencoder model incorporates a Cosine similarity and Mahalanobis distance based loss function, along with supervision via Mutual Information based loss. Detailed analysis of each component of the proposed model motivates its applicability for feature learning in different classification tasks. The efficacy of Supervised COSMOS autoencoder is demonstrated via extensive experimental evaluations on different image datasets. The proposed model outperforms existing algorithms on MNIST, CIFAR-10, and SVHN databases. It also yields state-of-the-art results on CelebA, LFWA, Adience, and IJB-A databases for attribute prediction and face recognition, respectively.

研究の動機と目的

  • 従来のオートエンコーダーが唯一のユークリッド再構成損失を最適化するという制限を解消し、分類タスクに最適でない可能性があること。
  • 方向的類似度(コサイン類似度)、分布的一致性(マハラノビス距離)、判別的教師信号(相互情報量)を組み込むことで特徴学習を向上させること。
  • 照明、アングル、回転の変化に対して効果的な、頑健で不変な表現を学習する統合フレームワークを開発すること。
  • 画像分類、属性予測、顔認識を含む多様なベンチマークで優れた性能を示すこと。

提案手法

  • 入力ベクトルと再構成ベクトル間のコサイン類似度を最適化することで、方向的関係を保持するためのマルチオブジェクティブ損失関数を採用する。
  • 入力と再構成の間の分布的類似度をモデル化するため、マハラノビス距離を統合し、局所的なデータ構造を捉える。
  • 特徴の判別性を向上させるために、相互情報量に基づく損失を教師信号として導入する。
  • 再構成、方向的、分布的、判別的という複数の目的を組み合わせて、エンドツーエンドで訓練する。
  • タイル張り(tessellation)を適用して画像パッチから局所的特徴を抽出し、グローバル特徴と統合することで、耐性を向上させる。
  • 複数の隠れ層を持つディープなエンコーダ-デコーダ構造を採用し、適応的学習率を用いた誤差逆伝播で最適化する。

実験結果

リサーチクエスチョン

  • RQ1再構成損失に方向的類似度(コサイン類似度)と分布的類似度(マハラノビス距離)を組み合わせることで、分類に適した特徴品質が向上するか?
  • RQ2相互情報量を教師信号として組み込むことで、オートエンコーダーが学習する特徴の判別力が向上するか?
  • RQ3タイル張りによる局所的(パッチベース)とグローバル(全画像)特徴の統合は、分類精度にどのように影響するか?
  • RQ4提案された COSMOS 損失は、従来のユークリッド損失や他のメトリックの組み合わせを上回る性能を示すか?

主な発見

  • Supervised COSMOS Autoencoder は MNIST で最先端の性能を達成し、テスト精度が 98.92% に達した。
  • CIFAR-10 では 94.14% の精度を達成し、評価設定において既存手法を上回った。
  • SVHN では 98.51% の精度を達成し、数字認識タスクへの強い一般化能力を示した。
  • CelebA では属性予測で 93.98% の精度を達成し、ベースラインを著しく上回った。
  • 『眼鏡』や『オval顔』といった属性について、正例と負例のスコア重複を低減させ、分離性が向上した。
  • タイル張りを組み込むことで、CelebA および SVHN でそれぞれ約 2% の性能向上が確認され、局所的・グローバル特徴の統合の有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。