Skip to main content
QUICK REVIEW

[論文レビュー] Collaboratively Weighting Deep and Classic Representation via L2 Regularization for Image Classification

Shaoning Zeng, Bob Zhang|arXiv (Cornell University)|Feb 21, 2018
Domain Adaptation and Few-Shot Learning被引用数 14
ひとこと要約

本稿では、$l_2$-正則化された協調表現を用いて、深層畳み込みニューラルネットワーク(CNN)特徴量と古典的な線形表現を協調的に重み付けする、DeepCWCと呼ばれる新しい画像分類手法を提案する。両表現からの距離ベクトルを学習された協調重みで統合することで、SOTA性能を達成し、Fashion-MNISTでは97.66%の正確度を達成する。これはWide ResNetに基づく手法や他のSOTAモデルを上回る性能を示す。

ABSTRACT

Deep convolutional neural networks provide a powerful feature learning capability for image classification. The deep image features can be utilized to deal with many image understanding tasks like image classification and object recognition. However, the robustness obtained in one dataset can be hardly reproduced in the other domain, which leads to inefficient models far from state-of-the-art. We propose a deep collaborative weight-based classification (DeepCWC) method to resolve this problem, by providing a novel option to fully take advantage of deep features in classic machine learning. It firstly performs the L2-norm based collaborative representation on the original images, as well as the deep features extracted by deep CNN models. Then, two distance vectors, obtained based on the pair of linear representations, are fused together via a novel collaborative weight. This collaborative weight enables deep and classic representations to weigh each other. We observed the complementarity between two representations in a series of experiments on 10 facial and object datasets. The proposed DeepCWC produces very promising classification results, and outperforms many other benchmark methods, especially the ones claimed for Fashion-MNIST. The code is going to be published in our public repository.

研究の動機と目的

  • 一つのデータセットで学習された深層特徴量が他のデータセットに一般化できないドメインシフト問題に対処すること。
  • 事前学習済みの深層特徴量を用いる際の、古典的機械学習モデルのロバスト性と性能を向上させること。
  • 線形モデル(例:$l_2$-正則化された協調表現)が非線形な深層特徴量を統一された分類フレームワーク内でどのように向上させるかを調査すること。
  • 深層特徴量と古典的表現を協調的重み付けで統合することで、複数のCNNアーキテクチャとデータセットにわたって優れた一貫性のある性能が得られることを示すこと。

提案手法

  • 事前学習済みのCNNから抽出した深層特徴量と元の画像の両方に対して、$l_2$-ノルムに基づく協調表現を実行する。
  • 二つの距離ベクトルを計算する:一つは生画像の線形表現からのもの、もう一つは深層CNN特徴量の線形表現からのもの。
  • 深層特徴量と古典的表現が互いに補い合うように、新たな協調重みを学習して二つの距離ベクトルを統合する。
  • 協調重みはトレーニング中にエンドツーエンドで最適化され、モデルが各表現が最終分類にどの程度寄与するかを学習できる。
  • 一般化性能の評価のため、複数のCNNアーキテクチャ(ResNet、Inception、VGG)と異なる層(例:fc6、グローバル平均プーリング)に適用する。
  • 深層モデルのアーキテクチャを変更せず、標準的な最適化手法で分類器をトレーニングする。深層モデルのハイパーパrameterのチューニングは行わず、分類レベルでの統合に焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1$l_2$-正則化された協調表現は、事前学習済みの深層特徴量の判別力を画像分類において効果的に向上させることができるか?
  • RQ2協調的重みによる深層特徴量と古典的表現の統合は、異なるデータセットやネットワークアーキテクチャにわたって一般化性能をどのように向上させるか?
  • RQ3同じ事前学習済みCNN特徴量を用いる場合、本手法はFashion-MNISTのような難易度の高いベンチマークでもSOTAモデルを上回る性能を示すか?
  • RQ4異なるCNN層(例:グローバル平均プーリング対全結合層)が、協調的統合フレームワークの性能に与える影響は何か?
  • RQ5深層モデルのアーキテクチャの変更やハイパーパrameterチューニングなしに、単純な線形統合メカニズムがSOTA結果を達成できるか?

主な発見

  • 提案手法のDeepCWCは、Fashion-MNISTデータセットでSOTAの97.66%の正確度を達成し、Wide Residual Networksに基づく手法や他のSOTAモデルを上回った。
  • 本手法は、ResNet、Inception、VGGを含むすべてのテスト対象CNNアーキテクチャにおいて、複数のデータセットでベースラインモデルを一貫して上回った。
  • VGG-16のfc6層からの特徴量を用いた際に最高の性能が得られた。これは、高次元の全結合特徴量が古典的表現と統合されることで、非常に判別力が高くなることを示している。
  • InceptionおよびResNetモデルにおいて、グローバル平均プーリング層が他の層よりも高い正確度を達成した。これは、クラスレベルの特徴を効果的に抽出できることを示唆している。
  • 深層ネットワークのアーキテクチャを変更せず、ハイパーパrameterのチューニングも行わずに高い性能を達成した。これは、統合メカニズムのロバスト性を示している。
  • 1サンプルあたりの推論時間は0.1〜0.2秒の間であり、二重の表現統合にもかかわらず効率的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。