Skip to main content
QUICK REVIEW

[論文レビュー] Weakly Supervised Complementary Parts Models for Fine-Grained Image Classification from the Bottom Up

Weifeng Ge, Xiangru Lin|arXiv (Cornell University)|Mar 7, 2019
Advanced Neural Network Applications参考文献 51被引用数 12
ひとこと要約

本論文は、反復的なマスクRCNNとCRFベースのインスタンスセグメンテーションを用いて、多様で支配的でないオブジェクト部品を抽出し、二方向LSTMを用いて統合することで、分類精度を向上させる弱教師付き補完的部品モデルを提案する。この手法は、SOTAを6.7%、2.8%、5.2%上回り、それぞれStanford Dogs 120、Caltech-UCSD Birds 2011-200、Caltech 256で最高性能を達成した。

ABSTRACT

Given a training dataset composed of images and corresponding category labels, deep convolutional neural networks show a strong ability in mining discriminative parts for image classification. However, deep convolutional neural networks trained with image level labels only tend to focus on the most discriminative parts while missing other object parts, which could provide complementary information. In this paper, we approach this problem from a different perspective. We build complementary parts models in a weakly supervised manner to retrieve information suppressed by dominant object parts detected by convolutional neural networks. Given image level labels only, we first extract rough object instances by performing weakly supervised object detection and instance segmentation using Mask R-CNN and CRF-based segmentation. Then we estimate and search for the best parts model for each object instance under the principle of preserving as much diversity as possible. In the last stage, we build a bi-directional long short-term memory (LSTM) network to fuze and encode the partial information of these complementary parts into a comprehensive feature for image classification. Experimental results indicate that the proposed method not only achieves significant improvement over our baseline models, but also outperforms state-of-the-art algorithms by a large margin (6.7%, 2.8%, 5.2% respectively) on Stanford Dogs 120, Caltech-UCSD Birds 2011-200 and Caltech 256.

研究の動機と目的

  • ディープ畳み込みニューラルネットワーク(CNN)が画像分類において唯一最も特徴的な部分に注目するという限界を是正すること。これにより、他のオブジェクト部品からの補完的情報が欠落する可能性がある。
  • バウンディングボックスや部品レベルのアノテーションを一切必要としない弱教師付き手法を開発し、複数の補完的オブジェクト部品を抽出・統合すること。
  • 部分的なオブジェクト記述をモデル化することで、より包括的な表現を構築し、細分化画像分類を向上させること。
  • 多様で補完的な部品を統合し、分類に適した統一された特徴表現を生成する効果的な統合メカニズムを設計すること。

提案手法

  • 事前学習済み分類器のクラスアクティベーションマップ(CAM)を弱教師付きオブジェクト検出の初期確率マップとして使用する。
  • 低レベルの外観特徴を用いてピクセル単位のセグメンテーションを改善するため、条件付きランダムフィールド(CRF)を適用し、初期オブジェクトインスタンスマスクを生成する。
  • CRFで生成されたマスクを用いてトレーニングされたマスクRCNNと、交互に繰り返すことで、局所化とセグメンテーションの精度を段階的に向上させる。
  • 検出されたインスタンス周辺で情報の多様性とカバー範囲を最大化するように、最適な補完的部品の集合を探索する。
  • 複数の補完的部品からの深層特徴を統合・符号化するため、二方向スタック型長短期記憶(LSTM)ネットワークを用いる。
  • LSTMの学習中に複数の損失関数を導入し、特徴学習を正則化し、識別性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1弱教師付きオブジェクト検出およびインスタンスセグメンテーションは、標準的なCNNが見過ごす補完的オブジェクト部品を効果的に回復できるか?
  • RQ2補完的部品はどのように選択・モデル化すれば、情報の多様性を最大化し、重複を最小限に抑えることができるか?
  • RQ3LSTMアーキテクチャを用いて複数の補完的部品の特徴を統合することで、支配的部品のみに依存するモデルと比較して分類性能が向上するか?
  • RQ4LSTM内での部品の順序が分類性能に与える影響はどの程度か?

主な発見

  • GoogleNetを用いたCaltech-UCSD Birds 2011-200では93.5%の精度を達成し、ベースラインより9.4ポイント、SOTA手法より5.2ポイント高い性能を発揮した。
  • Stanford Dogs 120では93.9%の精度に達し、前回のSOTAを6.7%上回った。
  • Caltech 256ではSJFTベースラインで86.3%の精度を記録し、提案されたスタック型LSTMモジュールを導入することで8.0%の向上を達成した。
  • アブレーションスタディの結果、ランダムまたはグリッドベースの部品初期化を用いると、精度はそれぞれ85.9%および78.3%に低下し、提案された部品探索機構の重要性が裏付けられた。
  • スタック型LSTMを削除し、特徴の連結や平均化に置き換えると、精度はそれぞれ5.8%および8.7%低下し、LSTMベースの統合が優れていることが示された。
  • LSTM内の部品順序をランダムにシャッフルしても性能が安定していることから、モデルが部品の順序に強く依存しないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。