Skip to main content
QUICK REVIEW

[論文レビュー] Object-centric Sampling for Fine-grained Image Classification

Xiaoyu Wang, Tianbao Yang|arXiv (Cornell University)|Dec 10, 2014
Advanced Neural Network Applications参考文献 12被引用数 8
ひとこと要約

本稿では、オブジェクト検出器を用いて、検出されたオブジェクトの周囲の画像ウィンドウを優先することで、CNNの学習をガイドするオブジェクト中心のサンプリング(OCS)を提案する。333クラス、157,023枚の学習画像を有する大規模な自動車データセットを構築した結果、検出応答を強調する多項分布サンプリングにより、背景の雑音を効果的に低減し、微細な違いの一般化を向上させることで、トップ1精度を81.6%から89.3%まで向上させた。

ABSTRACT

This paper proposes to go beyond the state-of-the-art deep convolutional neural network (CNN) by incorporating the information from object detection, focusing on dealing with fine-grained image classification. Unfortunately, CNN suffers from over-fiting when it is trained on existing fine-grained image classification benchmarks, which typically only consist of less than a few tens of thousands training images. Therefore, we first construct a large-scale fine-grained car recognition dataset that consists of 333 car classes with more than 150 thousand training images. With this large-scale dataset, we are able to build a strong baseline for CNN with top-1 classification accuracy of 81.6%. One major challenge in fine-grained image classification is that many classes are very similar to each other while having large within-class variation. One contributing factor to the within-class variation is cluttered image background. However, the existing CNN training takes uniform window sampling over the image, acting as blind on the location of the object of interest. In contrast, this paper proposes an \emph{object-centric sampling} (OCS) scheme that samples image windows based on the object location information. The challenge in using the location information lies in how to design powerful object detector and how to handle the imperfectness of detection results. To that end, we design a saliency-aware object detection approach specific for the setting of fine-grained image classification, and the uncertainty of detection results are naturally handled in our OCS scheme. Our framework is demonstrated to be very effective, improving top-1 accuracy to 89.3% (from 81.6%) on the large-scale fine-grained car classification dataset.

研究の動機と目的

  • 既存のベンチマークにおける学習データの制限により生じる過学習の課題に対処すること。
  • 微細な画像における背景のごみによるクラス内変動を低減すること。
  • オブジェクト検出に基づくオブジェクト中心のサンプリングに移行することで、CNNの性能を向上させること。
  • 不完全な検出結果に対しても耐性を持つ検出とサンプリングパイプラインを設計すること。
  • 自動車認識のための強力なCNNベースラインを、大規模かつ高解像度の微細なデータセットを用いて構築すること。

提案手法

  • ブランド、モデル、年式範囲でラベル付けされた333クラス、157,023枚の学習画像を有する大規模な微細な自動車データセットを構築する。
  • 最も顕著なオブジェクトのみがポジティブ例としてラベル付けされたデータセット上で学習された、Regionlet検出に基づく顕著性に配慮したオブジェクト検出フレームワークを設計する。
  • 選択的探索を用いてオブジェクト候補を生成し、Regionlet再局所化を適用して境界ボックスの予測を精緻化する。
  • 高信頼度の検出応答と重複する画像ウィンドウに高いサンプリング確率を割り当てる多項分布サンプリング方式を実装する。
  • 非最大抑制を全画像にわたる最大値演算に置き換えることで、画像全体にわたる検出信頼度を保持する。
  • 均一サンプリングと多項分布サンプリングの両方を用いて、333クラスの深層CNNを学習し、アブレーションと比較を行う。

実験結果

リサーチクエスチョン

  • RQ1大規模かつ微細なデータセットは、微細な画像分類におけるCNN性能を顕著に向上させることができるか?
  • RQ2検出結果に基づくオブジェクト中心のサンプリングは、微細な分類における背景の雑音の悪影響を軽減するか?
  • RQ3顕著性に配慮した検出器は、複雑でごみだらけの画像において、最も関連性の高いオブジェクトを特定するのにどの程度効果的か?
  • RQ4多項分布サンプリング戦略は、不完全な検出出力を効果的に処理しつつ、分類精度を向上させることができるか?
  • RQ5オブジェクト中心のサンプリングは、微細な認識タスクにおいて均一サンプリングをどの程度上回るか?

主な発見

  • 提案された大規模な自動車データセットにより、トップ1精度が81.6%に達する強力なCNNベースラインが実現され、従来手法を顕著に上回った。
  • 検出応答に基づく多項分布サンプリングを用いたオブジェクト中心のサンプリングにより、トップ1精度が89.3%に向上し、相対的な向上率は7.7ポイントであった。
  • 顕著性に配慮した検出器は、平均適合率85.8%を達成し、より大きく顕著なオブジェクトに対して一貫して高い信頼度を割り当てた。
  • 多項分布サンプリング方式により、背景特徴への依存が顕著に低減され、微細な違いの一般化が向上した。
  • 不完全な検出に対しても、モデルの性能向上が一貫して得られたことから、フレームワークの耐性が確認された。
  • 可視化により、モデルが正しいオブジェクト領域に注目しており、OCSを用いることで誤分類が減少していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。