Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Semantic Parts on Partially Occluded Objects

Jianyu Wang, Cihang Xie|arXiv (Cornell University)|Jul 25, 2017
Advanced Neural Network Applications参考文献 23被引用数 7
ひとこと要約

本論文では、深層ネットワークの活性化から得られる局所的視覚的特徴を統合することで、部分的に覆い隠された物体の意味的パーツを検出する投票ベースのフレームワークを提案する。対数尤度比検定と空間的制約を用いて、支援する視覚的コンセプトを動的に統合することで、重い覆い隠し状況下でもベースラインモデルに比べて優れた耐障害性を達成し、視覚的コンセプトを45から10に減らした際の精度低下が7.8%にとどまる一方、競合手法ではより大きな低下を示す。

ABSTRACT

In this paper, we address the task of detecting semantic parts on partially occluded objects. We consider a scenario where the model is trained using non-occluded images but tested on occluded images. The motivation is that there are infinite number of occlusion patterns in real world, which cannot be fully covered in the training data. So the models should be inherently robust and adaptive to occlusions instead of fitting / learning the occlusion patterns in the training data. Our approach detects semantic parts by accumulating the confidence of local visual cues. Specifically, the method uses a simple voting method, based on log-likelihood ratio tests and spatial constraints, to combine the evidence of local cues. These cues are called visual concepts, which are derived by clustering the internal states of deep networks. We evaluate our voting scheme on the VehicleSemanticPart dataset with dense part annotations. We randomly place two, three or four irrelevant objects onto the target object to generate testing images with various occlusions. Experiments show that our algorithm outperforms several competitors in semantic part detection when occlusions are present.

研究の動機と目的

  • トレーニング時に観測されていない任意の覆い隠しパターンに対しても耐性を持つパーツ検出手法の開発。
  • Faster R-CNNのような統合的検出器がパーツレベルの推論が不足しているため、覆い隠されたパーツを処理できないという限界の解消。
  • 非覆い隠しデータのみを用いて、部分的または完全に覆い隠された意味的パーツを検出可能にする。
  • 文脈に基づいて視覚的キューをオン/オフすることで適応可能な柔軟で説明可能な検出システムの構築。

提案手法

  • 深層ネットワークの内部活性化をクラスタリングすることで、局所的で意味的に意味のある特徴である視覚的コンセプトを抽出する。
  • 対数尤度比検定を用いて、パーツの存在に関する信頼性を評価する投票方式で、視覚的コンセプトからの証拠を集約する。
  • 空間オフセットマップを介して空間的制約を課し、検出されたパーツとキュー間の妥当な相対的位置関係を保証する。
  • マルチスケール推論と学習されたスケール予測モジュールを用いて、物体サイズの変動に対応する。
  • 空間的一致性と尤度に基づいて、視覚的キューを動的にオン/オフすることで、悪影響を及ぼすキューを回避する。
  • 近傍閾値が空間的文脈範囲を制御し、オミッション解析により、覆い隠し状況下での長距離キューの重要性が示された。

実験結果

リサーチクエスチョン

  • RQ1非覆い隠しデータでのみトレーニングされたパーツ検出システムは、部分的に覆い隠された物体に対しても高い精度を維持できるか?
  • RQ2統合的オブジェクト検出と比較して、局所的視覚的キューの統合は覆い隠し状況下でどのように性能を発揮するか?
  • RQ3パーツ検出における空間的文脈モデリングの、覆い隠しに対する耐障害性に与える影響は何か?
  • RQ4投票フレームワークは、支援する視覚的コンセプトの数や空間的近傍サイズに対してどれほど感受性を示すか?
  • RQ5本手法は、トレーニングに明示的な覆い隠しデータを含めない状況でも、未観測の覆い隠しパターンに一般化可能か?

主な発見

  • 提案された投票法は、視覚的コンセプトを45から10に減らした際の精度低下が最小(7.8%)であり、ベースラインモデルに比べて顕著に優れている。
  • 近傍閾値を小さくした(γ_th = 56)場合、4.5%の精度低下を示し、覆い隠し状況下で長距離視覚的キューの重要性が裏付けられた。
  • スケール予測モジュールは検出精度を顕著に向上させ、オラクルのスケール情報が欠落した状況下でも、投票法が最も性能低下が小さいことを示した。
  • 2~4体の遮蔽体を含む覆い隠しテストセットにおいて、投票フレームワークはFaster R-CNNや他のベースラインを上回る平均平均精度(mAP)を達成した。
  • 重い覆い隠し状況下でも高い耐障害性を維持し、遮蔽が激しくなるに従い、競合手法との性能差が最大に拡大した。
  • 診断的分析により、十分な数の視覚的コンセプトが重要である一方、多すぎると性能向上に寄与せず計算コストが増加することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。