Skip to main content
QUICK REVIEW

[論文レビュー] Attention-based Joint Detection of Object and Semantic Part

Keval Morabia, Jatin Arora|arXiv (Cornell University)|Jul 5, 2020
Advanced Neural Network Applications参考文献 7被引用数 10
ひとこと要約

本論文では、共有特徴を用いる2つのFaster R-CNNモデルを用いて、共同で物体および意味的部品を検出するためのアテンションベースの特徴統合手法を提案する。関連する物体-部品ペアをアテンションスコアで重み付けすることで、PASCAL-Part 2010で部品検出のmAPが最大83.3%向上し、物体検出においてもわずかな向上を示しており、文脈的なアテンションがマルチタスク視覚認識において有効であることを示している。

ABSTRACT

In this paper, we address the problem of joint detection of objects like dog and its semantic parts like face, leg, etc. Our model is created on top of two Faster-RCNN models that share their features to perform a novel Attention-based feature fusion of related Object and Part features to get enhanced representations of both. These representations are used for final classification and bounding box regression separately for both models. Our experiments on the PASCAL-Part 2010 dataset show that joint detection can simultaneously improve both object detection and part detection in terms of mean Average Precision (mAP) at IoU=0.5.

研究の動機と目的

  • 共有視覚特徴を用いて物体とその意味的部品を同時に検出する課題に対処すること。
  • 物体とその部品間の文脈的関係をモデル化することで、検出性能を向上させること。
  • LSTMや単純な特徴平均化に依存する従来手法の限界を克服すること。
  • 自己アテンション機構を用いて、特徴統合中に関連する部品や物体を動的に重み付けすることの有効性を検討すること。
  • アテンションベースの統合が単純な平均化よりも優れた性能を発揮することを実証すること。

提案手法

  • 物体検出と部品検出の両方の目的で、共有されたResNet-50バックボーンと特徴ピラミッドネットワーク(FPN)を備えた2つのFaster R-CNNモデルを活用する。
  • オブジェクトと部品の両方の領域提案を別々のRPNが生成するため、マルチスケールRoIアラインとFPNを用いて、固定サイズの特徴を抽出する。
  • 統合閾値を用いて関連する物体-部品ペアを定義する:intersection_area(物体, 部品) ≥ fusion_thresh × area(部品)。
  • 各関連する物体-部品ペアに対してアテンションスコアを計算し、特徴の重み付き平均を算出するアテンション層を実装する。
  • 融合された特徴を元の特徴と連結し、物体ヘッドおよび部品ヘッドにおける最終分類およびボクシングボックス回帰に使用する。
  • MS COCOからの転移学習を用いてモデルを訓練し、ランダムな水平反転によるデータ拡張を実施する。

実験結果

リサーチクエスチョン

  • RQ1アテンションベースの特徴統合は、単体モデルを上回る性能を発揮するのか?
  • RQ2アテンション機構は、物体とその部品の関係をモデル化する際に、単純な平均プーリングと比べてどのように優れているのか?
  • RQ3共有特徴を用いた共同学習は、PASCAL-Part 2010データセットにおける部品検出mAPにどの程度の向上をもたらすのか?
  • RQ4訓練データに人物の部品が含まれている場合、モデルは動物の部品を検出できるのか?
  • RQ5部品検出における非最大抑制(NMS)の閾値設定に、性能はどの程度感度を示すのか?

主な発見

  • 共同検出モデルは、IoU=0.5における顔クラスの部品検出mAPを最大83.3%まで向上させ、単体モデルを著しく上回った。
  • 体幹クラスでは、単体モデルの30.6%から共同モデルの80.3%にmAPが上昇し、顕著な性能向上が確認された。
  • 物体検出のmAPもわずかに向上し、羽のクラスでは25.9%から29.3%に上昇した。これは、一貫したがわずかな向上を示している。
  • モデルは、動物クラスの学習のみで訓練されたにもかかわらず、人物の部品(例:脚、体幹)を検出できた。これは、共有された部品の外観によるクラスの混同を示している。
  • 部品検出のNMS閾値を変更しても、IoU=0.5におけるmAPは52.1%を超えることはなく、性能の飽和または重複検出への過学習の兆候が示された。
  • 関連部品の単純な平均プーリングでは、単体モデルを上回る性能向上が得られず、アテンションベースの重み付けの必要性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。