[論文レビュー] Forest R-CNN: Large-Vocabulary Long-Tailed Object Detection and Instance Segmentation
Forest R-CNN は、大規模な語彙、長尾分布を示す物体検出およびインスタンスセグメンテーションに対処するために分類の森と NMS リサンプリング手法を提案する。階層的ツリー構造を用いて細分化されたクラスをより粗い親クラスにクラスタリングすることで、細分化分類におけるノイズの多いログ確率を抑制する。複数のツリーが森を形成し、投票を行う。この手法は、LVIS v0.5 において、マスク R-CNN と比較して、レアカテゴリで 11.5% の AP 向上、全体の AP で 3.9% の向上を達成した。
Despite the previous success of object analysis, detecting and segmenting a large number of object categories with a long-tailed data distribution remains a challenging problem and is less investigated. For a large-vocabulary classifier, the chance of obtaining noisy logits is much higher, which can easily lead to a wrong recognition. In this paper, we exploit prior knowledge of the relations among object categories to cluster fine-grained classes into coarser parent classes, and construct a classification tree that is responsible for parsing an object instance into a fine-grained category via its parent class. In the classification tree, as the number of parent class nodes are significantly less, their logits are less noisy and can be utilized to suppress the wrong/noisy logits existed in the fine-grained class nodes. As the way to construct the parent class is not unique, we further build multiple trees to form a classification forest where each tree contributes its vote to the fine-grained classification. To alleviate the imbalanced learning caused by the long-tail phenomena, we propose a simple yet effective resampling method, NMS Resampling, to re-balance the data distribution. Our method, termed as Forest R-CNN, can serve as a plug-and-play module being applied to most object recognition models for recognizing more than 1000 categories. Extensive experiments are performed on the large vocabulary dataset LVIS. Compared with the Mask R-CNN baseline, the Forest R-CNN significantly boosts the performance with 11.5% and 3.9% AP improvements on the rare categories and overall categories, respectively. Moreover, we achieve state-of-the-art results on the LVIS dataset. Code is available at https://github.com/JialianW/Forest_RCNN.
研究の動機と目的
- 長尾分布を示す多数の物体カテゴリを検出・セグメンテーションする課題に対処すること。
- 階層的な親子クラス関係を活用して、細分化分類器におけるノイズの多いログ確率を低減すること。
- 学習データに過小に表現されるレア(テール)クラスの認識性能を向上させること。
- 既存の物体認識モデルと互換性のあるプラグアンドプレイモジュールを構築し、スケーラブルな展開を可能とすること。
- 新しいリサンプリング戦略を用いて長尾データ分布を再バランス化し、レアクラスの学習を強化すること。
提案手法
- カテゴリ関係の事前知識を用いて、細分化されたクラスをより粗い親クラスにクラスタリングすることで分類ツリーを構築する。
- 親クラスの確率を用いて、細分化分類器におけるノイズの多いログ確率を抑制し、信頼性の高いキャリブレーションを向上させる。
- 異なる事前知識の種類に基づいて複数のツリーを構築し、分類の森を形成する。各ツリーが最終的な細分化予測に対して投票する。
- NMS リサンプリングを提案する。これは、カテゴリごとに NMS の閾値を適応的に調整することで、長尾データ分布を再バランス化するリサンプリング手法である。
- 分類の森と NMS リサンプリングを、マスク R-CNN などの既存の2段階検出器にプラグインモジュールとして統合する。
- ツリー構造に基づく監視を用い、親クラスおよび細分化クラスの両方でクロスエントロピー損失を用いて、エンドツーエンドでモデルを学習する。
実験結果
リサーチクエスチョン
- RQ1階層的なクラス関係をどのように活用することで、大規模語彙分類におけるノイズの多いログ確率を低減できるか?
- RQ21つのツリーではなく複数の分類ツリー(森)を用いることで、分類のロバストネスにどのような影響を与えるか?
- RQ3NMS リサンプリングによる適応的リサンプリングは、物体検出およびインスタンスセグメンテーションにおける長尾データの不均衡を効果的に緩和できるか?
- RQ4提案手法は、最先端のベースラインと比較して、レアカテゴリのパフォーマンスをどの程度向上させるか?
- RQ5Forest R-CNN は、LVIS ベンチマーク上で異なるバックボーンアーキテクチャーや学習設定において、どの程度一般化できるか?
主な発見
- LVIS v0.5 のバリデーションセットにおいて、Forest R-CNN はマスク R-CNN ベースラインと比較して、レアカテゴリで 11.5% の AP 向上、全体の AP で 3.9% の向上を達成した。
- LVIS v1.0 において、Forest R-CNN は全体の AP を 4% 向上させ、レアカテゴリの AP を 14.2% 向上させた。
- ResNet-50-FPN バックボーンを用いても、EQL や De-confound といった複雑なモデルを上回る、LVIS v0.5 における最先端のパフォーマンスを達成した。
- 分類の森の設計により予測が安定化した:正解予測の信頼度スコアは上昇し、誤り予測のスコアは抑制された。
- NMS リサンプリングはデータ分布の再バランスに効果的で、アーキテクチャの変更なしに、テールクラスの学習を向上させた。
- ハイパーパramータの選択に対してロバストである:1000 個の細分化クラスを 25〜50 個の親クラスにクラスタリングしても、性能は安定した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。