Skip to main content
QUICK REVIEW

[論文レビュー] Seesaw Loss for Long-Tailed Instance Segmentation

Jiaqi Wang, Wenwei Zhang|arXiv (Cornell University)|Aug 23, 2020
Advanced Neural Network Applications参考文献 57被引用数 5
ひとこと要約

本論文は、尾数クラスの過剰なペナルティを軽減するための緩和要因と、誤検出を防ぐための補償要因を適用することで、勾配の再バランスを図る動的で自己キャリブレーション可能な損失関数「Seesaw Loss」を提案する。この手法は、LVISデータセットにおいて、Mask R-CNNを用いた際には交差エントロピー損失と比較してAPを6.0%向上、Cascade Mask R-CNNを用いた際には6.4%向上し、装飾のないシンプルなエンドツーエンド学習パイプラインで最先端の性能を達成した。

ABSTRACT

Instance segmentation has witnessed a remarkable progress on class-balanced benchmarks. However, they fail to perform as accurately in real-world scenarios, where the category distribution of objects naturally comes with a long tail. Instances of head classes dominate a long-tailed dataset and they serve as negative samples of tail categories. The overwhelming gradients of negative samples on tail classes lead to a biased learning process for classifiers. Consequently, objects of tail categories are more likely to be misclassified as backgrounds or head categories. To tackle this problem, we propose Seesaw Loss to dynamically re-balance gradients of positive and negative samples for each category, with two complementary factors, i.e., mitigation factor and compensation factor. The mitigation factor reduces punishments to tail categories w.r.t. the ratio of cumulative training instances between different categories. Meanwhile, the compensation factor increases the penalty of misclassified instances to avoid false positives of tail categories. We conduct extensive experiments on Seesaw Loss with mainstream frameworks and different data sampling strategies. With a simple end-to-end training pipeline, Seesaw Loss obtains significant gains over Cross-Entropy Loss, and achieves state-of-the-art performance on LVIS dataset without bells and whistles. Code is available at https://github.com/open-mmlab/mmdetection.

研究の動機と目的

  • ヘッドクラスが支配的で、テイルクラスが背景やヘッドクラスとして誤分類される長尾データセットにおけるインスタンスセグメンテーションモデルの低性能を是正すること。
  • トレーニング中にヘッドクラスからの過剰なネガティブサンプルがもたらす勾配の不均衡を克服すること。
  • 事前に計算されたデータ分布に依存せずに、リアルタイムのクラスサンプル蓄積と誤分類パターンに基づいて勾配を動的に調整する損失関数を開発すること。
  • 複雑なデータサンプリングや分離学習パイプラインを用いずに、LVISのような長尾ベンチマークで最先端の性能を達成すること。
  • 本手法が分布に依存せず、あらゆるデータサンプラーおよび主流のインスタンスセグメンテーションフレームワークと互換性を持つこと。

提案手法

  • 各カテゴリに対して緩和要因と補償要因の2つの補完的要因を用いて勾配を動的に再バランスするSeesaw Lossを導入する。
  • 累積的なカテゴリ間のトレーニングインスタンス比に基づいて、テイルクラスのネガティブサンプルの損失勾配をスケーリングダウンする緩和要因を適用する。
  • 誤分類されたテイルカテゴリのインスタンスに対するペナルティを増加させることで、誤検出を低減する補償要因を適用する。
  • トレーニング中のリアルタイムで蓄積されたサンプル数を用いて真のデータ分布を近似し、動的かつ自己キャリブレーション可能なバランスを実現する。
  • アーキテクチャの変更なしに、Mask R-CNN や Cascade Mask R-CNN などのオブジェクト検出器の分類ブランチにSeesaw Lossを統合する。
  • TSD、CARAFE、強化されたネック、デュアルヘッド分類などの強力なトレーニング要素とSeesaw Lossを組み合わせることで、さらなる性能向上を達成する。

実験結果

リサーチクエスチョン

  • RQ1静的再重み付けに依存せずに、長尾データ分布に起因する勾配の不均衡を、インスタンスセグメンテーションで効果的に軽減する方法は何か?
  • RQ2リアルタイムのトレーニング統計に適応する動的損失関数は、誤検出を増加させることなくテイルカテゴリのパフォーマンスを向上させられるか?
  • RQ3Seesaw Lossは、標準の交差エントロピー損失と比較して、LVISのような長尾ベンチマークにおけるインスタンスセグメンテーションの正確性をどの程度向上させるか?
  • RQ4Seesaw Lossは、ランダムサンプリングやリピートファクターサンプリングを含む、さまざまな検出フレームワークやデータサンプリング戦略においても有効か?
  • RQ5Seesaw Lossは、長尾学習における複雑な分離学習パイプラインの必要性を排除できるか?

主な発見

  • Seesaw Lossは、ランダムサンプリングを用いたMask R-CNNと組み合わせた場合、LVIS v1バリデーションスプリットで交差エントロピー損失と比較してAPが6.0%の絶対的向上を達成した。
  • リピートファクターサンプラーを用いた場合、同じMask R-CNN設定で交差エントロピー損失と比較してAPが2.1%向上した。
  • Cascade Mask R-CNNを用いた場合、ランダムサンプリングでAPが6.4%向上、リピートファクターサンプリングで2.3%向上し、優れた一般化性能を示した。
  • 外部データやImageNet-1k事前学習を除く追加のアノテーションを用いずに、1つのHTC-LiteモデルでLVISテストデブスプリットで38.92%のAPを達成した。
  • Seesaw Lossは、ImageNet-LT長尾画像分類ベンチマークでも分類精度を6%向上させ、インスタンスセグメンテーションを超える汎用性を示した。
  • アブレーションスタディの結果、TSD、CARAFE、デュアルヘッド分類といった強力なコンponentsと組み合わせても、Seesaw Lossが既存手法を上回ることを確認した。これは、Seesaw Lossが即挿入可能なモジュールとしての有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。