Skip to main content
QUICK REVIEW

[論文レビュー] 1st Place Solution of LVIS Challenge 2020: A Good Box is not a Guarantee of a Good Mask

Jingru Tan, Gang Zhang|arXiv (Cornell University)|Sep 3, 2020
Central Venous Catheters and Hemodialysis参考文献 17被引用数 13
ひとこと要約

本論文は、長尾分布を示すLVISデータセットにおけるインスタンスセグメンテーションのための2段階トレーニングアプローチを提示しており、クラスの不均衡と高品質なマスク予測の両方を解決する。本手法は、ボクセルボックスのスケールおよびマスク対ボクセルボックス面積比に基づく新規なプロポーザル割り当て戦略と、Dice損失と重み付き交差エントロピーを組み合わせたバランスの取れたマスク損失を導入し、LVIS v1.0の検証セットで41.5 AP、テストデベロップメントセットで41.2 APを達成し、ベースラインを著しく上回る性能を発揮した。

ABSTRACT

This article introduces the solutions of the team lvisTraveler for LVIS Challenge 2020. In this work, two characteristics of LVIS dataset are mainly considered: the long-tailed distribution and high quality instance segmentation mask. We adopt a two-stage training pipeline. In the first stage, we incorporate EQL and self-training to learn generalized representation. In the second stage, we utilize Balanced GroupSoftmax to promote the classifier, and propose a novel proposal assignment strategy and a new balanced mask loss for mask head to get more precise mask predictions. Finally, we achieve 41.5 and 41.2 AP on LVIS v1.0 val and test-dev splits respectively, outperforming the baseline based on X101-FPN-MaskRCNN by a large margin.

研究の動機と目的

  • ラベルが極めて不均衡に分布するLVISデータセットにおける極端な長尾クラス分布に対処すること。
  • 特にボクセルボックスに比べて薄いマスクを持つカテゴリのインスタンスセグメンテーションマスク品質を向上させること。
  • 特徴マップの解像度の不一致により、ボクセルボックスがよく整列していても正確なマスク予測が保証されないという制限を克服すること。
  • 標準的な検出器がLVISで顕著に大きい、ボクセルボックスAPとマスクAPの性能差を縮小すること。
  • 表現学習とターゲットヘッド最適化を組み合わせることで、LVIS v1.0で最先端の性能を達成すること。

提案手法

  • クラス間の不均衡を軽減するために、表現学習段階でEqualization Loss (EQL) と Repeat Factor Sampling (RFS) を適用する。
  • Mosaic、回転、スケールジッターによるデータ拡張を実施し、Open ImagesおよびLVISからの疑似ラベルを用いた自己学習を活用して表現を向上させる。
  • ボクセルボックスのスケールとマスク対ボクセルボックス面積比の両方を考慮した新規なプロポーザル割り当て戦略を提案し、式 (1) を用いて特徴マップレベルを選択する。
  • 面積比に基づく動的フォアグラウンド重み付けを組み込んだ、Dice損失と重み付きバイナリクロスエントロピーを統合したバランスの取れたマスク損失を導入し、式 (2) で定義される。
  • 微調整段階でBalanced GroupSoftmaxを適用し、レアカテゴリとコモンカテゴリの分類器重みをバランスさせる。
  • テスト時拡張として、スケールに適応したボクセルボックスフィルタリング、稀少カテゴリのスコア再重み付け、ボクセルボックススケールおよび面積比に基づくマスク予測選択を実装する。

実験結果

リサーチクエスチョン

  • RQ1スパarselyアノテートされたLVISで、オープンボリュームデータセットからの疑似ラベルを用いた自己学習が表現学習を向上させ得るか?
  • RQ2プロポーザル割り当てにおいてマスク対ボクセルボックス面積比を考慮することで、薄いマスクを持つインスタンスのマスク品質が向上するか?
  • RQ3薄いマスクにおけるフォアグラウンド・バックグラウンドピクセルの不均衡を考慮したバランスの取れたマスク損失は、セグメンテーション精度を向上させるか?
  • RQ4表現学習に続くヘッド特化型微調整を組み合わせた2段階トレーニングパイプラインが、ボクセルボックスとマスクのAP差をどの程度縮小できるか?
  • RQ5EQL、RFS、自己学習、および新規ヘッドコンponentsの組み合わせが、長尾LVISベンチマークで最先端の性能を達成するのにどの程度有効か?

主な発見

  • 提案手法は、LVIS v1.0の検証セットで41.5 APを達成し、ResNeXt-101を用いたベースラインMask-RCNN(27.26 AP)を著しく上回った。
  • テストデベロップメントセットでは41.23 APを達成し、ホスト提供のベースラインを14ポイント以上上回った。
  • マスクAPとボクセルボックスAPの性能差は2.3にまで縮小され、ベースラインの2.9から改善された。これはマスク品質の向上を示している。
  • アブレーションスタディの結果、Balanced GroupSoftmax、新規プロポーザル割り当て、およびバランスの取れたマスク損失を組み合わせることで、APが33.2から38.8に上昇し、5.6ポイントの向上が得られた。
  • Open Imagesからの疑似ラベルを用いた自己学習とinstaboost拡張が、最終モデルで2.5ポイントのAP向上に寄与した。
  • スケールに適応したフィルタリングと稀少カテゴリのスコア再重み付けを含むテスト時拡張により、性能が0.3~0.5ポイント向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。