[論文レビュー] Mask Scoring R-CNN
Mask Scoring R-CNN は、予測マスクと正解マスクの間のオーバーラップ率(IoU)を予測する新しいヘッド、MaskIoU ヘッドを提案することで、インスタンスセグメンテーションのスコアリングを改善する。特徴量からマスク品質を直接回帰し、分類スコアと組み合わせることで、複数のバックボーンでマスクR-CNNに比べて一貫したAP上昇(約1.5%)を達成し、マスクスコアを実際のマスク品質に一致させる。
Letting a deep network be aware of the quality of its own predictions is an interesting yet important problem. In the task of instance segmentation, the confidence of instance classification is used as mask quality score in most instance segmentation frameworks. However, the mask quality, quantified as the IoU between the instance mask and its ground truth, is usually not well correlated with classification score. In this paper, we study this problem and propose Mask Scoring R-CNN which contains a network block to learn the quality of the predicted instance masks. The proposed network block takes the instance feature and the corresponding predicted mask together to regress the mask IoU. The mask scoring strategy calibrates the misalignment between mask quality and mask score, and improves instance segmentation performance by prioritizing more accurate mask predictions during COCO AP evaluation. By extensive evaluations on the COCO dataset, Mask Scoring R-CNN brings consistent and noticeable gain with different models, and outperforms the state-of-the-art Mask R-CNN. We hope our simple and effective approach will provide a new direction for improving instance segmentation. The source code of our method is available at \url{https://github.com/zjhuang22/maskscoring_rcnn}.
研究の動機と目的
- インスタンスセグメンテーションにおける分類スコアの信頼度と実際のマスク品質の不一致を是正すること。
- より正確なマスクスコアリングメカニズムを学習することで、インスタンスセグメンテーションの性能を向上させること。
- 学習されたマスク品質予測子を用いてマスクスコアを補正し、正解マスクとの実際のIoUをよりよく反映させること。
- 仮説スコアの精錬により、COCO AP などの評価指標を向上させるシンプルで効果的な手法を提供すること。
- 分類とは分離したマスク品質推定により、異なるバックボーンネットワークにわたるより良い一般化を可能にすること。
提案手法
- RoI 特徴量と予測マスクを入力として受け取り、予測マスクとその正解マスクの間のIoUを回帰する MaskIoU ヘッドを導入する。
- 各インスタンスの正解IoUに基づいて、単純なL1回帰損失を用いて MaskIoU ヘッドを学習する。
- 予測された MaskIoU と元の分類スコアを組み合わせて、洗練されたマスクスコアを形成する:最終スコア = 分類スコア × 予測された_MaskIoU。
- バックボーンや検出ヘッドを変更せずに、Mask R-CNN フレームワークに MaskIoU ヘッドを統合する。
- 推論の一貫性を保つために、SoftNMS を用いて提案領域を順位付けし、上位100件を選択する。
- 低IoUのものも含むすべての学習サンプルを用いて MaskIoU ヘッドを学習することで、一般化性能と正解との相関性を向上させる。
実験結果
リサーチクエスチョン
- RQ1予測されたマスク品質予測子をマスクスコアの再重み付けに用いることで、インスタンスセグメンテーションの性能向上が達成できるか?
- RQ2異なるバックボーンネットワーク間で、予測された MaskIoU と正解IoU の相関性はどのように変化するか?
- RQ3マスクスコアリングにおいて、正解IoUを上限として用いることでどのような影響があるか?
- RQ4提案手法は、異なるバックボーンアーキテクチャーやモデルスケールにおいて一貫して性能を向上させるか?
- RQ5MaskIoU ヘッドの追加による計算コストは何か?実際には無視できる程度のものか?
主な発見
- COCO 2017 検証セットにおいて、予測されたIoUと正解IoUの間の相関係数は約0.74に達し、強力な予測能力を示している。
- 低IoUのものも含むすべての学習サンプルを用いて MaskIoU ヘッドを学習すると、しきい値ベースのサンプリングよりも優れた性能を発揮する。
- ResNet-18 FPN を用いた場合、Mask Scoring R-CNN は Mask R-CNN よりも COCO AP を1.6ポイント向上させ、ResNet-101 DCN+FPN では1.4ポイント向上させた。
- 予測された IoU を正解IoU に置き換えた理想状態(完全な予測)では、ResNet-18 FPN では追加で2.2ポイント、ResNet-101 DCN+FPN では2.6ポイントのAP上昇が得られるだろう。
- MaskIoU ヘッドの計算コストは無視できるほど小さく、1つの提案あたりわずか ~0.39G FLOPs であり、TITAN V では推論速度が Mask R-CNN とほとんど同一である。
- 異なるバックボーンにおいて一貫した性能向上が得られ、アーキテクチャの変更に対しても一般化性とロバスト性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。