[論文レビュー] Reviving Iterative Training with Mask Guidance for Interactive Segmentation
この論文は、前回のステップで予測されたマスクを活用して精度と安定性を向上させる、フィードフォワードで反復的なクリックベースのインタラクティブセグメンテーションモデルを提案する。推論時最適化を必要とせず、すべての主要ベンチマークで最先端の性能を達成している。主な貢献は、COCO+LVISから得た高品質で多様なアノテーションを用いた、シンプルだが効果的な反復的トレーニング方式であり、モデルの一般化性能を著しく向上させ、新規オブジェクトのセグメンテーションと外部マスクの補正の両方を可能にしている。
Recent works on click-based interactive segmentation have demonstrated state-of-the-art results by using various inference-time optimization schemes. These methods are considerably more computationally expensive compared to feedforward approaches, as they require performing backward passes through a network during inference and are hard to deploy on mobile frameworks that usually support only forward passes. In this paper, we extensively evaluate various design choices for interactive segmentation and discover that new state-of-the-art results can be obtained without any additional optimization schemes. Thus, we propose a simple feedforward model for click-based interactive segmentation that employs the segmentation masks from previous steps. It allows not only to segment an entirely new object, but also to start with an external mask and correct it. When analyzing the performance of models trained on different datasets, we observe that the choice of a training dataset greatly impacts the quality of interactive segmentation. We find that the models trained on a combination of COCO and LVIS with diverse and high-quality annotations show performance superior to all existing models. The code and trained models are available at https://github.com/saic-vul/ritm_interactive_segmentation.
研究の動機と目的
- 複雑な推論時最適化スキームを用いずに最先端のインタラクティブセグメンテーション性能を達成できるかを調査すること。
- トレーニングデータセットの品質と多様性がインタラクティブセグメンテーション性能に与える影響を評価すること。
- 前回のマスク出力を入力として取り入れることで、反復的に予測を改善するフィードフォワードモデルを構築し、新規オブジェクトのセグメンテーションと外部マスクの補正の両方を可能にすること。
- 高品質で多様なデータセットでトレーニングされた強力なベースラインが、より複雑な修正機構を備えたモデルを上回ることを示すこと。
提案手法
- 前回のクリックからのセグメンテーションマスクをネットワークの入力として組み込むフィードフォワードモデルを提案し、逆伝播なしで反復的改善を可能にする。
- 各ステップで、前回の反復からの正例マスクを用いて、より良いマスクを予測するようモデルをトレーニングする反復的トレーニング手順を導入する。
- オブジェクトカテゴリにわたる一般化性能を向上させるために、多様で高品質なインスタンスアノテーションを活用するため、COCO+LVISの組み合わせデータセットでモデルをトレーニングする。
- 特徴表現を強化するため、HRNetベースのバックボーン(H18、H18s、H32)にOCR(オブジェクトコンテキスト表現)モジュールを組み込む。
- データオーグメンテーションやヒューリスティックなクリックシミュレーションを避けるために、トレーニング中に標準的なランダムポイントサンプリングを用いてクリックをシミュレートする。
- 各クリックが単一の順方向パスによってマスク予測を更新する多段階推論プロセスを適用し、効率性を維持する。
実験結果
リサーチクエスチョン
- RQ1複雑な推論時最適化に依存する最新手法よりも、シンプルなフィードフォワードモデルに反復的マスクガイダンスを組み込んだモデルが優れた性能を示せるか?
- RQ2特に多様性とアノテーション品質に差があるトレーニングデータセットの選択が、インタラクティブセグメンテーション性能に与える影響はいかほどか?
- RQ3COCO+LVISでトレーニングされたモデルは、優れた一般化性能を発揮し、新規オブジェクトのセグメンテーションとマスク補正の両方を処理できるか?
- RQ4マスクフィードバックを用いた反復的トレーニングは、追加のクリック後に精度の低下を防ぎ、モデルの安定性を向上させるか?
主な発見
- HRNet-18s+OCRバックボーンを搭載した提案モデル(IT-M)は、Pascal VOCでNoC@90が4.70を達成し、すべての先行手法を上回った。
- Berkeleyデータセットでは、H18s IT-MバージョンがNoC@90で1.68を達成し、以前のSOTA(3.07)を著しく上回った。
- COCO+LVISでトレーニングされたモデルは、GrabCutでNoC@85が1.54を達成し、以前のSOTA(2.60)を上回った。
- 反復的モデルは、どのクリック後でも精度の低下を示さず、すべてのベンチマークで一貫して高いIoU値に収束する安定した性能を示した。
- 最小のモデル(H18s IT-M)は、より大きなバージョンと同等の性能を示し、モバイルや低計算リソースデバイスへのデプロイが可能になった。
- アブレーションスタディの結果、COCO+LVISのような多様で高品質なデータセットでのトレーニングが不可欠であることが確認され、粗いまたは小さなデータセットでトレーニングしたモデルは顕著に性能が劣ることが分かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。