[論文レビュー] RMP-SAM: Towards Real-Time Multi-Purpose Segment Anything
本稿では、1つの統合アーキテクチャを用いてインタラクティブ・パンオプティック・ビデオインスタンスセグメンテーションを実行できる、初めてのリアルタイムマルチ目的セグメンテーションモデルであるRAP-SAMを提案する。軽量エンコーダー、二重アダプタを備えた統合デコーダー、および効率的なプーリングベースのダイナミック畳み込みを採用することで、COCOおよびYouTube-VISベンチマークで先行手法を上回る、最先端のスピード・アキュラシーのトレードオフを達成し、リアルタイムで動作する。
Recent segmentation methods, which adopt large-scale data training and transformer architecture, aim to create one foundation model that can perform multiple tasks. However, most of these methods rely on heavy encoder and decoder frameworks, hindering their performance in real-time scenarios. To explore real-time segmentation, recent advancements primarily focus on semantic segmentation within specific environments, such as autonomous driving. However, they often overlook the generalization ability of these models across diverse scenarios. Therefore, to fill this gap, this work explores a novel real-time segmentation setting called real-time multi-purpose segmentation. It contains three fundamental sub-tasks: interactive segmentation, panoptic segmentation, and video instance segmentation. Unlike previous methods, which use a specific design for each task, we aim to use only a single end-to-end model to accomplish all these tasks in real-time. To meet real-time requirements and balance multi-task learning, we present a novel dynamic convolution-based method, Real-Time Multi-Purpose SAM (RMP-SAM). It contains an efficient encoder and an efficient decoupled adapter to perform prompt-driven decoding. Moreover, we further explore different training strategies and one new adapter design to boost co-training performance further. We benchmark several strong baselines by extending existing works to support our multi-purpose segmentation. Extensive experiments demonstrate that RMP-SAM is effective and generalizes well on proposed benchmarks and other specific semantic tasks. Our implementation of RMP-SAM achieves the optimal balance between accuracy and speed for these tasks.Our code and model are available at https://github.com/xushilin1/RAP-SAM/.
研究の動機と目的
- 画像・動画・インタラクティブセグメンテーションのタスクを統合するリアルタイムで多目的なセグメンテーションモデルの不足に対処すること。
- 厳密な推論速度制約のもとで、インタラクティブセグメンテーション、パンオプティックセグメンテーション、ビデオインスタンスセグメンテーションのすべてのタスクで高い性能を達成する1つのモデルを開発すること。
- 複数のセグメンテーションタスクにわたる性能をバランスさせるために、カスケード型または重いコンponentsを用いない効率的なアーキテクチャとトレーニング戦略を検討すること。
- エッジデバイスへのファウンデーションモデルの実用的導入を可能にするために、速度とモデル効率性を最適化すること。
- COCOおよびYouTube-VISデータセットを用いた共同コ・トレーニングを実施し、リアルタイム全目的セグメンテーションの新しいベンチマークを確立すること。
提案手法
- インタラクティブ・パンオプティック・ビデオセグメンテーションの3つのタスクに共通するクエリを用いた統合デコーダーを提案し、1回のフォワードパスで全タスクを処理する。
- 推論速度を向上させるために、計算コストの高いピxls単位のクロスアテンションに代わる、軽量な特徴抽出器とプーリングベースのダイナミック畳み込みを採用する。
- インタラクティブセグメンテーションとセマンティックレベルのセグメンテーションタスク間の知識伝達をバランスさせるために、二重アダプタ設計を導入し、コ・トレーニング性能を向上させる。
- ラティアンシーを増加させるカスケード型デコーダーを回避するため、すべてのタスクに同一のピラミッド特徴マップを用いる。
- COCOおよびYouTube-VISデータセットを同じハイパーパrameterで共同コ・トレーニングすることで、マルチタスク一般化を可能にする。
- 安定したトレーニングを実現するため、大規模なジターリング(LSJ)データオーグメンテーションと、線形ウォームアップ+コサイン減衰の学習率スケジュールを採用する。
実験結果
リサーチクエスチョン
- RQ11つのリアルタイムモデルが、インタラクティブセグメンテーション、パンオプティックセグメンテーション、ビデオインスタンスセグメンテーションのすべてのタスクで高い性能を達成できるか?
- RQ2効率的なアーキテクチャ設計は、マルチ目的セグメンテーションにおいて、正確さとスピードの両立をどのように実現できるか?
- RQ3コ・トレーニングを可能にするために、インタラクティブセグメンテーションとセマンティックレベルセグメンテーションの間で最適なトレーニング戦略とアダプタメカニズムは何か?
- RQ4プーリングベースのダイナミック畳み込みは、クロスアテンションに代わっても正確さを維持しながら推論速度を向上させられるか?
- RQ5共有クエリを備えた統合デコーダーは、リアルタイム制約のもとで、多様なセグメンテーションタスクにどのように一般化するか?
主な発見
- RAP-SAMは、提案されたリアルタイム全目的セグメンテーションベンチマークにおいて、比較対象のすべての手法と比べて最良のスピード・アキュラシーのトレードオフを達成した。
- ResNet-50を用いた場合、インタラクティブセグメンテーションで58.1 mIoU、パンオプティックセグメンテーションで43.0 PQを達成し、アダプタを備えたMask2Formerを1.1 mIoU上回り、PQでは僅か0.3の損失にとどまった。
- YouTube-VIS 2019において、特に複雑で混雑したシーンで、Mask2Formerと比較して優れたエッジ検出性能と動画追跡の一貫性を示した。
- COCOパンオプティックセグメンテーションにおいて、K-Netと比較して滑らかでより正確なマスクを維持する高い性能を発揮した。
- 失敗事例から、高密度なオブジェクト被りや密なインスタンス処理の際のインスタンスキーナル割り当ての限界が明らかになった。
- 二重アダプタ設計は、Mask2Formerなど複数のモデルに応用可能であり、RAP-SAMを超えた広範な適用可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。