Skip to main content
QUICK REVIEW

[論文レビュー] MP-Former: Mask-Piloted Transformer for Image Segmentation

Hao Zhang, Feng Li|arXiv (Cornell University)|Mar 13, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

MP-Formerは、すべてのデコーダー層でノイズが加えられた正例マスクをアテンションマスクとして入力することで、マスクパイロットトレーニングというアプローチを導入し、正確な予測の再構築を可能にすることで、Mask2Formerを向上させた。これにより、層間での一貫性のないマスク予測が軽減され、クエリの利用効率が向上し、ResNet-50を用いたCityscapesで+2.3 APおよび+1.6 mIoUの向上が達成された。また、トレーニング時間を半減させつつ、推論時の計算コストはほとんど増加しない。

ABSTRACT

We present a mask-piloted Transformer which improves masked-attention in Mask2Former for image segmentation. The improvement is based on our observation that Mask2Former suffers from inconsistent mask predictions between consecutive decoder layers, which leads to inconsistent optimization goals and low utilization of decoder queries. To address this problem, we propose a mask-piloted training approach, which additionally feeds noised ground-truth masks in masked-attention and trains the model to reconstruct the original ones. Compared with the predicted masks used in mask-attention, the ground-truth masks serve as a pilot and effectively alleviate the negative impact of inaccurate mask predictions in Mask2Former. Based on this technique, our \M achieves a remarkable performance improvement on all three image segmentation tasks (instance, panoptic, and semantic), yielding $+2.3$AP and $+1.6$mIoU on the Cityscapes instance and semantic segmentation tasks with a ResNet-50 backbone. Our method also significantly speeds up the training, outperforming Mask2Former with half of the number of training epochs on ADE20K with both a ResNet-50 and a Swin-L backbones. Moreover, our method only introduces little computation during training and no extra computation during inference. Our code will be released at \url{https://github.com/IDEA-Research/MP-Former}.

研究の動機と目的

  • Mask2Formerにおける連続するデコーダー層間での一貫性のないマスク予測を是正すること。これは最適化の劣化とクエリ利用効率の低下を引き起こす。
  • トレーニング中に正例マスクをパイロット信号として用いることで、Transformerにおけるマスク付きアテンションを画像セグメンテーションに改善すること。
  • 推論コストやモデルの複雑さを増加させずにパフォーマンスを向上させるトレーニング手法を開発すること。
  • 複数のベンチマークで、分類精度を維持または向上させつつ、トレーニング収束を加速すること。

提案手法

  • デコーダークエリを、標準的なバイパートマッチングに使用する部分と、正例クラス埋め込みとマスクをクエリおよびアテンションマスクとして使用するマスクパイロット(MP)部分に分割する。
  • ノイズが加えられた入力を元に元の正例マスクとラベルを再構築できるようにMP部分を訓練する。これにより、ロバストネスを向上させるためにポイントノイズとラベルの反転を用いる。
  • すべてのデコーダー層にわたってマルチレイヤーのマスクパイロットトレーニングを適用し、予測の安定性と一貫性を向上させる。
  • 粗いものから細かいものへの特徴マップをデコーダーで使用し、最大の特徴マップ(1/8解像度)をすべての層で共通して使用することで、特徴の精錬を向上させる。
  • クラス埋め込みをMP部分のクエリとして使用することで、ラベルガイドドトレーニングを導入し、マスクとクラス予測の両方の回復を可能にする。
  • 正例マスクとラベルにノイズ増強(ポイント、スケーリング、シフト)を適用し、一般化性能とロバストネスを強化する。

実験結果

リサーチクエスチョン

  • RQ1デコーダー層間での一貫性のないマスク予測は、Mask2Formerのパフォーマンスを低下させるか。その影響は定量的に測定可能か?
  • RQ2マスク付きアテンションで正例マスクをパイロット信号として使用することで、予測の一貫性とパフォーマンスが向上するか?
  • RQ3ノイズ増強を伴うマルチレイヤーのマスクパイロットトレーニングは、クエリ利用効率とセグメンテーション精度の向上に寄与するか?
  • RQ4提案手法は、トレーニングステップ数を削減しつつ、Mask2Formerのパフォーマンスを維持または上回ることができるか?
  • RQ5この手法は、推論時のオーバーヘッドやアーキテクチャの変更を顕著に引き起こすか?

主な発見

  • MP-Formerは、ResNet-50バックボーンを用いたCityscapesで、インスタンスセグメンテーションおよびセマンティックセグメンテーションにおいて+2.3 APおよび+1.6 mIoUの向上を達成した。
  • ADE20Kでは、36エポックでトレーニングしたMP-Formerが、50エポックでトレーニングしたMask2Formerと同等の性能を発揮し、80kステップでは160kステップでトレーニングしたMask2Formerと同等の性能を達成した。
  • Swin-Lバックボーンを用いた場合、72エポックでCOCOインスタンスセグメンテーションで+1.1 APの向上を達成し、Mask2Formerを上回った。
  • この手法は、レイヤー単位のクエリ利用効率と平均IoUを大幅に向上させ、予測の一貫性の低減が有効であることを裏付けた。
  • ポイントノイズを追加すると+0.3 APの向上が得られたが、スケーリングおよびシフトノイズでは効果が認められなかった。
  • 最大の特徴マップ(1/8)をすべての層で共通して使用した場合、MP-Formerでは粗いものから細かいものへの特徴マップの使用よりも優れた性能を発揮した。これは、Mask2Formerの設計とは対照的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。