Skip to main content
QUICK REVIEW

[論文レビュー] DCT-Mask: Discrete Cosine Transform Mask Representation for Instance Segmentation

Xing Shen, Jirui Yang|arXiv (Cornell University)|Nov 19, 2020
Advanced Neural Network Applications参考文献 34被引用数 9
ひとこと要約

DCT-Maskは、高分解能のバイナリマスクをコン pact で低複雑性のベクトルに符号化する、新しい離散コサイン変換(DCT)に基づくマスク表現を提案する。DCTのエネルギー集中特性を活用して重要な低周波数のマスク特徴を保持することで、推論コストを増加させずにCOCOおよびLVISでマスクAPを最大2.1%向上させ、マスクR-CNNやCascade R-CNNといった既存のピクセルベースのフレームワークにスムーズに統合可能である。

ABSTRACT

Binary grid mask representation is broadly used in instance segmentation. A representative instantiation is Mask R-CNN which predicts masks on a $28 imes 28$ binary grid. Generally, a low-resolution grid is not sufficient to capture the details, while a high-resolution grid dramatically increases the training complexity. In this paper, we propose a new mask representation by applying the discrete cosine transform(DCT) to encode the high-resolution binary grid mask into a compact vector. Our method, termed DCT-Mask, could be easily integrated into most pixel-based instance segmentation methods. Without any bells and whistles, DCT-Mask yields significant gains on different frameworks, backbones, datasets, and training schedules. It does not require any pre-processing or pre-training, and almost no harm to the running speed. Especially, for higher-quality annotations and more complex backbones, our method has a greater improvement. Moreover, we analyze the performance of our method from the perspective of the quality of mask representation. The main reason why DCT-Mask works well is that it obtains a high-quality mask representation with low complexity. Code is available at https://github.com/aliyun/DCT-Mask.git.

研究の動機と目的

  • インスタンスセグメンテーションにおける低分解能バイナリグリッドマスク表現の限界、特に細部の捉え損ないや再構成誤差の問題を解決すること。
  • 高品質で低複雑性のマスク表現を開発し、高精度を維持しながらトレーニングおよび推論のオーバーヘッドを低減すること。
  • 事前学習やアーキテクチャの大規模な見直しを必要とせず、既存のピクセルベースのインスタンスセグメンテーションフレームワークにシームレスに統合できること。
  • 多様なデータセット、バックボーン、アノテーション品質において一貫した性能向上を示すこと。
  • マスク表現の品質向上が、最小限の計算コストですらもマスクAPの向上に直接寄与することを示すこと。

提案手法

  • 本手法は、高分解能バイナリマスク(例:128×128)を離散コサイン変換(DCT)を用いて周波数ドメインに変換し、最も顕著な低周波数係数のみを保持する。
  • 得られるDCT係数ベクトル(例:300次元)は、コン pact で高精度なマスク表現であり、重要な構造的詳細を保持する。
  • DCTに基づく表現は、マスクR-CNNやCascade R-CNNなどの既存のインスタンスセグメンテーションモデルに、最小限のアーキテクチャ変更で統合可能である。
  • 事前学習や事前処理を回避し、DCTの固有の数学的性質に依存して、効率的かつリアルタイムな圧縮と再構成を実現する。
  • 推論時、逆DCTを用いてDCT係数を高分解像マスクに復元することで、正確なマスク再構成が可能になる。
  • 本手法は、任意のマスクヘッドアーキテクチャと互換性があり、異なる全結合層構成において一貫した性能向上が確認されている。

実験結果

リサーチクエスチョン

  • RQ1DCTベースのマスク表現は、低分解像バイナリグリッドよりも高い再構成忠実度を達成しながら、低計算複雑性を維持できるか?
  • RQ2マスク表現の品質向上が、多様なデータセットやバックボーンアーキテクチャにおいて測定可能なAP向上をもたらすか?
  • RQ3DCT-Maskは、事前学習や顕著なアーキテクチャ変更なしに、既存のインスタンスセグメンテーションフレームワークに効果的に統合可能か?
  • RQ4PCA や反復的レンダリング(例:PointRend)といった他のコンパクト表現手法と比較して、精度、FLOPs、推論速度の面でどのように差がつくか?
  • RQ5DCT-Maskの性能向上は、アノテーション品質やモデルの複雑さに応じてスケーリングするか?

主な発見

  • DCT-Maskは、128×128マスクを300次元のDCTベクトルに圧縮しても97%のIoUを達成し、標準の28×28バイナリグリッドの93.8%を大きく上回る。
  • COCOでは、ResNet-50で1.3%、ResNeXt-101で2.0%のAP向上を達成し、バックボーンにかかわらず一貫した向上が確認された。
  • LVISでは、ResNet-50で2.1%、ResNeXt-101で3.1%のAP向上を達成し、複雑なデータや高品質アノテーションの環境でより顕著な恩恵が得られた。
  • Cityscapesでは、APがベースラインの30.6から改善版の30.6に上昇し、高品質アノテーションデータセットでも一貫した向上が確認された。
  • DCT-Maskは、AP(36.5 vs. 36.3)と推論速度(22 FPS vs. 16 FPS)の両面でPointRendを上回り、FLOPsは半分にまで削減された。
  • 本手法はほとんど速度ペナルティを伴わず、V100 GPUでも22 FPSを維持しており、事前学習や事前処理の必要がないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。