[論文レビュー] AsymFormer: Asymmetrical Cross-Modal Representation Learning for Mobile Platform Real-Time RGB-D Semantic Segmentation
AsymFormerは、モバイルプラットフォームにおけるリアルタイムRGB-Dセマンティックセグメンテーションのための非対称なクロスモーダル表現学習フレームワークを提案する。深度用に軽量なTransformerバックボーンを、RGB用にCNNを用いることで冗長性を低減する。NYUv2で52.0%のmIoUを達成し、65 FPS(混合精度を用いるともに79 FPS)の推論速度を実現し、従来手法に比べて速度-精度のバランスに優れ、局所化されたアテンションとクロスモーダル相関モジュールによってパrameter数を最小限に抑える。
Understanding indoor scenes is crucial for urban studies. Considering the dynamic nature of indoor environments, effective semantic segmentation requires both real-time operation and high accuracy.To address this, we propose AsymFormer, a novel network that improves real-time semantic segmentation accuracy using RGB-D multi-modal information without substantially increasing network complexity. AsymFormer uses an asymmetrical backbone for multimodal feature extraction, reducing redundant parameters by optimizing computational resource distribution. To fuse asymmetric multimodal features, a Local Attention-Guided Feature Selection (LAFS) module is used to selectively fuse features from different modalities by leveraging their dependencies. Subsequently, a Cross-Modal Attention-Guided Feature Correlation Embedding (CMA) module is introduced to further extract cross-modal representations. The AsymFormer demonstrates competitive results with 54.1% mIoU on NYUv2 and 49.1% mIoU on SUNRGBD. Notably, AsymFormer achieves an inference speed of 65 FPS (79 FPS after implementing mixed precision quantization) on RTX3090, demonstrating that AsymFormer can strike a balance between high accuracy and efficiency.
研究の動機と目的
- 対称的な二重ブランチネットワークがRGB-Dセマンティックセグメンテーションにおいて計算コストを倍増させつつも、精度の向上に見合わない非効率性を是正すること。
- 軽量な深度ブランチと強力なRGBブランチを備えた非対称なバックボーンを設計することで、モデルの冗長性を低減すること。
- 空間的・チャネル的アテンションを並列にモデル化することができる局所化アテンション・ガイドド・フィーチャー選択(LAFS)モジュールを導入し、特徴量統合の効率を向上させること。
- 最小限のパラメータ増加でマルチモーダル自己類似性を捉えることのできるクロスモーダルアテンション(CMA)モジュールを用いて、クロスモーダル表現学習を強化すること。
- モバイルロボットプラットフォームへのデプロイを最適化し、精度を損なわずリアルタイム推論を達成する、優れた速度-精度トレードオフを実現すること。
提案手法
- AsymFormerは、RGB特徴量にCNNベースのバックボーンを、深度特徴量に小型でパラメータ効率の良いTransformerを用いることで、計算の冗長性を低減する。
- 局所化アテンション・ガイドド・フィーチャー選択(LAFS)モジュールは、学習可能なチャネル重みと空間アテンションを用いて、並列に空間的・チャネル的アテンション重みを計算し、高速で選択的な統合を実現する。
- LAFSは、学習可能な重みを用いてモダリティ間の差異を推定することで空間アテンションをモデル化し、高精度な特徴量選択を実現するとともに、高い推論速度を維持する。
- クロスモーダルアテンション(CMA)モジュールは、異なるモダリティ間の自己類似性をモデル化することで、最小限のパラメータオーバーヘッドで特徴量相関を向上させ、クロスモーダル表現を強化する。
- 特徴量統合は、空間的およびチャネル的依存関係に基づいて動的にRGBブランチと深度ブランチの寄与度を重みづけるアテンションマップによってガイドされる。
- さらに推論速度を向上させるために混合精度推論を適用し、RTX 3090で精度を落とさずに79 FPSを達成した。

実験結果
リサーチクエスチョン
- RQ1非対称なバックボーン設計により、精度を損なわずマルチモーダルセマンティックセグメンテーションにおけるパラメータの冗長性を低減できるか?
- RQ2リアルタイム性能を確保しつつ、空間的およびチャネルワイドなアテンションの忠実度を維持するための特徴量選択はどのように最適化できるか?
- RQ3マルチモーダル自己類似性特徴量は、パラメータの増加を最小限に抑えながら、どの程度セグメンテーション精度を向上させられるか?
- RQ4軽量なクロスアテンション機構は、リアルタイム環境下で効果的にクロスモーダル表現学習を強化できるか?
- RQ5提案手法は、既存のSOTA手法に比べて、モバイルロボットプラットフォーム上でより優れた速度-精度トレードオフを達成できるか?
主な発見
- AsymFormerはNYUv2データセットで52.0%のmIoUを達成し、精度と速度の両面で大多数の既存手法を上回った。
- RTX 3090では、フル精度推論で65 FPS、混合精度量子化を用いるともに79 FPSの推論速度を達成し、従来手法に比べて顕著に高速であった。
- わずか33Mのパラメータで52.0%のmIoUを維持しており、高い効率性と低いパラメータ数を示した。
- SUNRGBDデータセットでは、49.1%のmIoUを達成し、データセット内の深度画像の品質が低いにもかかわらず、競争力のある性能を示した。
- 可視化結果から、LAFSはCBAMに比べてより一貫性があり、情報量が多く、エッジの保持が優れているアテンションマップを生成することが確認された。
- アブレーションスタディの結果、非対称なバックボーン、LAFS、CMAモジュールの組み合わせが、速度と精度の両面で顕著な向上をもたらした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。