[論文レビュー] PoinTramba: A Hybrid Transformer-Mamba Framework for Point Cloud Analysis
PoinTramba は Transformer ベースのグループ内特徴モデリングと Mamba ベースのグループ間処理を組み合わせ、双方向の重要度認識オーダリング戦略と重要度認識プーリングに導かれ、点群分類とセグメンテーションで線形時間のグループ間計算を実現し、最先端または競争力のある結果を達成します。
Point cloud analysis has seen substantial advancements due to deep learning, although previous Transformer-based methods excel at modeling long-range dependencies on this task, their computational demands are substantial. Conversely, the Mamba offers greater efficiency but shows limited potential compared with Transformer-based methods. In this study, we introduce PoinTramba, a pioneering hybrid framework that synergies the analytical power of Transformer with the remarkable computational efficiency of Mamba for enhanced point cloud analysis. Specifically, our approach first segments point clouds into groups, where the Transformer meticulously captures intricate intra-group dependencies and produces group embeddings, whose inter-group relationships will be simultaneously and adeptly captured by efficient Mamba architecture, ensuring comprehensive analysis. Unlike previous Mamba approaches, we introduce a bi-directional importance-aware ordering (BIO) strategy to tackle the challenges of random ordering effects. This innovative strategy intelligently reorders group embeddings based on their calculated importance scores, significantly enhancing Mamba's performance and optimizing the overall analytical process. Our framework achieves a superior balance between computational efficiency and analytical performance by seamlessly integrating these advanced techniques, marking a substantial leap forward in point cloud analysis. Extensive experiments on datasets such as ScanObjectNN, ModelNet40, and ShapeNetPart demonstrate the effectiveness of our approach, establishing a new state-of-the-art analysis benchmark on point cloud recognition. For the first time, this paradigm leverages the combined strengths of both Transformer and Mamba architectures, facilitating a new standard in the field. The code is available at https://github.com/xiaoyao3302/PoinTramba.
研究の動機と目的
- Transformer の精度と Mamba の効率をバランスさせた点群解析の促進。
- intra-group および inter-group の依存関係を個別に処理するハイブリッドアーキテクチャを提案。
- Mamba におけるランダムオーダリングの影響を軽減する双方向の重要度認識オーダリング(BIO)戦略を導入。
- グローバルな点群特徴を形成するための重要度認識プーリング機構を開発。
- ScanObjectNN、ModelNet40、ShapeNetPart の分類・セグメンテーションベンチマークで効果を示す。
提案手法
- 点群を G グループにセグメント化し、Transformer エンコーダでグループ内埋め込みを抽出。
- グループ埋め込みを inter-group Mamba エンコーダに入力し、線形計算量でグローバルなグループ間依存性を捕捉。
- Mamba 処理前にグループ埋め込みを再配置するための双方向重要度認識オーダリング(BIO)を適用。
- グループ埋め込みの重要度スコアを予測して再配置を誘導し、重要度認識プーリングを実行してグローバル特徴を形成。
- タスク損失、重要度損失、アライメント損失を含む多項損失でエンドツーエンドに学習。
実験結果
リサーチクエスチョン
- RQ1ハイブリッドな Transformer-Mamba アーキテクチャは、効率を維持しつつ分類とセグメンテーションの点群モデルにおいて単一アーキテクチャより性能を上回ることができるか。
- RQ2BIO(双方向の重要度認識オーダリング)は Mamba の unordered な点群処理を改善するか。
- RQ3重要度認識プーリングは、再配置されたグループ埋め込みを効果的に活用してロバストなグローバル特徴を生み出すか。
- RQ4各コンポーネント(Transformer、Mamba、BIO、アライメント、IAP)の寄与は全体性能にどの程度か。
主な発見
- PoinTramba は ScanObjectNN(PB-T50-RS バリアント: 92.3 ± 0.4; 回転なしでの Ours: 92.3 ± 0.2; PB-T50-RS バリアントで 88.9–89.1)で最先端手法と競合または優越の精度を達成。
- ModelNet40 では、ハイブリッドバックボーンで 92.7% (±0.1) を達成し、最近の Transformer/Mamba 手法と競合または上回る。
- ShapeNetPart では、Inst. mIoU が 85.7% (±0.1) で、以前の SOTA 手法と同等。
- アブレーションにより、グループ間 Mamba のみで PointNet++ より精度が 8.2%向上; 局所グループ Transformer の追加で 0.4%; BIO で 2.1%; IAP で 0.5%。
- アライメント損失と BIO は相互作用して性能をさらに向上(アライメント:Mamba に対して +1.4%、PoinTramba に対して +1.7%)。
- BIO オーダリングは単一方向またはランダムオーダリング戦略を上回り、IAP は平均/最大プーリングより優れる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。