[論文レビュー] RingMo-lite: A Remote Sensing Multi-task Lightweight Network with CNN-Transformer Hybrid Framework
RingMo-lite は、周波数ドメインモデリングを活用してグローバルおよびローカル特徴抽出のバランスをとる、軽量な CNN-Transformerハイブリッド基盤モデルである。二重ブランチアーキテクチャと周波数に敏感なマスキング画像モデリング(FD-MIM)の事前学習戦略を採用することで、RingMo よりも 60% 以上のパラメータ削減を達成しながら、複数のタスクで SOTA に近い性能を維持し、平均精度低下が 2% 未満に抑えられている。
In recent years, remote sensing (RS) vision foundation models such as RingMo have emerged and achieved excellent performance in various downstream tasks. However, the high demand for computing resources limits the application of these models on edge devices. It is necessary to design a more lightweight foundation model to support on-orbit RS image interpretation. Existing methods face challenges in achieving lightweight solutions while retaining generalization in RS image interpretation. This is due to the complex high and low-frequency spectral components in RS images, which make traditional single CNN or Vision Transformer methods unsuitable for the task. Therefore, this paper proposes RingMo-lite, an RS multi-task lightweight network with a CNN-Transformer hybrid framework, which effectively exploits the frequency-domain properties of RS to optimize the interpretation process. It is combined by the Transformer module as a low-pass filter to extract global features of RS images through a dual-branch structure, and the CNN module as a stacked high-pass filter to extract fine-grained details effectively. Furthermore, in the pretraining stage, the designed frequency-domain masked image modeling (FD-MIM) combines each image patch's high-frequency and low-frequency characteristics, effectively capturing the latent feature representation in RS data. As shown in Fig. 1, compared with RingMo, the proposed RingMo-lite reduces the parameters over 60% in various RS image interpretation tasks, the average accuracy drops by less than 2% in most of the scenes and achieves SOTA performance compared to models of the similar size. In addition, our work will be integrated into the MindSpore computing platform in the near future.
研究の動機と目的
- エッジデバイスや軌道上プラットフォームへの高リソースを要するリモートセンシング基盤モデルの導入課題に対処すること。
- マルチタスクのリモートセンシングビジョンタスクにおいて高い精度を維持する、軽量で汎用性の高い基盤モデルを設計すること。
- リモートセンシング画像の複雑なスペクトル的および空間的特性を扱う際に、単一アーキテクチャ(CNN やビジョン Transformer)の限界を克服すること。
- 低リソース環境での表現学習を向上させるために、周波数ドメイン特徴を効果的に活用した効率的で自己教師付き事前学習を可能にすること。
- 分類、検出、セマンティックセグメンテーション、変化検出を含む、多様なリモートセンシング応用に適した統合的で軽量なフレームワークを開発すること。
提案手法
- モデルは二重ブランチアーキテクチャを採用している:Transformerベースのブランチがグローバルで低周波数の特徴を抽出する低域フィルタとして機能し、CNNベースのブランチが細粒度の高周波数の詳細を捉えるスタックドハイパスフィルタとして機能する。
- 画像パッチの高周波数および低周波数成分を同時にマスクして再構築することで、特徴表現学習を強化する、新しい周波数ドメインマスキング画像モデリング(FD-MIM)の事前学習手法を導入した。
- 周波数にインフォームドな特徴ブロック(FIFB)モジュールは、周波数ドメインで低周波数および高周波数コンテンツを分離して処理することで、スペクトル成分を明示的にモデリングする。
- 大規模なリモートセンシングデータセット上で自己教師付き事前学習を実施し、その後、下流タスクでの微調整をエンドツーエンドで実行する。
- 知識蒸留やニューラルアーキテクチャ探索を用いないで、アーキテクチャ設計によるモデル圧縮を実現し、追加のトレーニング段階なしにパラメータを削減した。
- 将来的な展開を想定し、MindSpore コンピューティングプラットフォームとの互換性をフレームワークに組み込んだ。

実験結果
リサーチクエスチョン
- RQ1軽量なリモートセンシング基盤モデルは、顕著に少ないパラメータで近似SOTAの性能を達成できるか?
- RQ2リモートセンシング画像の周波数ドメイン特性は、ハイブリッド CNN-Transformerアーキテクチャで効果的に活用できるか?
- RQ3周波数に敏感な事前学習手法(FD-MIM)は、低リソースおよびマルチタスクのリモートセンシング環境で特徴表現を改善できるか?
- RQ4二重ブランチアーキテクチャは、多様なリモートセンシングタスクにおいてグローバルおよびローカル特徴抽出のバランスをどの程度効果的に実現できるか?
- RQ5RingMo や他の軽量モデルと比較して、提案モデルは効率性および精度の点でどの程度優れているか?
主な発見
- RingMo-lite は、元の RingMo 基盤モデルと比較して、60% 以上のパラメータ削減を達成しながら、複数のリモートセンシングタスクで平均精度低下が 2% 未満に抑えられている。
- LEVIR-CD データセットでは、RingMo の FLOPs の 17% のみで 99.15% の F1 スコアを達成し、高い効率性を示している。
- 同サイズのモデルの中で SOTA の性能を達成しており、Swin Tiny や DiFormerベースのモデルよりも精度およびパラメータ効率の点で優れている。
- FD-MIM 事前学習手法は一般化性能を向上させ、LEVIR-CD データセットではベースライン手法と比較して全体精度(OA)が 0.06% 向上した。
- FIFB モジュールは特徴学習を強化し、Swin Tiny をバックボーンとして使用した場合、ベースラインと比較して OA が 0.03% 向上した。
- 極めてコンactなサイズであるにもかかわらず、RingMo-lite は、分類、オブジェクト検出、セマンティックセグメンテーション、変化検出タスクにおいて強力な一般化性能を維持しており、表 XIV に示されている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。