[論文レビュー] SparseFormer: Sparse Visual Recognition via Limited Latent Tokens
SparseFormerは、画像を表すために学習可能な潜在トークンを限定的に(最小49個)使用するスパースな視覚認識フレームワークを提案する。すべてのパッチやピクセルを密に処理するのではなく、反復的な領域の重要度(RoI)記述子の最適化とスパースな特徴抽出により、注目すべき領域にのみ注目することで、Swin-Tのような密なモデルと同等の性能を達成しながら、FLOPsを著しく削減し、特に低計算リソース環境において処理速度を向上させる。
Human visual recognition is a sparse process, where only a few salient visual cues are attended to rather than traversing every detail uniformly. However, most current vision networks follow a dense paradigm, processing every single visual unit (e.g,, pixel or patch) in a uniform manner. In this paper, we challenge this dense paradigm and present a new method, coined SparseFormer, to imitate human's sparse visual recognition in an end-to-end manner. SparseFormer learns to represent images using a highly limited number of tokens (down to 49) in the latent space with sparse feature sampling procedure instead of processing dense units in the original pixel space. Therefore, SparseFormer circumvents most of dense operations on the image space and has much lower computational costs. Experiments on the ImageNet classification benchmark dataset show that SparseFormer achieves performance on par with canonical or well-established models while offering better accuracy-throughput tradeoff. Moreover, the design of our network can be easily extended to the video classification with promising performance at lower computational costs. We hope that our work can provide an alternative way for visual modeling and inspire further research on sparse neural architectures. The code will be publicly available at https://github.com/showlab/sparseformer
研究の動機と目的
- 視覚変換器やCNNで一般的な、すべてのピクセルやパッチを均等に処理する支配的で密なパラダイムに挑戦すること。
- 学習可能な潜在トークンを用いて、人間の視覚認識に倣い、わずかな注目すべき領域にのみ集中すること。
- 潜在空間におけるスパースなトークンの集合に制限することで、計算コストとメモリ使用量を削減すること。
- 局所化の教師信号を必要とせず、分類信号のみでエンドツーエンドの学習を可能にすること。
- 視覚タスクに効率的で汎用性の高い新しいスパースなニューラルアーキテクチャのパラダイムを模索すること。
提案手法
- 初期の画像特徴を抽出するための軽量な初期畳み込みエンコーダを導入する。
- 各潜在トークンのための領域の重要度(RoI)記述子を反復的に最適化する潜在的注目変換器を採用し、判別性の高い画像領域に注目する。
- 双線形補間によるスパースな特徴抽出を用い、各トークンのRoIに対応する画像領域からの特徴を抽出することで、密な処理を回避する。
- 得られた潜在トークン埋め込みを、潜在空間における標準的で深く構築された変換器エンコーダで処理し、高精度な認識を実現する。
- 最初にグリッドパターン(例:49トークンの場合に7×7)でトークンのRoIを初期化し、その空間的範囲と位置をエンドツーエンドで学習する。
- Xavier初期化を用いた適応的デコードを採用し、学習の安定性を確保し、初期段階での挙動が無条件畳み込みに類似するようにする。

実験結果
リサーチクエスチョン
- RQ1分類信号のみで制御されるスパースなアテンション機構を用いて、局所化の教師信号なしに、前景オブジェクトに注目する能力を学習できるか?
- RQ2わずかなスパースな潜在トークンのみを処理することで、FLOPsを著しく削減しながらも、競争力のある精度を達成できるか?
- RQ3スパースアーキテクチャの性能は、Swin変換器のような密な対比モデルと比較して、精度とスループットのトレードオフにおいてどうなるか?
- RQ4計算コストが主なボトルネックとなる動画認識タスクへ、スパース設計を効果的に拡張できるか?
- RQ5ランダムな領域の削除やゼロパディングなどの入力摂動に対して、モデルは頑健であるか?
主な発見
- SparseFormer-Tiny(2.0 GFLOPs)はImageNet-1Kで1270画像/秒のスループットを達成し、トップ1精度81.0%を記録。Swin-T(4.5 GFLOPs、81.3%、726画像/秒)に比べてスループットが優れている。
- わずか49個の潜在トークンでのみ処理しても、SparseFormerは81.0%のトップ1精度を達成しており、低計算リソース環境下でも高い効率性と性能を示している。
- Ade20Kのセマンティックセグメンテーションベンチマークでは、SparseFormer-T(400トークン)が43.5%のmIoUと54.7%のmAccを達成し、FLOPsはSwin-Tの1/8(43 GFLOPs)にまで削減されながらも、競争力のある性能を維持している。
- 可視化結果から、局所化の教師信号なしでも、段階を経て徐々に判別性の高い前景領域に注目する能力を学習していることが確認された。
- ランダムな領域の削除やゼロパディングなどの入力摂動に対してもモデルは頑健であり、訓練の過程で情報のない領域を避けるようにスパースなサンプリングを適応的に制御している。
- 動画分類タスクへの一般化性能も高く、Kinetics-400で密なモデルよりも低い計算量で有望な性能を達成している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。