[論文レビュー] Anytime Dense Prediction with Confidence Adaptivity
本稿では、セマンティックセグメンテーションおよび人間のポーズ推定のためのプログレッシブで信頼性適応型推論を可能にする、最初のエンド・ツー・エンドのいつでも推論可能な密度予測フレームワークADP-Cを提案する。エンコーダ・デコーダヘッドを用いたエアリー・エグジットの再設計と、予測の信頼性に基づく空間的適応型計算を適用することで、CityscapesとMPIIにおいてそれぞれ44.4%および59.1%の合計FLOPs削減を達成したが、ベースモデルと同等の最終的な精度を維持した。
Anytime inference requires a model to make a progression of predictions which might be halted at any time. Prior research on anytime visual recognition has mostly focused on image classification. We propose the first unified and end-to-end approach for anytime dense prediction. A cascade of "exits" is attached to the model to make multiple predictions. We redesign the exits to account for the depth and spatial resolution of the features for each exit. To reduce total computation, and make full use of prior predictions, we develop a novel spatially adaptive approach to avoid further computation on regions where early predictions are already sufficiently confident. Our full method, named anytime dense prediction with confidence (ADP-C), achieves the same level of final accuracy as the base model, and meanwhile significantly reduces total computation. We evaluate our method on Cityscapes semantic segmentation and MPII human pose estimation: ADP-C enables anytime inference without sacrificing accuracy while also reducing the total FLOPs of its base models by 44.4% and 59.1%. We compare with anytime inference by deep equilibrium networks and feature-based stochastic sampling, showing that ADP-C dominates both across the accuracy-computation curve. Our code is available at https://github.com/liuzhuang13/anytime .
研究の動機と目的
- 予測を任意の時点で停止できるようにする、進行的かつ品質向上が見込める密度予測タスクのためのいつでも推論を可能にすること。
- 特にリアルタイムまたは低リソース環境でのデプロイに適した、最終的な精度を損なわずに計算コストを削減すること。
- 複数の予測段階と空間的適応型計算をサポートする、統一的でエンド・ツー・エンドで訓練可能なフレームワークの設計。
- 空間的および層間で既に信頼性が高いと判断された予測に対して冗長な計算を回避する、信頼性ベースのマスク機構の開発。
提案手法
- 段階ごとの異なる特徴の深さと空間解像度に対応するため、エンコーダ・デコーダヘッドを備えた一連のエアリー・エグジットを導入する。
- 十分な受容 field と空間的スムージングを確保するようにエグジットヘッドを再設計し、初期段階の予測品質を向上させる。
- 予測の信頼性が高いピクセルをマスクすることで、空間的適応型推論を適用し、その出力を保持して以降の層での畳み込み処理をスキップする。
- 分類予測の最大確率を信頼性指標として用い、どのピクセルをマスクし、計算を省略するかを決定する。
- 畳み込み処理を避けて、マスクされたピクセルの特徴量を補間することで、FLOPsを削減しつつ予測の一貫性を維持する。
- すべてのエグジットと信頼性ベースのマスク機構を含む、モデル全体をエンド・ツー・エンドで訓練し、精度と効率を同時に最適化する。
実験結果
リサーチクエスチョン
- RQ1統一的でエンド・ツー・エンドの深層学習フレームワークは、進行的精度向上を伴ういつでも密度予測をサポートできるか?
- RQ2密度予測における空間的構造を活用することで、精度を損なわずに計算量を削減できるか?
- RQ3密度予測タスクにおける効果的かつ効率的な空間的適応型推論を実現するための信頼性指標として適切なものは何か?
- RQ4信頼性適応型計算は、均一またはランダムなマスキングと比較して、精度とFLOPs削減の両面で優れているか?
- RQ5提案手法は、多様な密度予測ベンチマークにおいて顕著なFLOPs削減を達成しつつ、最終的なモデル精度を維持できるか?
主な発見
- ADP-Cは、ベースのHRNet-W18モデルと比較して、Cityscapesのセマンティックセグメンテーションで44.4%、MPIIのヒューマンポーズ推定で59.1%の合計FLOPs削減を達成した。
- ADP-Cの最終予測は、ベースモデルと同等のmIoUを達成しており、計算量の削減にもかかわらず精度の低下がないことを示した。
- 最大確率を用いた信頼性ベースのマスクは、固定比率およびランダムマスキングを上回り、エントロピーを用いた信頼性指標は同程度の性能を示したが、効率が劣った。
- アブレーションスタディにより、エンコーダ・デコーダ構造を備えた再設計済みエグジットヘッドが、初期段階の予測品質および全体の精度-計算量トレードオフを顕著に向上させることを確認した。
- 可視化結果から、高信頼度領域(例:道路、空)は早期にマスクされ、複雑な領域(例:歩行者、隠れ肢)はより深く処理されるなど、直感的な計算割り当てと整合した。
- 両ベンチマークにおいて、ADP-Cは、深層均衡ネットワークおよび特徴ベースの確率的サンプリングの両方を、精度-計算量曲線全体で上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。