[論文レビュー] AdaBrowse: Adaptive Video Browser for Efficient Continuous Sign Language Recognition
AdaBrowseは、計算コストを低減するために、情報量の多い動画部分列と入力解像度を動的に選択する、効率的な継続的サイン言語認識のための適応型ビデオブラウジングフレームワークを提案する。時間的・空間的特徴の冗長性を軽量な方策ネットワークとGumbel-Softmaxサンプリングを活用することで、先行手法と比較して1.44倍の高いスループットと2.12倍少ないFLOPsを達成しながら、最先端の精度を実現した。
Raw videos have been proven to own considerable feature redundancy where in many cases only a portion of frames can already meet the requirements for accurate recognition. In this paper, we are interested in whether such redundancy can be effectively leveraged to facilitate efficient inference in continuous sign language recognition (CSLR). We propose a novel adaptive model (AdaBrowse) to dynamically select a most informative subsequence from input video sequences by modelling this problem as a sequential decision task. In specific, we first utilize a lightweight network to quickly scan input videos to extract coarse features. Then these features are fed into a policy network to intelligently select a subsequence to process. The corresponding subsequence is finally inferred by a normal CSLR model for sentence prediction. As only a portion of frames are processed in this procedure, the total computations can be considerably saved. Besides temporal redundancy, we are also interested in whether the inherent spatial redundancy can be seamlessly integrated together to achieve further efficiency, i.e., dynamically selecting a lowest input resolution for each sample, whose model is referred to as AdaBrowse+. Extensive experimental results on four large-scale CSLR datasets, i.e., PHOENIX14, PHOENIX14-T, CSL-Daily and CSL, demonstrate the effectiveness of AdaBrowse and AdaBrowse+ by achieving comparable accuracy with state-of-the-art methods with 1.44$ imes$ throughput and 2.12$ imes$ fewer FLOPs. Comparisons with other commonly-used 2D CNNs and adaptive efficient methods verify the effectiveness of AdaBrowse. Code is available at \url{https://github.com/hulianyuyy/AdaBrowse}.
研究の動機と目的
- 継続的サイン言語認識(CSLR)モデルのリアルタイム応用における高い計算コストを解消すること。
- 生のサイン言語ビデオに内在する時間的および空間的特徴の冗長性を活用し、不要な計算を削減すること。
- 各動画に対して最も情報量の多いフレームと解像度を知的に選択する動的な推論メカニズムを構築すること。
- CSLRにおける認識精度と計算効率の良好なトレードオフを達成すること。
- ストリーミング動画入力を伴うリアルワールドのオンライン環境において、CSLRシステムの実用的導入を可能にすること。
提案手法
- 入力ビデオから粗い特徴を抽出する軽量なグローバルCNNを用い、その後続の意思決定を支援する。
- Gumbel-Softmaxで訓練された再帰的方策ネットワークが、粗い特徴に基づいて計算量を最小限に抑えつつ認識精度を保持するフレーム部分列を選択する。
- 離散的フレーム選択の微分可能な緩和を用いて、サンプリングプロセスを通じた誤差逆伝播を可能にするエンドツーエンド最適化により、方策ネットワークを最適化する。
- さらなる効率化を図るため、フレーム部分列選択と入力解像度の適応を同時に最適化するAdaBrowse+に拡張する。
- グローバルネットワークとローカルネットワークの特徴を一致させるために、対照的アライメント損失($\mathcal{L}_{\text{Align}}$)を導入し、表現品質を向上させる。
- オンライン設定にデプロイされ、ストリーミング動画フレームを処理し、テスト時における推論を動的に適応させる。
実験結果
リサーチクエスチョン
- RQ1サイン言語ビデオにおける時間的冗長性は、精度を損なわずに推論計算を削減するために効果的に活用可能か?
- RQ2動画の複雑さに基づく適応的入力解像度選択は、CSLRにおける計算効率をさらに向上させられるか?
- RQ3情報量の多い動画部分列を効率的な推論のために選択するための微分可能で逐次的な意思決定メカニズムは、どのように設計できるか?
- RQ4フレーム選択と解像度適応の共同最適化は、CSLRにおける精度-計算トレードオフをどの程度改善できるか?
- RQ5提案された適応的推論フレームワークは、リアルタイムでストリーミングされるオンライン環境で、どの程度の性能を示すか?
主な発見
- AdaBrowseは、PHOENIX14、PHOENIX14-T、CSL-Daily、CSLの4つの大規模CSLRデータセットにおいて、最先端の認識精度を達成した。
- 最先端の手法と比較して、FLOPsを2.12倍削減し、スループットを1.44倍向上させながら、競争力あるWERを維持した。
- CSLデータセットでは、1動画あたり254 GFLOPsの計算量でWER 0.8%を達成し、精度-計算トレードオフの面で先行手法を大きく上回った。
- AdaBrowse+はさらに効率性を向上させ、1動画あたりのFLOPsを171 GFLOPsに削減し、CSLデータセットでWER 0.7%を達成した。
- オンラインストリーミング環境では、完全な畳み込みベースラインと比較して、スループットを1.41倍向上させ、FLOPsを2.06倍削減したが、わずかに高い精度を示した。
- アブレーションスタディの結果、適応的方策はランダムおよびガウス分布サンプリングを上回り、グローバル特徴の再利用により精度が0.4–0.5%向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。