Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Resolution in the Context of Efficient Video Recognition

Chuofan Ma, Qiushan Guo|arXiv (Cornell University)|Sep 26, 2022
Advanced Image Processing Techniques被引用数 10
ひとこと要約

本稿では、高解像度の教師ネットワークから低解像度の学生ネットワークへ知識を転送するCross-Resolution Knowledge Distillation (ResKD) を提案する。この手法により、効率性を損なわず動画認識の精度を向上させることができる。ResKD は低解像度入力において顕著な性能向上を達成し、特に Mini-Kinetics において 4 倍少ない FLOPs で最先端の手法を大きく上回る。

ABSTRACT

In this paper, we empirically study how to make the most of low-resolution frames for efficient video recognition. Existing methods mainly focus on developing compact networks or alleviating temporal redundancy of video inputs to increase efficiency, whereas compressing frame resolution has rarely been considered a promising solution. A major concern is the poor recognition accuracy on low-resolution frames. We thus start by analyzing the underlying causes of performance degradation on low-resolution frames. Our key finding is that the major cause of degradation is not information loss in the down-sampling process, but rather the mismatch between network architecture and input scale. Motivated by the success of knowledge distillation (KD), we propose to bridge the gap between network and input size via cross-resolution KD (ResKD). Our work shows that ResKD is a simple but effective method to boost recognition accuracy on low-resolution frames. Without bells and whistles, ResKD considerably surpasses all competitive methods in terms of efficiency and accuracy on four large-scale benchmark datasets, i.e., ActivityNet, FCVID, Mini-Kinetics, Something-Something V2. In addition, we extensively demonstrate its effectiveness over state-of-the-art architectures, i.e., 3D-CNNs and Video Transformers, and scalability towards super low-resolution frames. The results suggest ResKD can serve as a general inference acceleration method for state-of-the-art video recognition. Our code will be available at https://github.com/CVMI-Lab/ResKD.

研究の動機と目的

  • 低解像度入力において動画認識モデルが性能を発揮できない理由を調査すること。
  • 低解像度動画認識における性能低下の根本的原因を特定し、ダウンサンプリングによる情報損失が主な要因であるという仮定に疑問を呈すること。
  • 一般性がありスケーラブルで効率的な手法を開発し、低解像度フレームの潜在的性能を最大限に引き出すこと。
  • 解像度を跨ぐ知識蒸留が、高解像度と低解像度入力間の性能ギャップを効果的に埋め合わせられることを示すこと。

提案手法

  • ResKD は、224×224 フレームで学習された高解像度の教師ネットワークを用い、112×112 フレームで学習される低解像度の学生ネットワークを蒸留過程で監視する。
  • 複数レベルの監視を採用:KLダイバージェンスと平均二乗誤差損失を用いたクリップレベル、フレームレベル、ピクセルレベルの知識転送。
  • フレームレベルおよびピクセルレベルの監視が特に重要であることが示され、クリップレベルのKDのみに比べて3%以上のmAP向上が達成された。
  • 蒸留プロセスにより、学生モデルの有効受容 field (ERF) が縮小され、低解像度入力におけるオブジェクトスケールとよりよく一致するようになる。
  • ResKD はアーキテクチャに依存せず、3D-CNN や Video Transformer(Swin Transformer を含む)の両方で優れた性能を示している。
  • アブレーションスタディにより、教師が高解像度入力を使用する「解像度蒸留」が、単なるモデル蒸留よりも効果的であることが確認された。

実験結果

リサーチクエスチョン

  • RQ1なぜ動画認識モデルは低解像度入力で著しく性能を発揮できないのか。また、ダウンサンプリングによる情報損失が主な要因であるのか。
  • RQ2ネットワークアーキテクチャと入力スケールの不一致が、低解像度フレームにおける性能低下にどの程度寄与しているのか。
  • RQ3クロス解像度の知識蒸留が、高解像度と低解像度入力間の性能ギャップを効果的に埋め合わせられるか。
  • RQ4監視信号の選択(クリップレベル、フレームレベル、ピクセルレベル)が、クロス解像度設定における知識蒸留の効果にどのように影響するか。
  • RQ5ResKD は異なる動画認識アーキテクチャに一般化可能であり、超低解像度入力に対してもスケーラブルか。

主な発見

  • ダウンサンプリングによる情報損失は認識精度にほとんど影響しないことから、高解像度フレームにはタスクに不要な冗長性が多数存在することが示唆された。
  • 低解像度入力における性能低下の主な原因は情報損失ではなく、アーキテクチャの不一致である。現在のモデルは低解像度入力に適応された場合、最適でないことが判明した。
  • ResNet-50 を学生、ResNet-152 を教師として用いた ActivityNet では、ResKD が 78.5% の mAP を達成し、ベースラインより 6.7 パcentage points 高かった。
  • Mini-Kinetics では、ResKD が AdaFocus V2 より 1.4% 高いトップ-1 正答率を達成したが、FLOPs は 4 倍少ない。
  • Video Swin Transformer に ResKD を適用した場合、1 ビデオあたり 1000 GFLOPs 以上の推論 FLOPs 減少が達成され、精度の低下なしに実現された。
  • ResKD は注視力の局在化を向上させ、関連オブジェクトに注目し、背景の活性化を低減することが、特徴マップの可視化から明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。