Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Semantic Video Segmentation with Per-frame Inference

Yifan Liu, Chunhua Shen|arXiv (Cornell University)|Feb 26, 2020
Advanced Vision and Imaging参考文献 43被引用数 9
ひとこと要約

本論文は、動きを考慮した時間的損失と、独自の時間的知識蒸留戦略を用いてトレーニング中に時間的整合性を強制することで、リアルタイムのセマンティック動画セグメンテーション手法を提案する。これにより、1フレームずつの推論によって低遅延かつ高精度で滑らかな予測が可能となり、後処理や複数フレーム処理に起因する遅延を排除し、CityscapesおよびCamvidベンチマークでキーフレームベース手法を上回る性能を達成する。

ABSTRACT

For semantic segmentation, most existing real-time deep models trained with each frame independently may produce inconsistent results for a video sequence. Advanced methods take into considerations the correlations in the video sequence, e.g., by propagating the results to the neighboring frames using optical flow, or extracting the frame representations with other frames, which may lead to inaccurate results or unbalanced latency. In this work, we process efficient semantic video segmentation in a per-frame fashion during the inference process. Different from previous per-frame models, we explicitly consider the temporal consistency among frames as extra constraints during the training process and embed the temporal consistency into the segmentation network. Therefore, in the inference process, we can process each frame independently with no latency, and improve the temporal consistency with no extra computational cost and post-processing. We employ compact models for real-time execution. To narrow the performance gap between compact models and large models, new knowledge distillation methods are designed. Our results outperform previous keyframe based methods with a better trade-off between the accuracy and the inference speed on popular benchmarks, including the Cityscapes and Camvid. The temporal consistency is also improved compared with corresponding baselines which are trained with each frame independently. Code is available at: https://tinyurl.com/segment-video

研究の動機と目的

  • 独立したフレーム処理に起因するリアルタイムのセマンティック動画セグメンテーションにおける時間的不整合を解消すること。
  • 後処理や複数フレーム処理に起因する推論遅延を排除すること。
  • 速度を犠牲にせずにコンパクトモデルの動画セグメンテーション性能を向上させること。
  • トレーニング時の制約と知識蒸留を用いて、精度と時間的滑らかさの両方を向上させること。

提案手法

  • 動きを考慮した時間的損失を導入し、予測された光流を用いて1フレームから次のフレームへセグメンテーションラベルを伝搬させ、教師信号とする。
  • ピxls単位の光流を連続フレーム間で予測するための動き推定ネットワークを導入し、ラベル伝搬を支援する。
  • ConvLSTMを用いて2フレーム間の類似性をモデル化することで、複数フレームの依存関係を符号化する新しい時間的知識蒸留手法を提案する。
  • 空間的知識蒸留と時間的蒸留を組み合わせることで、精度と整合性の両方を向上させる。
  • 時間的制約を課してトレーニングするが、推論は各フレームごとに独立して実行するコンパクトモデル(例:MobileNetV2、PSPNet18)を採用する。
  • 推論時に計算負荷を追加せずにトレーニング時に時間的整合性を強制する。

実験結果

リサーチクエスチョン

  • RQ1推論時の遅延を追加せずに、トレーニング時に時間的整合性を効果的に強制できるか?
  • RQ2コンパクトモデルが動画セグメンテーションで高精度かつ滑らかな予測を達成できるか?
  • RQ3時間的知識蒸留は、標準的な蒸留手法を上回り、精度と時間的滑らかさの両方を向上させられるか?
  • RQ4トレーニング時に時間的制約を課した1フレームずつの推論は、キーフレームベース手法よりも速度と整合性の面で優れているか?

主な発見

  • Cityscapesでは、ベースラインのPSPNet18(mIoU 69.8%、TC 68.5%)に対して、提案手法はより高いmIoU(73.1%)と時間的整合性(70.6%)を達成した。
  • Camvidでは、静的領域(例:図8の赤枠)におけるフレッカリングが低減し、フレーム間で安定した予測が得られた。
  • 強化されたMobileNetV2モデルは、1枚のGTX 1080Tiで動作する最先端のキーフレームベース手法(AccelやDVSN)よりも高速な推論速度と高い精度を達成した。
  • Cityscapesにおける動く物体(例:バス:47.2% → 48.5%、列車:55.5% → 76.4%)の時間的整合性(TC)が顕著に向上した。
  • Cityscapesでは「道路」で97.7%、「空」で93.0%の時間的整合性スコアを達成し、ベースラインを上回った。
  • アブレーションスタディの結果、空間的および時間的蒸留を組み合わせた場合が最良の性能を示し、時間的蒸留が整合性向上に不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。