Skip to main content
QUICK REVIEW

[論文レビュー] Real-time Deep Video Deinterlacing

Haichao Zhu, Xueting Liu|arXiv (Cornell University)|Aug 1, 2017
Advanced Image Processing Techniques参考文献 18被引用数 8
ひとこと要約

本論文は、奇数フィールドおよび偶数フィールドからの時間的情報を用い、元のスキャンラインを保持したまま欠落しているスキャンラインのみを再構築する、リアルタイム動画デインターリングに初めて適用された深層畳み込みニューラルネットワーク(DCNN)ベースの手法を提案する。レイヤー共有アーキテクチャを採用することで、単一GPU上でのリアルタイム性能を達成し、複数の解像度において視覚的品質と計算効率の両面で先行手法を上回る。

ABSTRACT

Interlacing is a widely used technique, for television broadcast and video recording, to double the perceived frame rate without increasing the bandwidth. But it presents annoying visual artifacts, such as flickering and silhouette "serration," during the playback. Existing state-of-the-art deinterlacing methods either ignore the temporal information to provide real-time performance but lower visual quality, or estimate the motion for better deinterlacing but with a trade-off of higher computational cost. In this paper, we present the first and novel deep convolutional neural networks (DCNNs) based method to deinterlace with high visual quality and real-time performance. Unlike existing models for super-resolution problems which relies on the translation-invariant assumption, our proposed DCNN model utilizes the temporal information from both the odd and even half frames to reconstruct only the missing scanlines, and retains the given odd and even scanlines for producing the full deinterlaced frames. By further introducing a layer-sharable architecture, our system can achieve real-time performance on a single GPU. Experiments shows that our method outperforms all existing methods, in terms of reconstruction accuracy and computational performance.

研究の動機と目的

  • 時間的情報を無視する(品質を犠牲にする)か、高コストな動き推定に依存する(速度を犠牲にする)既存のデインターリング手法の限界を解消すること。
  • 標準の超解像DCNNが持つ並進不変性の仮定を克服すること。この仮定は、存在するスキャンラインと欠落しているスキャンラインの処理が一様であるため、物体境界でぼやけやアーチファクトを引き起こす。
  • 奇数フィールドと偶数フィールド間の時間的整合性を活用することで、視覚的品質を損なわずリアルタイムのデインターリングを実現すること。
  • 入力スキャンラインを保持しながら、欠落しているスキャンラインのみを再構築する新しいDCNNアーキテクチャを設計することにより、再構築精度を向上させること。

提案手法

  • 本手法は、入力として完全なインターレースフレームを受け取り、奇数スキャンラインと偶数スキャンラインの両方を含む欠落スキャンラインのみを含む2つの半フレームを出力する。元のスキャンラインはそのままで保持される。
  • 2本のブランチを持つDCNNアーキテクチャを採用し、各ブランチが奇数フィールドおよび偶数フィールドの両方の特徴を用いて、1つの欠落スキャンライン半フレームを再構築する。
  • 低レベルの畳み込み層を2つのブランチ間で共有することで、計算コストを削減し、トレーニングおよび推論の高速化を実現する。
  • 欠落スキャンラインの再構築誤差を最小化するために、ピクセル単位の損失(例:L2損失)を用いてエンドツーエンドでネットワークを訓練する。
  • 既存スキャンラインと欠落スキャンラインを異なる方法で処理することで、並進不変性の仮定を回避し、物体境界でのぼやけを防止する。
  • リアルタイム推論を最適化し、単一GPUで1024×768解像度で33 fpsを達成している。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、既存スキャンラインを保持しながら欠落スキャンラインを効果的に再構築し、リアルタイム性能を維持できるか?
  • RQ2奇数フィールドおよび偶数フィールドからの時間的情報を組み込むことで、フィールド内手法と比較してデインターリング品質がどのように向上するか?
  • RQ32本のブランチネットワーク間でのレイヤー共有は、再構築精度を著しく低下させることなく、計算コストをどの程度削減できるか?
  • RQ4DCNNにおける並進不変性の仮定を回避することで、エッジの保持が向上し、アーチファクトが減少するか?
  • RQ5DCNNベースのデインターリング手法は、従来の動きベース手法および超解像スタイル手法の両方を、視覚的品質と速度の両面で上回ることができるか?

主な発見

  • 本手法は、単一GPUを用いて1024×768解像度で33 fpsのリアルタイム性能を達成し、計算効率においてすべての競合手法を上回った。
  • 平均して、本手法はSRCNNをデインターリングに再トレーニングしたバージョンや、ELAやバイキュービックといった従来手法を含むすべてのベースライン手法よりも高いPSNRおよびSSIMスコアを達成した。
  • レイヤー共有戦略により、2つの独立したネットワークをトレーニングする場合と比較して推論時間が約2/3に削減され、再構築品質はほぼ同一であった。
  • 特に動く物体の輪郭周辺において、ぼやけやハローアーチファクトが顕著に減少した。
  • 極端な大規模な動きや非常に細い水平構造では失敗ケースが発生し、ネットワークがインターレースアーチファクトを実際の特徴と誤って分類する場合がある。
  • ELA(CPUベースの手法)よりも速度と品質の両面で優れており、複雑性がより高いSRCNNやその他の超解像モデルをも凌駆する再構築精度を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。