Skip to main content
QUICK REVIEW

[論文レビュー] State-of-the-art in 360° Video/Image Processing: Perception, Assessment and Compression

Chen Li, Mai Xu|arXiv (Cornell University)|May 1, 2019
Visual Attention and Saliency Detection参考文献 149被引用数 6
ひとこと要約

本論文は、認識モデリング、視覚的品質評価(VQA)、および圧縮を焦点として、最新の360°動画/画像処理に関する包括的サーベイを提供している。データセット、注視予測手法、主観的および能動的VQAアプローチ、球面幾何と人間の視覚的注意に着目した圧縮技術をレビューし、分野の前進のためにはより大規模なデータセットとマルチタスク学習フレームワークの必要性を強調している。

ABSTRACT

Nowadays, 360° video/image has been increasingly popular and drawn great attention. The spherical viewing range of 360° video/image accounts for huge data, which pose the challenges to 360° video/image processing in solving the bottleneck of storage, transmission, etc. Accordingly, the recent years have witnessed the explosive emergence of works on 360° video/image processing. In this paper, we review the state-of-the-art works on 360° video/image processing from the aspects of perception, assessment and compression. First, this paper reviews both datasets and visual attention modelling approaches for 360° video/image. Second, we survey the related works on both subjective and objective visual quality assessment (VQA) of 360° video/image. Third, we overview the compression approaches for 360° video/image, which either utilize the spherical characteristics or visual attention models. Finally, we summarize this overview paper and outlook the future research trends on 360° video/image processing.

研究の動機と目的

  • 360°動画/画像処理における最近の進展を、認識、視覚的品質評価(VQA)、圧縮の観点から体系的にレビューすること。
  • 球面幾何とビューポートベースの視聴行動に起因する、従来の2D動画/画像処理技術を360°コンテンツに適応させる際の主な課題を特定すること。
  • 視覚的注意データを含む既存のデータセットを分析し、データ駆動型モデルの学習に用いる際のスケールと代表性の限界を評価すること。
  • 視覚的注意やビューポートに配慮した品質劣化モデリングを組み込んだ、360°コンテンツ向けの能動的VQA手法の進化を分析すること。
  • 球面的特徴と人間の視覚的注意を活用してビットレートを削減しながら品質を維持する圧縮戦略を検討すること。

提案手法

  • HMDや眼動測定システムを用いて収集された視覚的注意データを含む12の公開360°動画/画像データセットを調査し、人間の視聴行動を分析すること。
  • ヒューリスティック(手作業で設計された特徴)とデータ駆動型(深層ニューラルネットワーク)の2つのアプローチに分類して注視予測手法を分類し、2D注視モデルからの適応に重点を置くこと。
  • 制御されたHMD環境下で品質スコアを収集する主観的VQA手法と、非一様な投影密度の補正や視覚的注意の統合を行う能動的VQAモデルをレビューすること。
  • 2D動画コーデック(例:HEVC、VVC)を変更してモーション推定、再投影、またはサンプリング密度を適応させる圧縮技術と、注視に基づくビット割り当てを用いる技術を分析すること。
  • 注視、ビューポート、品質スコアを同時に予測するマルチタスク学習フレームワークを評価し、認識、VQA、圧縮パイプライン全体の効率性と一貫性を向上させること。
  • 2D VQAメトリクス(例:SSIM、PSNR)を360°コンテンツに適応させるために、再投影、重み割り当て、ビューポートに配慮したメトリクスの役割を強調すること。

実験結果

リサーチクエスチョン

  • RQ1360°動画/画像における人間の視聴パターンは2Dコンテンツとどのように異なるか。また、これらの行動を効果的に捉えているデータセットは何か。
  • RQ2既存の2D注視モデルは360°動画/画像にどの程度適応可能か。また、現在の注視モデリングアプローチの限界は何か。
  • RQ3視覚的品質評価(VQA)手法は、非一様な知覚感受性とビューポートベースの視聴を考慮して、どのように360°コンテンツに適応できるか。
  • RQ4球面幾何と人間の視覚的注意を活用して、品質を損なわずビットレートを削減する圧縮戦略は何か。
  • RQ5注視、VQA、圧縮を同時に最適化するマルチタスク学習フレームワークは、360°動画/画像処理におけるパフォーマンスと効率性を向上させられるか。

主な発見

  • 既存の360°動画/画像注視データセットは規模が限定的(例:48~153名の被験者)であり、大規模な2Dデータセットと比較して、データ駆動型の深層学習モデルの性能が制限されている。
  • 360°コンテンツの注視予測は、2Dベースの特徴抽出と新規の球面対応アーキテクチャの両方の利点を活かすが、多くのモデルが360°幾何の特徴を完全に活用していない。
  • 視覚的注意を組み込んだ能動的VQA手法や、歪みバイアスを低減する再投影を適用した手法は、標準的な2Dメトリクスよりも主観的品質スコアと良好に一致する。
  • ビューポートに配慮したビット割り当てや球面対応のモーション推定を用いる圧縮技術は、顕著なビットレート削減(例:一部のケースで最大30%)を達成しながら、知覚的品質を維持している。
  • VQA分野の大多数がフルリファレンス(FR)にとどまっていることから、リアルタイムかつスケーラブルな展開のための強力な低リファレンス(RR)およびノーリファレンス(NR)アプローチの必要性が顕著である。
  • 注視、ビューポート、品質スコアを同時に予測するマルチタスク学習フレームワークは、エンドツーエンド最適化の観点で有望であり、初期の研究が実現可能性とパフォーマンス向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。