Skip to main content
QUICK REVIEW

[論文レビュー] Towards Coding for Human and Machine Vision: A Scalable Image Coding Approach

Yueyu Hu, Shuai Yang|arXiv (Cornell University)|Jan 9, 2020
Advanced Image and Video Retrieval Techniques参考文献 19被引用数 5
ひとこと要約

本論文は、圧縮特徴抽出(エッジマップ)とスパースな参照ピクセルを用いた深層生成モデルによる再構成を組み合わせることで、人間の視覚的品質と機械視覚性能を統合最適化するスケーラブルな画像符号化フレームワークを提案する。本手法は、類似ビットレートにおけるJPEGと比較して、忠実度において90%の人的視認性選好を達成し、顔認識特徴点検出において44.75%の誤差低減を実現した。

ABSTRACT

The past decades have witnessed the rapid development of image and video coding techniques in the era of big data. However, the signal fidelity-driven coding pipeline design limits the capability of the existing image/video coding frameworks to fulfill the needs of both machine and human vision. In this paper, we come up with a novel image coding framework by leveraging both the compressive and the generative models, to support machine vision and human perception tasks jointly. Given an input image, the feature analysis is first applied, and then the generative model is employed to perform image reconstruction with features and additional reference pixels, in which compact edge maps are extracted in this work to connect both kinds of vision in a scalable way. The compact edge map serves as the basic layer for machine vision tasks, and the reference pixels act as a sort of enhanced layer to guarantee signal fidelity for human vision. By introducing advanced generative models, we train a flexible network to reconstruct images from compact feature representations and the reference pixels. Experimental results demonstrate the superiority of our framework in both human visual quality and facial landmark detection, which provide useful evidence on the emerging standardization efforts on MPEG VCM (Video Coding for Machine).

研究の動機と目的

  • ビッグデータ時代における、人間の認知と機械視覚タスクの両方を支援する画像符号化の増大するニーズに対応すること。
  • 信号忠実度指向の圧縮と特徴ベースの圧縮の間のギャップを埋めること。
  • 人間の高品質再構成を維持しながら、機械視覚の堅牢な性能を実現するスケーラブルな符号化フレームワークを開発すること。
  • ハイブリッド構造-色表現を通じて、人間の視覚的品質と機械視覚の正確性を統合最適化すること。

提案手法

  • フレームワークはまず、機械視覚タスクのためのベースレイヤーとして、コンactなエッジマップを抽出するための特徴解析を実行する。
  • エッジ位置に基づいてスパースな参照ピクセルをサンプリングし、人間視覚の再構成忠実度を向上させる。
  • エッジマップと参照ピクセルの組み合わせから高品質な画像を再構成するための深層生成モデルを訓練する。
  • 画像品質を向上させるために、知覚的、敵対的、再構成的損失を含むマルチ損失訓練目的関数を用いる。
  • エッジマップを構造的情報を保持しつつビットレートを最小限に抑えるために、コンパクトなベクトルとしてパラメータ化する。
  • スケーラブルなデコードをサポート:ベースレイヤー(エッジ)は機械タスクを可能にし、強化レイヤー(参照ピクセル)は視覚的品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1単一の画像符号化フレームワークが、同時に人間の視覚的品質と機械視覚性能を最適化できるか?
  • RQ2顔認識特徴点検出などの機械視覚タスクのベースレイヤーとして、コンパクトなエッジマップはどの程度効果的か?
  • RQ3生成的モデルは、最小限の構造的表現から高忠実度の画像をどの程度再構成できるか?
  • RQ4ビットレート効率と、人間および機械視覚分野における性能の間には、どのようなトレードオフが生じるか?

主な発見

  • 提案手法は、類似ビットレートにおけるJPEGと比較して、人間の視覚的忠実度で90%の選好率、アートの美しさで73%の選好率を達成し、顕著に優れた性能を示した。
  • qp=4の条件下で、顔認識特徴点検出の正規化平均誤差(NME)をJPEGと比較して44.75%低減した。
  • 色と構造の手がかりを組み合わせた場合、NMEはわずか3.33%にまで低下し、qp=8のJPEG(4.48% NME)を上回った。
  • 提案手法で再構成された画像の90%以上が、顔認識特徴点検出で5%未満の誤差を示しており、高い耐障害性を示した。
  • ユーザースタディーの結果、提案手法は忠実度および美しさの両面で好まれており、それぞれ90%および73%の選好率を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。