Skip to main content
QUICK REVIEW

[論文レビュー] DSSLIC: Deep Semantic Segmentation-based Layered Image Compression

Mohammad Akbari, Jie Liang|arXiv (Cornell University)|Jun 8, 2018
Advanced Data Compression Techniques参考文献 22被引用数 7
ひとこと要約

本稿では、セマンティックセグメンテーションマップをベースレイヤーとして用い、コンパクトな画像表現と残差を拡張レイヤーとして符号化する深層学習ベースの画像符号化フレームワーク、DSSLICを提案する。セマンティックに注意を払った再構築と生成的フィンガーリングを活用することで、さまざまなビットレートにおいてBPG、JPEG2000、WebP、JPEGを上回るPSNRおよびMS-SSIM性能を達成するとともに、オブジェクトベースの圧縮や画像検索といったセマンティックに注意を払った応用を可能にする。

ABSTRACT

Deep learning has revolutionized many computer vision fields in the last few years, including learning-based image compression. In this paper, we propose a deep semantic segmentation-based layered image compression (DSSLIC) framework in which the semantic segmentation map of the input image is obtained and encoded as the base layer of the bit-stream. A compact representation of the input image is also generated and encoded as the first enhancement layer. The segmentation map and the compact version of the image are then employed to obtain a coarse reconstruction of the image. The residual between the input and the coarse reconstruction is additionally encoded as another enhancement layer. Experimental results show that the proposed framework outperforms the H.265/HEVC-based BPG and other codecs in both PSNR and MS-SSIM metrics across a wide range of bit rates in RGB domain. Besides, since semantic segmentation map is included in the bit-stream, the proposed scheme can facilitate many other tasks such as image search and object-based adaptive image compression.

研究の動機と目的

  • 圧縮効率とセマンティック的有用性の両方を向上させるために、セマンティックセグメンテーションを統合した学習ベースの画像符号化フレームワークを開発すること。
  • JPEG、JPEG2000、WebPといった従来のコーデックの限界を克服し、深層学習を活用してより優れたレート・リダンドランス性能を達成すること。
  • セマンティックセグメンテーションマップを圧縮ビットストリームに直接埋め込むことで、オブジェクト単位の画像操作および検索を可能にすること。
  • セマンティックマップと残差学習を用いた高精度な再構築が、低ビットレートでも実現可能かどうかを検討すること。
  • マルチレイヤードでセマンティックに注意を払った符号化により、圧縮画像の知覚的品質と構造的忠実度を向上させること。

提案手法

  • 入力画像はまず深層ニューラルネットワークを通過し、セマンティックセグメンテーションマップが生成され、それがビットストリームのベースレイヤーとして無損失符号化される。
  • 専用ネットワーク(CompNet)を用いて入力画像のコンパクトな表現が抽出され、最初の拡張レイヤーとして符号化される。
  • セグメンテーションマップとコンパクトな画像表現を用いて、リファインメントネットワーク(FineNet)が粗い再構築を生成し、欠落した高周波数ディテールを予測する。
  • 元の画像と粗い再構築との間の残差が計算され、忠実度を向上させるために2番目の拡張レイヤーとして符号化される。
  • 知覚的品質を向上させるために生成的対抗ネットワーク(GAN)が採用され、トレーニング中に知覚的損失(VGGおよびDIS)が使用され、視覚的な自然さが向上する。
  • フレームワークは3つの構成要素を持つ階層的ビットストリームアーキテクチャを採用している:ベースレイヤー(セグメンテーションマップ)、最初の拡張レイヤー(コンパクトな画像)、2番目の拡張レイヤー(残差)。

実験結果

リサーチクエスチョン

  • RQ1セマンティックに注意を払った再構築と生成的フィンガーリングを活用することで、BPG、JPEG2000、WebP、JPEGを上回るPSNRおよびMS-SSIM性能を達成する。
  • RQ2セマンティックセグメンテーションマップが画像符号化におけるベースレイヤーとして効果的に機能するか。
  • RQ3コンパクトな画像表現と残差符号化を組み合わせることで、標準コーデックと比較して再構築品質がどのように向上するか。
  • RQ4ビットストリームにセマンティック情報を組み込むことで、画像検索やオブジェクトベースの圧縮といった下流タスクがどの程度向上するか。
  • RQ5知覚的損失(VGGおよびDIS)が、提案フレームワークにおける視覚的品質とPSNRに与える影響は何か。
  • RQ6さまざまなビットレートにおいて、DSSLICフレームワークがBPG、JPEG2000、WebP、JPEGといった最先端のコーデックと比較してPSNRおよびMS-SSIMの観点でどのように性能を発揮するか。

主な発見

  • DSSLICは、RGB(4:4:4)ドメインにおいて、広い範囲のビットレートでH.265/HEVCベースのBPGコーデックをPSNRおよびMS-SSIMの両面で上回る。
  • 特定のKodakテスト画像では、同等のビットレートにおいてDSSLICがBPGに対して4.7 dBのPSNR向上を達成する。
  • ADE20Kデータセットでは、DSSLICは0.18 bppで30.87 dB、0.12 bppで34.72 dBのPSNRを達成し、BPGおよびWebPを著しく上回る。
  • 視覚的比較において、DSSLICは複雑なシーンにおいてもBPG、WebP、JPEG2000、JPEGよりもシャープでより自然な視覚的品質の画像を生成する。
  • アブレーションスタディの結果、セグメンテーションマップの使用(withSeg)は、特にテクスチャおよびエッジ領域でnoSeg設定よりもPSNRと視覚的品質が向上することが示された。
  • 知覚的損失の導入(synth設定)により視覚的品質が向上するが、PSNRは低下するため、知覚的指標と客観的指標の間にはトレードオフがあることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。