[論文レビュー] Deep Perceptual Compression
この論文では、視覚的品質を向上させるために、深層的知覚メトリック(LPIPS)とMS-SSIMを共同で最適化する学習済み画像圧縮手法であるDeep Perceptual Compression(DPC)を提案する。DPCは人間評価において深層学習ベースの手法やJPEG-2000を上回り、特に低ビットレートでのオブジェクト検出精度の低下が他の手法よりも小さい。
Several deep learned lossy compression techniques have been proposed in the recent literature. Most of these are optimized by using either MS-SSIM (multi-scale structural similarity) or MSE (mean squared error) as a loss function. Unfortunately, neither of these correlate well with human perception and this is clearly visible from the resulting compressed images. In several cases, the MS-SSIM for deep learned techniques is higher than say a conventional, non-deep learned codec such as JPEG-2000 or BPG. However, the images produced by these deep learned techniques are in many cases clearly worse to human eyes than those produced by JPEG-2000 or BPG. We propose the use of an alternative, deep perceptual metric, which has been shown to align better with human perceptual similarity. We then propose Deep Perceptual Compression (DPC) which makes use of an encoder-decoder based image compression model to jointly optimize on the deep perceptual metric and MS-SSIM. Via extensive human evaluations, we show that the proposed method generates visually better results than previous learning based compression methods and JPEG-2000, and is comparable to BPG. Furthermore, we demonstrate that for tasks like object-detection, images compressed with DPC give better accuracy.
研究の動機と目的
- 従来の指標(PSNR や MS-SSIM)と人間の知覚の間の相関が弱いことに対処すること。
- MS-SSIM を置き換えたり補完したりすることで、深層学習ベースの圧縮における知覚的品質を向上させること。
- 人間による評価で知覚的品質がよりよく捉えられることを示すこと。
- 圧縮画像が下流のコンピュータビジョンタスク(特にオブジェクト検出)に与える有用性を評価すること。
- SOTAの学習済みおよび従来のコーデックと比較して、DPCがより優れた視覚的品質と低いタスク劣化を達成できることを示すこと。
提案手法
- エンド・ツー・エンドのトレーニングを可能にするエンコーダ・デコーダ型ニューラルネットワークアーキテクチャを用いる。
- 知覚的品質と構造的忠実度の両立を図るために、学習済み知覚画像パッチ類似度(LPIPS)とMS-SSIMの2つの損失成分を共同で最適化する。
- LPIPSメトリックは、画像歪みの知覚に関する人間の判断データで事前学習されたCNNを用いて計算される。
- チェッカーボードアーティファクトを軽減するために、畳み込み層のカーネルサイズをストライドで割り切れるように設計されたデコンボリューションアップサンプリング層を採用する。
- 最適化の正則化のために、LPIPS(低いほど良い)とMS-SSIM(高いほど良い)を組み合わせたマルチタスク損失関数を用いてモデルを訓練する。
- 評価には人間の知覚研究、PSNR/MS-SSIMの比較、およびResNet-101を用いた事前学習済みFaster R-CNNを用いたMS-COCOデータセット上のオブジェクト検出性能評価を含む。
実験結果
リサーチクエスチョン
- RQ1学習済み知覚メトリック(LPIPS)を最適化することで、MS-SSIM や PSNR を最適化するのと比較して、より優れた視覚的品質が得られるか?
- RQ2人間評価において、DPCの知覚的品質は他の学習済みおよび従来のコーデック(例:JPEG-2000、BPG)と比較してどうか?
- RQ3DPCは、他の圧縮手法と比較して、オブジェクト検出のような下流のコンピュータビジョンタスクにおいて、どれほど高い有用性を維持できるか?
- RQ4LPIPS と MS-SSIM をマルチタスク損失として組み合わせることで、学習済み圧縮における知覚的品質と構造的類似度の両方が向上するか?
- RQ5既存の学習済み圧縮モデルでは、MS-SSIM スコアが高くても人間の知覚が悪いという乖離が生じるが、DPCはこれを是正できるか?
主な発見
- Kodak、Urban100、Set14、Set5 データセットにおいて、DPCは全ビットレートで最も高い人間評価の知覚的品質を達成し、深層学習ベースの手法およびJPEG-2000を上回った。
- 一部の手法(例:Mentzer et al. や Ballé et al.)よりもMS-SSIMスコアが低くても、DPCは一貫して人間評価で高い順位を獲得した。これは、MS-SSIMが知覚的品質の良い代理指標ではないことを示している。
- 0.37 bpp ではBPGと同等またはそれを上回る人間評価を得ており、0.23 bpp では他のすべての手法を顕著に上回った。
- MS-COCO データセットでは、DPCは全手法の中でオブジェクト検出性能(AP@[.5:.95])の劣化が最小であり、特に低ビットレート(例:0.23 bpp)で顕著だった。一部の状況ではBPGでさえもDPCに劣った。
- PSNR や MS-SSIM と比較して、LPIPS は人間の知覚とより良い相関を示しており、MS-SSIM スコアが高いにもかかわらず人間評価が低い手法が存在するという事実からも裏付けられた。
- LPIPS と MS-SSIM をマルチタスク損失として組み合わせることで、視覚的に優れた再構成と、単体で使用する場合よりも優れた下流タスク性能が得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。