[論文レビュー] A New Image Codec Paradigm for Human and Machine Uses
本稿では、人間の視覚と機械視覚の両方を最適化する新しい画像コーデックパラダイムを提案する。16ビットグレースケールのインスタンスセグメンテーションマップと低レベルの信号特徴量を、損失なし圧縮により統合的に符号化し、一般品質の画像再構成を学習された画像予測子で行い、残差を損失ありコーデックで圧縮する。この手法は、従来のコーデックおよび学習ベースのコーデックと比較して、画像再構成(PSNRおよびMS-SSIM)および機械視覚タスク(mAP)の両面で優れた性能を達成する。
With the AI of Things (AIoT) development, a huge amount of visual data, e.g., images and videos, are produced in our daily work and life. These visual data are not only used for human viewing or understanding but also for machine analysis or decision-making, e.g., intelligent surveillance, automated vehicles, and many other smart city applications. To this end, a new image codec paradigm for both human and machine uses is proposed in this work. Firstly, the high-level instance segmentation map and the low-level signal features are extracted with neural networks. Then, the instance segmentation map is further represented as a profile with the proposed 16-bit gray-scale representation. After that, both 16-bit gray-scale profile and signal features are encoded with a lossless codec. Meanwhile, an image predictor is designed and trained to achieve the general-quality image reconstruction with the 16-bit gray-scale profile and signal features. Finally, the residual map between the original image and the predicted one is compressed with a lossy codec, used for high-quality image reconstruction. With such designs, on the one hand, we can achieve scalable image compression to meet the requirements of different human consumption; on the other hand, we can directly achieve several machine vision tasks at the decoder side with the decoded 16-bit gray-scale profile, e.g., object classification, detection, and segmentation. Experimental results show that the proposed codec achieves comparable results as most learning-based codecs and outperforms the traditional codecs (e.g., BPG and JPEG2000) in terms of PSNR and MS-SSIM for image reconstruction. At the same time, it outperforms the existing codecs in terms of the mAP for object detection and segmentation.
研究の動機と目的
- AIoTおよびスマートシティ環境における、人間の視覚的認識と機械視覚タスクの両方を満たす画像コーデックの増大するニーズに対応する。
- 人間の視認に最適化された従来のコーデックや、人間には読めない記述ベースのコーデックの限界を克服する。
- 部分的ビットストリームが機械視覚タスクをサポートするスケーラブルな画像圧縮を実現する。一方、完全な復号が高品質な人間視認を可能にする。
- 画像再構成およびオブジェクト検出やセグメンテーションなどの下流の機械視覚タスクの両方における圧縮効率を向上させる。
- 高レベルの意味的情報を(インスタンスセグメンテーションにより)統合的に活用する統一フレームワークを設計し、感覚的品質やタスクの正確性を損なわず、二重目的に利用可能にする。
提案手法
- 深層ニューラルネットワークを用いて高レベルのインスタンスセグメンテーションマップと低レベルの信号特徴量を抽出する。
- 意味的コンテンツを保持しつつ冗長性を低減するため、インスタンスセグメンテーションマップをコンactな16ビットグレースケールプロファイルとして表現する。
- 16ビットプロファイルと信号特徴量を損失なしコーデック(FLIF)で圧縮し、堅牢な送信および復号を実現する。
- 16ビットプロファイルと信号特徴量を用いて、一般品質の画像再構成を生成するための深層画像予測子を学習する。
- 元の画像と予測画像との残差を損失ありコーデック(VVC)で符号化し、高精細な再構成を実現する。
- スケーラブルな復号を可能にする:部分的ビットストリーム(ストリーム1およびストリーム2)は機械視覚タスクをサポートし、完全なビットストリーム(ストリーム3)は高品質な人間視認を可能にする。
実験結果
リサーチクエスチョン
- RQ1統一された画像コーデックフレームワークは、高品質な人間向け画像再構成と高精度な機械視覚タスクの両方を同時に満たすことができるか?
- RQ2インスタンスセグメンテーションを16ビットグレースケールプロファイルとして表現することで、生の特徴量や圧縮された特徴量表現と比較して、圧縮効率とタスクパフォーマンスにどのような影響を与えるか?
- RQ316ビットプロファイルによる高レベルの意味的情報の統合が、画像再構成と下流の機械視覚タスクの正確性の両方をどの程度向上させるか?
- RQ4提案された予測符号化フレームワークは、従来のコーデック(例:BPG、JPEG2000)および学習ベースのコーデックと比較して、PSNR、MS-SSIM、およびmAPの観点でどのように差をつけるか?
- RQ5どの正規化手法(チャネル、バッチ、インスタンス)が、提案された画像予測子および再構成パイプラインの圧縮効率を最も向上させるか?
主な発見
- 提案されたコーデックは、最先端の学習ベースのコーデックと同等のPSNRおよびMS-SSIM性能を達成し、BPG や JPEG2000 といった従来のコーデックよりも画像再構成品質で優れている。
- 従来のコーデックと比較して、オブジェクト検出およびインスタンスセグメンテーションのmAPが顕著に向上し、機械視覚タスクにおける優れたパフォーマンスを示している。
- 学習されたエンコーダーおよび画像予測子モジュールにおけるチャネル正規化が、PSNRおよびMS-SSIMの観点でバッチ正規化およびインスタンス正規化を上回る最良の圧縮効率を達成した。
- アブレーションスタディにより、16ビットインスタンスセグメンテーションプロファイルが、PSNRおよびMS-SSIMの観点での画像再構成品質、およびmAPの観点での機械視覚タスクの正確性の両方を向上させることを確認した。
- ビットストリーム構造により、スケーラブルな復号が可能である:部分的ビットストリーム(ストリーム1およびストリーム2)は機械視覚タスクをサポートし、完全ビットストリーム(ストリーム3)は高精細な人間視認を可能にする。
- さまざまなQ値(QP)でのVVCによる残差圧縮の結果、低いQP値でより高い品質の再構成が達成されることを確認し、残差ベースの最適化の有効性を裏付けた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。