Skip to main content
QUICK REVIEW

[論文レビュー] End-to-end optimized image compression for multiple machine tasks

Lahiru D. Chamain, Fabien Racapé|arXiv (Cornell University)|Mar 6, 2021
Algorithms and Data Compression参考文献 1被引用数 9
ひとこと要約

本稿では、レート最適化された画像デコーダーと下流の機械視覚モデルの間に挿入される軽量でタスクに依存しないニューラルモジュール「Connectors」を提案する。これにより、1つのエンドツーエンド最適化されたコ덱(物体検出用)が、再トレーニングなしに画像分類やセマンティックセグメンテーションなどの複数の二次的タスクで優れた性能を発揮できる。検出に最適化されたコデッカーからの特徴を変換することで、ImageNet-1Kではトップ5精度が最大8.75%向上し、COCOではmAPが4.6%向上する。コデッカーの再トレーニングや二次的モデルの再学習は、ファインチューニングを除いて不要である。

ABSTRACT

An increasing share of captured images and videos are transmitted for storage and remote analysis by computer vision algorithms, rather than to be viewed by humans. Contrary to traditional standard codecs with engineered tools, neural network based codecs can be trained end-to-end to optimally compress images with respect to a target rate and any given differentiable performance metric. Although it is possible to train such compression tools to achieve better rate-accuracy performance for a particular computer vision task, it could be practical and relevant to re-use the compressed bit-stream for multiple machine tasks. For this purpose, we introduce 'Connectors' that are inserted between the decoder and the task algorithms to enable a direct transformation of the compressed content, which was previously optimized for a specific task, to multiple other machine tasks. We demonstrate the effectiveness of the proposed method by achieving significant rate-accuracy performance improvement for both image classification and object segmentation, using the same bit-stream, originally optimized for object detection.

研究の動機と目的

  • 複数の機械視覚タスクに向けたレート-歪み最適化コデッカーの非効率性を是正すること。
  • 1つのエンドツーエンド最適化コデッカー(例:物体検出を主なタスクとして訓練)を、複数の下流タスク(例:分類、セグメンテーション)で再利用可能にすること。
  • コデッカーの再トレーニングなしに、主タスクに最適化されたデコーダーからの特徴を二次的タスクに適した表現に変換する軽量でタスクに依存しない適応機構を開発すること。
  • 複雑なデータセット(例:COCO)でエンドツーエンド最適化された特徴が、多様なビジョンタスクに効果的に一般化されることを実証すること。

提案手法

  • PSNRではなく、レートと検出精度(mAP)のバランスを取る損失関数を用いて、物体検出のためのニューラル画像コデッカーをエンドツーエンドで訓練する。
  • スケールハイパーピリオドに基づく事前に訓練済みの、レート-検出精度最適化コデッカーを用い、画像を圧縮する。これにより、検出に最適化されたが視覚的に歪んだ特徴が得られる。
  • 「Connectors」—検出に最適化されたデコーダーと二次的タスクモデルの間に挿入される、小さな学習可能なニューラルモジュール(例:1x1畳み込み、深度可逆畳み込み、平均プーリング)—を導入し、特徴表現を変換する。
  • 1回限りのタスクに依存しない方法でConnectorsを訓練し、検出に最適化されたコデッカーからの特徴を、分類やセグメンテーションなどの二次的タスクに適した表現にマッピングする。
  • オフザシェルの分類およびセグメンテーションモデルを、検出に最適化されたコデッカーからの特徴でファインチューニングし、Connectorsを介して特徴の整合性を向上させる。
  • ImageNet-1K(分類)、COCO-2017(物体検出)、Cityscapes(セマンティックセグメンテーション)の評価を行い、レート歪み最適化およびレート-精度-歪み最適化コデッカーとのベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1物体検出に最適化された1つの画像コデッカーを、再エンコードやコデッカーの再トレーニングなしに、複数の他の下流タスク(例:分類、セグメンテーション)に効果的に再利用できるか?
  • RQ2軽量でタスクに依存しないConnectorsが、検出に最適化されたコデッカーからの特徴を変換することで、関連のないビジョンタスクの性能をどれほど向上できるか?
  • RQ3検出に向けたエンドツーエンド最適化により、視覚的再現性を犠牲にしても、他のビジョンタスクに有用な特徴が保持または強化されるか?
  • RQ4検出に最適化された特徴に対するファインチューニング戦略が、標準のレート歪み最適化コデッカーと比較して、二次的タスクの精度をどの程度向上させるか?
  • RQ5複数のデータセットおよびタスクにおいて、Connectorsの性能は、直接検出に最適化された特徴に対する推論と比較してどの程度優れているか?

主な発見

  • 検出に最適化されたコデッカーを用いた場合、ConnectorsによりCOCO-2017物体検出でmAPが4.6%相対的に向上した。
  • ImageNet-1Kでは、0.2203 BPPのビットレートでトップ5分類精度が8.75%向上(66.43%から75.18%に)し、優れた一般化性能を示した。
  • ファインチューニングなしでも、検出に最適化されたコデッカーにConnectorsを適用した場合、レート歪み最適化コデッカーを上回る二次的タスクの精度を達成しており、特徴の有用性が保持されていることが示された。
  • 平均プーリングおよび2次元深度可逆畳み込みConnectorsは、特徴の整合性を顕著に向上させ、後者が単純な平均プーリングよりも高い精度向上を達成した。
  • 低ビットレート(例:0.1119 BPP)では、ConnectorsによりPSNRが17.36 dB(J-FT)から21.14 dB(J-FT + Conv)に向上し、特徴変換が二次的タスクの再構成品質を向上させることを示した。
  • 検出に最適化された特徴にConnectorsを介してファインチューニングしたResNet-50分類器は、標準のレート歪み最適化画像でファインチューニングした場合よりも高いトップ1およびトップ5精度を達成しており、特徴空間の価値が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。