[論文レビュー] Prompt-ICM: A Unified Framework towards Image Coding for Machines with Task-driven Prompts
Prompt-ICM は、機械視覚向けにタスク駆動型プロンプトを用いて圧縮と特徴適応を最適化する統合的画像符号化フレームワークを提案する。内容に応じたビット割り当てのための圧縮プロンプトと、下流特徴チューニングのためのタスク適応型プロンプトを導入することで、多様な視覚タスクにおいて最小限の追加パラメータで最先端の性能を達成する。
Image coding for machines (ICM) aims to compress images to support downstream AI analysis instead of human perception. For ICM, developing a unified codec to reduce information redundancy while empowering the compressed features to support various vision tasks is very important, which inevitably faces two core challenges: 1) How should the compression strategy be adjusted based on the downstream tasks? 2) How to well adapt the compressed features to different downstream tasks? Inspired by recent advances in transferring large-scale pre-trained models to downstream tasks via prompting, in this work, we explore a new ICM framework, termed Prompt-ICM. To address both challenges by carefully learning task-driven prompts to coordinate well the compression process and downstream analysis. Specifically, our method is composed of two core designs: a) compression prompts, which are implemented as importance maps predicted by an information selector, and used to achieve different content-weighted bit allocations during compression according to different downstream tasks; b) task-adaptive prompts, which are instantiated as a few learnable parameters specifically for tuning compressed features for the specific intelligent task. Extensive experiments demonstrate that with a single feature codec and a few extra parameters, our proposed framework could efficiently support different kinds of intelligent tasks with much higher coding efficiency.
研究の動機と目的
- 人間の知覚ではなく、多様な下流AIタスク向けに画像圧縮を最適化する課題に取り組む。
- タスク固有のコ덱や汎用的特徴コデッキの限界を克服し、1つのコデッキが複数のタスクをサポート可能にする。
- タスク固有の再トレーニングや別々のコデッキの必要性を最小限に抑えることで、計算コストとストレージコストを削減する。
- パrameter効率の良いチューニング機構を活用して、下流タスクへの効率的な移行を可能にする。
提案手法
- 軽量な情報セレクタによって予測されるタスク条件付きの重要度マップとしての圧縮プロンプトを導入し、圧縮中にコンテンツ重み付きビット割り当てをガイドする。
- 空間的に可変レートの特徴圧縮モデルを実装し、下流タスクに応じて圧縮プロンプトを用いて意味的に重要な領域に多くのビットを割り当てる。
- 特定の下流タスク向けに微調整するための小さな学習可能なパrameterの集合としてのタスク適応型プロンプトを設計する。
- 符号化と下流分析の整合性を保つために、レートとタスク固有の損失を共同で最適化するエンドツーエンドの学習フレームワークを採用する。
- 特徴抽出に事前学習されたバックボーンを活用し、情報セレクタを用いてタスクの意味に応じて動的に圧縮を適応させる。
- 最小限の追加パラメータを有する統一コデッキを採用し、複数の視覚タスクにわたる効率的なデプロイを可能にする。

実験結果
リサーチクエスチョン
- RQ1どのようにして画像圧縮を下流視覚タスクに動的に適応させ、符号化効率を向上させられるか?
- RQ2タスク固有のコデッキを必要とせずに、タスク駆動型プロンプトが符号化と下流分析を効果的に調整できるか?
- RQ3学習可能なパラメータの小さな集合(タスク適応型プロンプト)が、完全微調整と同等の性能を達成できる程度はどの程度か?
- RQ4圧縮プロンプトはどのようにしてタスク固有の重要性を反映しており、それらの意味的整合性を可視化できるか?
主な発見
- Prompt-ICM は、1つの統合コデッキを用いて画像分類、オブジェクト検出、セマンティックセグメンテーションタスクで最先端の性能を達成する。
- Omni-ICM や前処理ベースのベースラインと比較して、レート・ディストーション性能が顕著に優れており、学習可能なパラメータもはるかに少ない。
- タスク適応型プロンプトチューニングは、完全微調整(87.61Mパラメータ)と比較してわずか0.87Mパラメータでより優れた性能を達成する。
- 圧縮プロンプトは視覚的にタスク関連領域と一致しており、タスクの種類に応じて物体の境界や判別性の高い特徴に焦点を当てる。
- アブレーションスタディの結果、複数の意味的レベルからの特徴を用いる場合に、圧縮プロンプトがレート・ディストーション性能の向上に寄与することが確認された。
- 最小限のパラメータオーバーヘッドで多様なタスクに高い性能を維持できることから、優れた汎化性と効率性を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。