[論文レビュー] Images Speak in Images: A Generalist Painter for In-Context Visual Learning
この論文では、入力と出力を両方画像として扱い、入力-出力画像ペアをステッチしてマスク画像モデリングを適用することで、文脈内視覚学習を可能にする汎用的ビジョンモデルPainterを紹介する。モデルは、タスク固有のアーキテクチャや損失関数の変更なしに、深度推定で最先端の性能を達成し、セグメンテーションや画像修復を含む7つの多様なビジョンタスクにおいても競争力ある結果を示す。
In-context learning, as a new paradigm in NLP, allows the model to rapidly adapt to various tasks with only a handful of prompts and examples. But in computer vision, the difficulties for in-context learning lie in that tasks vary significantly in the output representations, thus it is unclear how to define the general-purpose task prompts that the vision model can understand and transfer to out-of-domain tasks. In this work, we present Painter, a generalist model which addresses these obstacles with an "image"-centric solution, that is, to redefine the output of core vision tasks as images, and specify task prompts as also images. With this idea, our training process is extremely simple, which performs standard masked image modeling on the stitch of input and output image pairs. This makes the model capable of performing tasks conditioned on visible image patches. Thus, during inference, we can adopt a pair of input and output images from the same task as the input condition, to indicate which task to perform. Without bells and whistles, our generalist Painter can achieve competitive performance compared to well-established task-specific models, on seven representative vision tasks ranging from high-level visual understanding to low-level image processing. In addition, Painter significantly outperforms recent generalist models on several challenging tasks.
研究の動機と目的
- タスクの出力表現が大きく異なるため、一般化が困難である文脈内学習の課題に対処すること。
- 自然言語処理(NLP)ではテキストトークンが共通インターフェースを提供するのに対し、ビジョンタスクに統一的で汎用的なインターフェースが欠如している問題を克服すること。
- ビジョンタスクの出力を3チャンネル画像として再定義し、画像ペアをタスクプロンプトとして用いるビジョン中心のソリューションを提案すること。
- 言語理解やモデルの微調整を必要とせず、視覚的文脈のみを用いてゼロショットおよびフェイントショットの外部ドメインタスクへの適応を可能にすること。
- 高レベルの理解から低レベルの修復まで多様なビジョンタスクにおいて、単一の統一された学習目的を用いて競争力ある性能を達成すること。
提案手法
- すべてのビジョンタスクを出力として3チャンネルテンソル(すなわち「出力画像」)として表現することで、画像補完問題に再定式化する。
- 同じタスクからの入力画像と出力画像ペアを連結して1つの長めの画像にすることで、学習データを構築する。
- 出力画像部分に対して標準的なマスク画像モデリング(MIM)を適用し、入力画像のパッチに条件づけて予測を行う。
- 推論時においては、タスクの入力-出力画像ペアをプロンプトとして使用し、明示的な言語指示なしにモデルがタスクを推論できるようにする。
- アーキテクチャや損失関数の変更なしに、単一の汎用モデルをエンドツーエンドで学習する。
- 入力-出力例ペアを直接コンテキストとして入力することで、文脈内推論を可能にし、未学習のカテゴリーやタスクへの一般化を実現する。

実験結果
リサーチクエスチョン
- RQ1言語トークンに依存せず、共通インターフェースを用いて文脈内学習を可能にするビジョンタスクの統一は可能か?
- RQ2単一で簡単な目的関数を用いて、多様なタスクを学習しながらも強力な性能を維持できる汎用的ビジョンモデルをどのように訓練できるか?
- RQ3微調整や言語監視を必要とせず、視覚的例のみをプロンプトとして用いて、外部ドメインのタスクに一般化できるか?
- RQ4出力を画像として扱い、画像ペアをプロンプトとして用いることで、従来の汎用アプローチに比べて少データやゼロショット一般化が向上するか?
- RQ5統一された画像中心のフレームワークは、深度推定やパンセグメンテーションのような困難なタスクにおいて、特化型モデルを上回る性能を発揮できるか?
主な発見
- Painterは、複雑なアーキテクチャと損失関数を備えた従来の専用モデルを上回り、NYUv2深度推定で最先端の性能を達成した。
- Semantic Segmentation(ADE-20K)、Instance Segmentation(COCO)およびPanoptic Segmentation、キーポイント検出においても、タスク固有のモデルと同等またはそれを上回る結果を達成した。
- 画像ノイズ除去、雨除去、低照度強化といった困難なタスクにおいて、最近の汎用モデルを顕著に上回った。
- トレーニングデータに含まれないカテゴリ、例えばオープンボリュームキーポイント検出(馬、サル、ほうきなど)やインスタンスセグメンテーション(タブレットなど)に対しても、効果的に一般化した。
- 探索的または学習可能なプロンプトによるプロンプトチューニングは、ランダムプロンプトよりも性能を向上させ、プロンプト最適化が文脈内学習能力を強化することを示した。
- ランダムプロンプトでも強いロバストネスを示し、画像中心の文脈内学習フレームワークに内在する安定性と一般化能力の高さを裏付けた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。