[論文レビュー] Reduce Information Loss in Transformers for Pluralistic Image Inpainting
本稿では、入力のダウンサンプリングおよび量子化を回避することで情報損失を最小限に抑える、トランスフォーマーに基づく新しいフレームワークPUTを提案する。非重複的な特徴符号化にパッチベースのVQ-VAE(P-VQVAE)を用い、量子化されていない特徴を処理するが、量子化済みトークンからの予測を行う非量子化トランスフォーマー(UQ-Transformer)を採用することで、特に大きな複雑なマスク領域において最先端の忠実度を達成する。
Transformers have achieved great success in pluralistic image inpainting recently. However, we find existing transformer based solutions regard each pixel as a token, thus suffer from information loss issue from two aspects: 1) They downsample the input image into much lower resolutions for efficiency consideration, incurring information loss and extra misalignment for the boundaries of masked regions. 2) They quantize $256^3$ RGB pixels to a small number (such as 512) of quantized pixels. The indices of quantized pixels are used as tokens for the inputs and prediction targets of transformer. Although an extra CNN network is used to upsample and refine the low-resolution results, it is difficult to retrieve the lost information back.To keep input information as much as possible, we propose a new transformer based framework "PUT". Specifically, to avoid input downsampling while maintaining the computation efficiency, we design a patch-based auto-encoder P-VQVAE, where the encoder converts the masked image into non-overlapped patch tokens and the decoder recovers the masked regions from inpainted tokens while keeping the unmasked regions unchanged. To eliminate the information loss caused by quantization, an Un-Quantized Transformer (UQ-Transformer) is applied, which directly takes the features from P-VQVAE encoder as input without quantization and regards the quantized tokens only as prediction targets. Extensive experiments show that PUT greatly outperforms state-of-the-art methods on image fidelity, especially for large masked regions and complex large-scale datasets. Code is available at https://github.com/liuqk3/PUT
研究の動機と目的
- 入力のダウンサンプリングおよび画素の量子化によって引き起こされるトランスフォーマーに基づく複数解釈可能な画像補填における情報損失を是正すること。
- 特にマスク領域の境界部において、高分解能の画像ディテールと空間的整合性を保持すること。
- 特にImageNetのような大規模データセットにおいて、大きな複雑な領域における補填の忠実度と多様性を向上させること。
- 非量子化トランスフォーマーのための訓練戦略を設計し、訓練中にランダムに量子化することで離散トークンの予測を可能にすること。
- 従来の手法で一般的に見られる高分解像と低分解像の表現間の不整合アーチファクトを排除すること。
提案手法
- 入力をダウンサンプリングせずに、パッチベースで非重複的な自己符号化器として機能するP-VQVAEを導入し、画像パッチを潜在的特徴に符号化する。
- マスク済みと未マスク済みのパッチを別々に表現できるように、P-VQVAEに二重のコードブックを採用し、特徴の分離性を向上させる。
- P-VQVAEのデコーダーを用いてマスク領域を再構築すると同時に、未マスク領域はそのままで保持する。
- 非量子化された特徴ベクトルを入力としつつ、量子化済みトークンを予測ターゲットとするUQ-Transformerを提案し、量子化に起因する情報損失を回避する。
- 推論時の条件を模倣するために、訓練中に入力特徴をランダムに量子化する手法を採用し、推論時に完全な量子化を行わずとも正確な生成が可能となるように訓練する。
- ネットワーク全体で高分解像の入力を維持することで、入力と予測間の解像度の不整合を排除する。
実験結果
リサーチクエスチョン
- RQ1入力のダウンサンプリングおよび量子化を回避することで、トランスフォーマーに基づくモデルにおける画像補填の忠実度が向上するか?
- RQ2トランスフォーマー内で非量子化された特徴を処理することで、生成画像領域の品質と多様性にどのような影響を与えるか?
- RQ3自己符号化器における非重複パッチ設計が、マスク済み領域と未マスク済み領域の干渉をどの程度低減するか?
- RQ4UQ-Transformerの訓練時にランダムに量子化を行うことで、離散トークンの推論が有効に可能となり、特徴の忠実度が保持されるか?
- RQ5不規則で大きなマスク領域を扱う際、PUTは既存手法と比較してどの程度優れているか?
主な発見
- FFHQ、Places2、ImageNetのデータセットにおいて、FID、LPIPS、FVDの指標でSOTAを達成し、特に大きなマスク領域において従来手法を大きく上回る性能を示した。
- アブレーションスタディの結果、二重コードブックを用いたPUT(PUT)は、単一コードブック(PUT one)や非量子化推論(PUT no_ref)よりも優れていることが確認され、構造的なコードブック設計の有効性が裏付けられた。
- スライディングウィンドウ処理を用いるCNNベースのエンコーダーを搭載したPUT conv よりもPUTが優れていることから、重複のないパッチ符号化がマスク済み・未マスク領域間の干渉を効果的に回避できることを示した。
- 訓練時にランダム量子化を適用したモデル(PUT)は、その手法を用いないバージョン(PUT qua0)よりも顕著に優れており、UQ-Transformerの訓練戦略の有効性が検証された。
- マスク領域の端縁に生じる不整合アーチファクト(ICTの結果に見られるもの)を完全に排除し、不規則なマスクであっても滑らかで自然な出力を得られた。
- ImageNetのような複雑なデータセットにおいて、PUTは既存のトランスフォーマーに基づく手法と比較して、画像の忠実度において顕著な向上を示し、シーンの複雑さに対するロバスト性が顕著に高まった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。