[論文レビュー] ITTR: Unpaired Image-to-Image Translation with Transformers
本稿では、局所的およびグローバルなコンテキストを捉えるハイブリッドパーセプションブロック(HPB)と、計算コストを低減するためのデュアルプリーディング自己注意(DPSA)を組み合わせた、非ペaired画像対画像変換を目的としたビジョントランスフォーマーに基づくアーキテクチャ、ITTRを提案する。ITTRは6つのベンチマークで最先端の性能を達成し、FIDとDRN-Scoreの両面で先行手法を上回りながらも、効率性を維持している。
Unpaired image-to-image translation is to translate an image from a source domain to a target domain without paired training data. By utilizing CNN in extracting local semantics, various techniques have been developed to improve the translation performance. However, CNN-based generators lack the ability to capture long-range dependency to well exploit global semantics. Recently, Vision Transformers have been widely investigated for recognition tasks. Though appealing, it is inappropriate to simply transfer a recognition-based vision transformer to image-to-image translation due to the generation difficulty and the computation limitation. In this paper, we propose an effective and efficient architecture for unpaired Image-to-Image Translation with Transformers (ITTR). It has two main designs: 1) hybrid perception block (HPB) for token mixing from different receptive fields to utilize global semantics; 2) dual pruned self-attention (DPSA) to sharply reduce the computational complexity. Our ITTR outperforms the state-of-the-arts for unpaired image-to-image translation on six benchmark datasets.
研究の動機と目的
- 非ペア画像対画像変換において、CNNベースのジェネレータが長距離依存関係を捉える能力に制限を受ける問題に対処すること。
- 認識ベースのビジョントランスフォーマーが画像変換タスクにおいて高い計算コストと生成の不安定性を示す問題を克服すること。
- グローバルコンテキストモデリングと計算効率の両立を図った、効率的かつ効果的なトランスフォーマー基盤ジェネレータを設計すること。
- 強力な定量的および定性的な結果を得るために、多様な非ペア画像変換ベンチマーク上で提案アーキテクチャの有効性を検証すること。
提案手法
- ハイブリッドパーセプションブロック(HPB)は、局所的特徴抽出のためのディープワイズ畳み込みブランチと、グローバルコンテキストモデリングのための自己注意ブランチを統合し、マルチ受容場の特徴統合を可能にする。
- デュアルプリーディング自己注意(DPSA)は、注意マップを計算する前に、行および列方向に低寄与度のトークンを評価・削除することで、自己注意の複雑さを低減する。
- DPSAでは、訓練の安定化と崩壊の防止を目的に、クエリおよびキー行列に対してトークン単位のL2正規化を適用し、信頼性のある注意学習を保証する。
- ジェネレータアーキテクチャは、ソースドメインとターゲットドメインの非ペアデータを活用して、サイクル整合性とアイデンティティ損失を用いてエンドツーエンドで訓練される。
- DPSAは、学習可能な寄与スコアを用いてスパースなトークン選択を実施し、FLOPsを削減しながらも性能を維持する。
- モデルは標準的なGANの目的関数を用いて最適化され、6つの標準的な非ペア変換ベンチマークで評価される。
実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマー基盤ジェネレータは、長距離依存関係を捉えることで、CNNベースジェネレータを上回ることができるか?
- RQ2ビジョントランスフォーマーにおける自己注意の高い計算コストを、変換品質を損なわずに低減する方法は何か?
- RQ31つのブロックに局所的パーセプション(CNN)とグローバルな注目(トランスフォーマー)を統合することで、画像変換にどのような影響を与えるか?
- RQ4自己注意におけるトークンプリーニングは、変換タスクにおける意味的整合性および画像品質を維持するか、あるいは向上させるか?
- RQ5FID、DRN-Score、推論効率の観点から、提案アーキテクチャは最先端手法と比較してどのように差をつけるか?
主な発見
- ITTRは6つの非ペア画像対画像変換ベンチマークで最先端の性能を達成し、FIDとDRN-Scoreの両面で先行手法を上回っている。
- Horse→ZebraおよびCityscapesデータセットでは、それぞれFIDスコアが45.1および33.6を記録し、CUTおよびLSeSimを上回っている。
- アブレーションスタディの結果、HPBにおける局所的パーセプションブランチを削除すると性能が低下(FID: 45.7 → 48.6)し、ドメインギャップ低減におけるその重要性が確認された。
- DPSAは計算複雑性を顕著に低減した:ITTRのジェネレータはわずか45.8 G MACsを要し、CUTやLSeSimを下回っているが、FIDスコアはより優れている。
- QおよびKのトークン単位L2正規化が行われないとモデルが崩壊するため、訓練安定性におけるその重要性が示された。
- DPSAにおける最適なスパーストークンは8×8であり、より大きなトークン数(例:16×16)では、プリーニング効果が低下し、ソフトマックス平滑化の影響により性能が劣化する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。