[論文レビュー] Exploring Patch-wise Semantic Relation for Contrastive Learning in Image-to-Image Translation Tasks
本稿では、パッチ単位の意味的関係を意味的関係一貫性(SRC)正則化とハードネガティブマイニングを用いてモデル化することで、特徴の対応を向上させる、画像対画像翻訳のための新規な対照学習フレームワークを提案する。対照学習を分離し、画像パッチ間の異種意味的関係の一貫性を強制することで、単モodal、マルチモーダル翻訳、GAN圧縮の各タスクで最先端の性能を達成し、FIDとmIoUが顕著に向上する。
Recently, contrastive learning-based image translation methods have been proposed, which contrasts different spatial locations to enhance the spatial correspondence. However, the methods often ignore the diverse semantic relation within the images. To address this, here we propose a novel semantic relation consistency (SRC) regularization along with the decoupled contrastive learning, which utilize the diverse semantics by focusing on the heterogeneous semantics between the image patches of a single image. To further improve the performance, we present a hard negative mining by exploiting the semantic relation. We verified our method for three tasks: single-modal and multi-modal image translations, and GAN compression task for image translation. Experimental results confirmed the state-of-art performance of our method in all the three tasks.
研究の動機と目的
- 既存の対照学習手法が画像内の多様な意味的関係を無視するという限界に対処すること。
- 入力画像と出力画像間のパッチ単位の意味的関係の一貫性を強制することで、特徴の対応を向上させること。
- 空間的に変化する意味的関係に基づいたハードネガティブマイニング戦略を開発し、簡単なネガティブサンプルを避けること。
- サイクル一貫性制約に依存せずに、片側画像翻訳およびGAN蒸留で最先端の性能を達成すること。
提案手法
- 対照的目的と意味的関係正則化を分離する、分離型対照学習(DCE)を導入する。
- 入力と出力間の画像パッチ間で分布的類似性と空間的意味的構造を保持するため、意味的関係一貫性(SRC)正則化を提案する。
- 学習されたパッチ単位の関係に従って、意味的関連性に基づいてネガティブサンプルを選択するハードネガティブマイニング戦略を採用する。
- トレーニングの安定性を向上させるために、ネガティブサンプルの難易度を制御するカリキュラム学習スキームを適用する。
- 関係性の知識を教師モデルから学生モデルに転送することで、画像翻訳およびGAN圧縮の両タスクに本手法を適用する。
- 特徴類似度マップを活用して、翻訳前後における意味的関係の一貫性を可視化および検証する。

実験結果
リサーチクエスチョン
- RQ1パッチ単位の意味的関係をモデル化することで、片側画像対画像翻訳における特徴の対応が向上するか?
- RQ2異種意味的関係の一貫性を強制することで、画像翻訳の品質にどのような影響を与えるか?
- RQ3意味的関係に基づいたハードネガティブマイニングは、対照学習におけるランダムまたは均一なネガティブサンプリングを上回るか?
- RQ4提案手法は、翻訳品質を維持しつつ、どの程度GAN圧縮を改善できるか?
- RQ5提案手法は単モーダル、マルチモーダル、GAN蒸留の各タスクに一般化可能か?
主な発見
- 提案手法は、Horse→ZebraデータセットでFIDスコア34.4、Cityscapesデータセットで46.4を達成し、ベースラインモデルを上回る最先端のスコアを実現した。
- Cityscapesデータセットでは、圧縮された学生モデルが教師モデルよりも高いmIoU(35.6)を達成しており、意味的整合性が向上していることを示している。
- アブレーションスタディの結果、SRCとハードネガティブマイニングの追加が一貫して性能向上をもたらし、フルモデルが最良の結果を達成した。
- 類似度マップの可視化により、SRCが入力と出力間で一貫した意味的パターンを強制していることが確認され、ハードネガティブマイニングが意味的に関連するネガティブサンプルに焦点を当てるようになったことが示された。
- 性能の損失を最小限に抑えながらモデルサイズを削減し、FIDを維持または向上させながら、ベースラインの学生モデルよりもMACsと#Paramsが少ない結果を得た。
- 単モーダル翻訳、マルチモーダル翻訳、GAN圧縮の多様なタスクにわたり、本手法は効果的に一般化し、強靭性と転送可能性を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。