Skip to main content
QUICK REVIEW

[論文レビュー] Semi-supervised Learning for Few-shot Image-to-Image Translation

Yaxing Wang, Salman Khan|arXiv (Cornell University)|Mar 30, 2020
Generative Adversarial Networks and Image Synthesis参考文献 43被引用数 4
ひとこと要約

本論文は、ノイズに強い偽ラベル付けとサイクル整合性を用いて未ラベルデータを活用することで、ラベル付きソース画像への依存を軽減する半教師あり少数ショット画像対画像変換手法SEMITを提案する。20%のラベル付きソースデータのみを用いて完全教師ありモデルと同等の性能を達成し、4つのデータセットで10%のラベル付きデータで最先端の結果を達成する。

ABSTRACT

In the last few years, unpaired image-to-image translation has witnessed remarkable progress. Although the latest methods are able to generate realistic images, they crucially rely on a large number of labeled images. Recently, some methods have tackled the challenging setting of few-shot image-to-image translation, reducing the labeled data requirements for the target domain during inference. In this work, we go one step further and reduce the amount of required labeled data also from the source domain during training. To do so, we propose applying semi-supervised learning via a noise-tolerant pseudo-labeling procedure. We also apply a cycle consistency constraint to further exploit the information from unlabeled images, either from the same dataset or external. Additionally, we propose several structural modifications to facilitate the image translation task under these circumstances. Our semi-supervised method for few-shot image translation, called SEMIT, achieves excellent results on four different datasets using as little as 10% of the source labels, and matches the performance of the main fully-supervised competitor using only 20% labeled data. Our code and models are made public at: https://github.com/yaxingwang/SEMIT.

研究の動機と目的

  • 画像対画像変換のための大規模ラベル付きデータセットを収集する高コストと現実的でない課題に対処する。
  • 訓練中に豊富なラベル付きソースデータを必要とする従来の少数ショット手法の制限を克服する。
  • 訓練時にソースドメインから限られたラベル付きデータしか入手できない、新しい半教師あり少数ショットI2I変換設定を検討する。
  • 強力な偽ラベル付けとサイクル整合性を用いて、未ラベル付きソース画像(外部データを含む)を効果的に活用することで、一般化性能を向上させる。
  • OctConvやエントロピー制御といった一般的なアーキテクチャ的改善を提案し、低データ環境下での学習効率を向上させる。

提案手法

  • 初期のラベル付き画像の少数セットに基づいて、未ラベル付きソース画像にソフトラベルを割り当てるノイズに強い偽ラベル付け手順を適用する。
  • コンテンツ保存を強制し、同じデータセットおよび外部ソースからの未ラベル付き画像の情報を活用するために、サイクル整合性損失を統合する。
  • 高周波数と低周波数の特徴を分離するため、オクターブ畳み込み(OctConv)を組み込み、翻訳に不可欠な高周波数画像ディテールに学習を集中させる。
  • ドメイン不変な潜在表現を促進するためにエントロピー制御を適用し、未観測のターゲットドメインへの一般化を向上させる。
  • ラベル付きデータのための分類損失と併せて、偽ラベル付け、サイクル整合性、分類損失を統合したマルチステージ訓練戦略を用いて翻訳モデルを共同最適化する。
  • 分類損失を外部データに適用しないようにして、分布シフトを避けるために、ドメイン内および外部の未ラベル付きデータの両方でモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1半教師あり学習は、性能を損なわせることなく、少数ショット画像対画像変換におけるラベル付きソース画像への依存を低減できるか?
  • RQ2低データ環境下で、ノイズに強い偽ラベル付けは、未ラベル付きソース画像から信頼性の高い監視信号を生成するのにどの程度有効か?
  • RQ3少数ショットI2I変換において、未ラベル付きデータに適用されたサイクル整合性損失は、性能向上にどの程度寄与するか?
  • RQ4OctConv やエントロピー制御のようなアーキテクチャ的変更は、限られたラベル付きデータ下でのモデル一般化を向上させられるか?
  • RQ5ドメイン内および外部の未ラベル付きデータの組み合わせで訓練されたモデルは、未観測のターゲットドメインに一般化できるか?

主な発見

  • SEMITは、ラベル付きソースデータの20%のみを用いても、完全教師ありFUNITと同等の性能を達成し、AnimalsデータセットではmFID 65.21(FUNITは100%で66.14)を記録する。
  • ラベル付きソースデータを10%にまで減らしても、SEMITはFlowersデータセットでmFID 71.49を達成し、FUNIT(100%ラベルでmFID 72.64)を上回る。
  • Birdsデータセットでは、SEMITが20%のラベル付きデータでmFID 65.42を達成し、FUNITが100%ラベル付きデータでmFID 66.14を達成したのと同等の性能を示す。
  • 特にFlowersのような挑戦的なデータセットでは、SEMITはFUNITよりもより現実的でシャープなターゲット固有の画像を生成する。
  • 拡張されたデータセット(例:Animals++ および Birds++)で共同訓練することで視覚的品質が向上し、外部の未ラベル付きデータを効果的に活用できる能力を示している。
  • 1ショットおよび5ショットの設定でも、SEMIT-1はAnimalsおよびBirdsのすべての指標で競争力のある結果を達成し、強い性能を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。