Skip to main content
QUICK REVIEW

[論文レビュー] Unpaired Photo-to-manga Translation Based on The Methodology of Manga Drawing

Hao Su, Jianwei Niu|arXiv (Cornell University)|Apr 22, 2020
Generative Adversarial Networks and Image Synthesis参考文献 7被引用数 6
ひとこと要約

MangaGAN は、複数の GAN アーキテクチャを用いてマンガ作家の技術を模倣する、未対応の写真からマンガへの翻訳を実現する新規な GAN ベース手法である。幾何学的顔面特徴を生成することで、高品質でスタイルが一貫したマンガ顔を実現し、滑らかな線画と高い類似度を達成し、新たに構築されたマンガデータセットにおいて最先端の手法を上回る性能を発揮する。

ABSTRACT

Manga is a world popular comic form originated in Japan, which typically employs black-and-white stroke lines and geometric exaggeration to describe humans' appearances, poses, and actions. In this paper, we propose MangaGAN, the first method based on Generative Adversarial Network (GAN) for unpaired photo-to-manga translation. Inspired by how experienced manga artists draw manga, MangaGAN generates the geometric features of manga face by a designed GAN model and delicately translates each facial region into the manga domain by a tailored multi-GANs architecture. For training MangaGAN, we construct a new dataset collected from a popular manga work, containing manga facial features, landmarks, bodies, and so on. Moreover, to produce high-quality manga faces, we further propose a structural smoothing loss to smooth stroke-lines and avoid noisy pixels, and a similarity preserving module to improve the similarity between domains of photo and manga. Extensive experiments show that MangaGAN can produce high-quality manga faces which preserve both the facial similarity and a popular manga style, and outperforms other related state-of-the-art methods.

研究の動機と目的

  • 入力写真の顔のアイデンティティを保持しつつ、本物のマンガ風アートを生成できる深層学習手法を開発すること。
  • ペaired データが存在しない状況でも、マンガの描画実務からの知見を活用して、現実的な写真をスタイライズドなマンガ顔に変換する課題に対処すること。
  • ノイズを低減し、生成されたマンガ顔における線画の連続性を向上させることで、視覚的品質を向上させること。
  • 類似度を保つモジュールを用いて、入力写真と生成されたマンガ出力の間で顔の類似度を高めること。
  • 既存のマンガ作品から大規模かつ高精細なデータセットを構築することで、写真からマンガへの翻訳の新しいベンチマークを確立すること。

提案手法

  • MangaGAN は、顔の各部位に特化した生成器と判別器を備えた、顔領域の写真からマンガスタイルへの翻訳を目的としたマルチ GAN アーキテクチャを採用している。
  • 生成されたマンガ顔における線画の連続性を向上させるとともに、ピクセルレベルのノイズを低減するため、新しい構造的スムージング損失を導入して訓練している。
  • 入力写真と生成されたマンガの特徴分布を一致させるために、類似度を保つモジュールを統合しており、顔のアイデンティティの保持を確保している。
  • 人気のあるマンガシリーズから抽出したデータセットを新規に構築し、顔のランドマーク、ボディポーズ、スタイライズドなマンガ特徴をペアで含んでいる。
  • 敵対的訓練を用いることで、リアルなマンガ風出力を生成しながらも、マンガの慣習に従った幾何的整合性を維持している。
  • 熟練したマンガ作家の作業フローを模倣するようにアーキテクチャを設計しており、構造の誇張とスタイライズドなラインワークに重点を置いている。

実験結果

リサーチクエスチョン

  • RQ1ペアドデータを必要としない GAN ベースのモデルは、実写の写真から高品質なマンガ顔を生成できるか?
  • RQ2写真からマンガスタイルへの翻訳において、顔のアイデンティティと類似度をどれほど効果的に保持できるか?
  • RQ3構造的スムージングと類似度を保つコンponent を組み込むことで、生成されたマンガ顔の視覚的品質と現実性はどの程度向上するか?
  • RQ4マルチ GAN アーキテクチャは、マンガ描画に伴う複雑な幾何的およびスタイリスティックな変換を効果的にモデル化できるか?
  • RQ5提案手法は、既存の最先端のアプローチと比較して、未対応の写真からマンガへの翻訳においてどのように優れているか?

主な発見

  • MangaGAN は、入力写真の顔のアイデンティティとマンガ特有の幾何的スタイライズド表現の両方を保持した高品質なマンガ顔を生成する。
  • 構造的スムージング損失は、ノイズの多いピクセルを顕著に低減し、線画の連続性を向上させ、よりクリアで自然な見た目のマンガラインを実現した。
  • 類似度を保つモジュールにより、入力写真と生成されたマンガの間で知覚的な一致が向上し、ドメイン間での顔の一貫性が向上した。
  • 定量的指標と定性的な評価の両方において、既存の最先端手法を上回り、優れたスタイライズド表現とアイデンティティ保持を示した。
  • 実際のマンガ作品から構築した新規データセットは、未対応の写真からマンガへの翻訳分野における今後の研究の貴重なベンチマークを提供している。
  • マルチ GAN アーキテクチャにより、顔領域の翻訳に対して細分化された制御が可能になり、より正確でスタイリスティックな出力を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。