Skip to main content
QUICK REVIEW

[論文レビュー] Using GANs to Synthesise Minimum Training Data for Deepfake Generation

Simranjeet Singh, Rajneesh Sharma|arXiv (Cornell University)|Nov 10, 2020
Generative Adversarial Networks and Image Synthesis参考文献 11被引用数 5
ひとこと要約

本論文では、YouTubeから抽出した多数の動画フレームを用いてStyleGAN2を訓練し、ジョン・オリバーの顔の1,000枚にのわたる多様で高品質な合成画像を生成することで、最小限の実際のトレーニングデータでほぼリアルなディープフェイク動画を生成する手法を提案している。実際のデータを一切使用しないにもかかわらず、得られたディープフェイク動画は高い知覚的品質と顔の多様性を示し、GANで生成されたデータがディープフェイク生成における大規模な実データセットの代替として効果的に機能できることを示している。

ABSTRACT

There are many applications of Generative Adversarial Networks (GANs) in fields like computer vision, natural language processing, speech synthesis, and more. Undoubtedly the most notable results have been in the area of image synthesis and in particular in the generation of deepfake videos. While deepfakes have received much negative media coverage, they can be a useful technology in applications like entertainment, customer relations, or even assistive care. One problem with generating deepfakes is the requirement for a lot of image training data of the subject which is not an issue if the subject is a celebrity for whom many images already exist. If there are only a small number of training images then the quality of the deepfake will be poor. Some media reports have indicated that a good deepfake can be produced with as few as 500 images but in practice, quality deepfakes require many thousands of images, one of the reasons why deepfakes of celebrities and politicians have become so popular. In this study, we exploit the property of a GAN to produce images of an individual with variable facial expressions which we then use to generate a deepfake. We observe that with such variability in facial expressions of synthetic GAN-generated training images and a reduced quantity of them, we can produce a near-realistic deepfake videos.

研究の動機と目的

  • 限られた実際の顔画像データしか入手できない有名人でない人物向けに、高品質なディープフェイクを生成する課題に対処すること。
  • GANによって生成された合成顔画像が、ディープフェイクモデルのトレーニングデータとして効果的であるかどうかを調査すること。
  • 合成トレーニングデータにおける顔の表情の多様性と画像品質が、ディープフェイクのリアルさに与える影響を評価すること。
  • 多様で高品質なGAN生成画像をわずか1,000枚程度で使用することで、人間の目にはほとんど区別がつかないほどのディープフェイク動画を生成できることを実証すること。
  • 数千枚の実際の顔画像を必要とせずに、一般の人々のディープフェイクを生成するための手法を提供すること。

提案手法

  • YouTubeからジョン・オリバーの132,000フレームの動画を抽出し、それらを用いてStyleGAN2モデルを訓練して合成顔画像を生成した。
  • 顔の表情やポーズに高い多様性を持つ1,000枚の合成顔画像からなるデータセットを生成した。
  • OpenFace(平均スコア0.401、分散0.068)およびface_recognitionライブラリを用いて、画像品質と顔の多様性を評価した。
  • GAN生成画像の品質と多様性を評価するため、Inceptionスコア1.628を計算した。
  • チャットボット(ChatterBot)を用いて会話を生成し、その会話を実際の被験者が演技した動画を記録した。
  • DeepFaceLabフレームワークを用いて、256x256解像度の動画フレーム全体にわたり、被験者の顔をGANで生成されたジョン・オリバーの顔に交換した。

実験結果

リサーチクエスチョン

  • RQ1顔の表情に高い多様性を持つ1,000枚のGAN生成画像データセットが、高品質なディープフェイク動画を生成できるか?
  • RQ2ディープフェイクトレーニングの文脈において、GAN生成画像の顔の多様性とリアルさは、実画像と比べてどの程度か?
  • RQ3事前に訓練されたGANから得られる合成画像が、ディープフェイク生成における大規模な実データセットにどの程度代替可能か?
  • RQ4完全に合成されたトレーニング画像のみを用いて生成されたディープフェイク動画の知覚的品質はどの程度か?また、実データベースのディープフェイクと比較してどうか?
  • RQ5合成データのみでトレーニングされた場合でも、ディープフェイク出力がフレーム間で視覚的に一貫性を保てるか?

主な発見

  • GANで生成された1,000枚の画像データセットは顔の多様性が高く、OpenFaceによる評価では平均類似度スコア0.401、分散0.068を示し、顔の同一性は保たれつつ多様な表情が得られていることが確認された。
  • 生成画像のInceptionスコア1.628は、適切な多様性と品質を示しており、これらがトレーニングデータとしての有効性を裏付けている。
  • 完全に合成画像のみを用いて生成されたディープフェイク動画は、ほぼリアルな品質に達しており、顔の交換がフレーム全体にわたり説得力があり一貫性を示した。
  • わずかな色の不一致はあったが、動画は公開され、視覚的に妥当であると評価された。これにより、合成データがディープフェイクトレーニングにおいて実現可能であることが示された。
  • 本手法により、実際の顔画像を数千枚も必要とせず、一般の人物のディープフェイクを成功裏に生成できた。
  • 結果から、GANを用いたデータ合成により、ディープフェイク生成に必要なデータ量を大幅に削減しつつも、高い出力品質を維持できることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。