[論文レビュー] Deepfake Video Detection Using Generative Convolutional Vision Transformer
本論文では、視覚的特徴抽出にConvNeXtとSwin Transformerを組み合わせ、潜在的データ分布のモデリングにオートエンコーダーと変分オートエンコーダーを用いる、深造り動画検出のための新規モデルGenConViTを提案する。複数のベンチマークにおいて95.8%の平均正答率と99.3%のAUCを達成し、多様な深造り動画を検出するうえで優れた汎化性能と耐性を示している。
Deepfakes have raised significant concerns due to their potential to spread false information and compromise digital media integrity. In this work, we propose a Generative Convolutional Vision Transformer (GenConViT) for deepfake video detection. Our model combines ConvNeXt and Swin Transformer models for feature extraction, and it utilizes Autoencoder and Variational Autoencoder to learn from the latent data distribution. By learning from the visual artifacts and latent data distribution, GenConViT achieves improved performance in detecting a wide range of deepfake videos. The model is trained and evaluated on DFDC, FF++, DeepfakeTIMIT, and Celeb-DF v2 datasets, achieving high classification accuracy, F1 scores, and AUC values. The proposed GenConViT model demonstrates robust performance in deepfake video detection, with an average accuracy of 95.8% and an AUC value of 99.3% across the tested datasets. Our proposed model addresses the challenge of generalizability in deepfake detection by leveraging visual and latent features and providing an effective solution for identifying a wide range of fake videos while preserving media integrity. The code for GenConViT is available at https://github.com/erprogs/GenConViT.
研究の動機と目的
- 多様な動画分布にわたる深造り検出における汎化性の課題に対処すること。
- 既存手法が視覚的アーティファクトに依存するが、未確認の深造りタイプでは失敗するという限界を克服すること。
- 視覚的特徴と潜在的データ分布を併用して、検出の耐性を向上させること。
- 動画シーケンスにおける局所的およびグローバルな時空間パターンを効果的に捉える統合アーキテクチャの開発。
- 実世界の応用においてデジタルメディアの整合性を保つための信頼性の高いソリューションの提供。
提案手法
- 動画フレームからの階層的局所的およびグローバル視覚的特徴抽出のため、ConvNeXtとSwin Transformerを統合する。
- 本質的な潜在的データ分布を学習するために、オートエンコーダー(AE)と変分オートエンコーダー(VAE)を採用する。
- AEとVAEの再構成出力を元のフレームと比較し、操作の兆候を示す乖離を特定する。
- ConvNeXtとSwin Transformerからの視覚的特徴と、AEとVAEからの再構成誤差を統合し、最終的な分類に用いる。
- クロスエントロピー損失を用いて複数の深造りデータセットでエンドツーエンドのモデルを訓練し、AdamWで最適化する。
- 汎化性能を向上させ、過学習を防ぐためにデータオーグメンテーションとクラスバランス技術を適用する。

実験結果
リサーチクエスチョン
- RQ1視覚的特徴抽出と潜在的分布モデリングを組み合わせることで、深造り検出の汎化性能が向上するか?
- RQ2GenConViTは、DFDC、FF++、DeepfakeTIMIT、Celeb-DF(v2)のような多様な深造りデータセットでどのように性能を発揮するか?
- RQ3視覚的アーティファクトと内部データ表現の両方をモデリングすることで、検出の耐性がどの程度向上するか?
- RQ4ベンチマークデータセット全体で、GenConViTは最新の最先端モデルと比較して、正答率、AUC、F1スコアの観点で優れているか?
- RQ5生成モデルと統合されたConvNeXtとSwin Transformerの融合は、単独のアーキテクチャに比べてより優れた性能を発揮するか?
主な発見
- GenConViTはDFDCデータセットで98.5%の正答率と99.9%のAUCを達成し、以前の最先端モデルを上回った。
- FF++データセットでは97.0%の正答率と99.6%のAUC、F1スコア97.1%を達成し、多様な深造りタイプに対して強力な性能を示した。
- Celeb-DF(v2)でも高い性能を維持し、F1スコア95.5%、AUC98.1%を達成した。これは複雑な操作に対しても耐性があることを示している。
- 全テストデータセットで平均正答率95.8%、平均AUC99.3%を達成し、汎化能力の高さを確認した。
- GenConViT(B)はGenConViT(A)をわずかに上回り、FF++でAUC99.6%、F1スコア96.8%を記録した。これはアーキテクチャの最適化が有効であることを示している。
- AUCとF1スコアの両方で、すべての指標において一貫して優れた性能を示しており、本物と偽物のクラスを強く識別できることを示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。