Skip to main content
QUICK REVIEW

[논문 리뷰] Generated Faces in the Wild: Quantitative Comparison of Stable Diffusion, Midjourney and DALL-E 2

Ali Borji|arXiv (Cornell University)|2022. 10. 02.
Generative Adversarial Networks and Image Synthesis인용 수 96
한 줄 요약

본 논문은 FID를 사용해 Stable Diffusion, Midjourney, DALL-E 2 간의 야생에서의 포토리얼리스틱 얼굴 생성의 정량적 비교를 수행합니다. 세 가지 중 Stable Diffusion이 얼굴 품질이 가장 우수합니다. 평가를 위한 생성 얼굴의 새로운 GFW 데이터셋이 도입됩니다.

ABSTRACT

The field of image synthesis has made great strides in the last couple of years. Recent models are capable of generating images with astonishing quality. Fine-grained evaluation of these models on some interesting categories such as faces is still missing. Here, we conduct a quantitative comparison of three popular systems including Stable Diffusion, Midjourney, and DALL-E 2 in their ability to generate photorealistic faces in the wild. We find that Stable Diffusion generates better faces than the other systems, according to the FID score. We also introduce a dataset of generated faces in the wild dubbed GFW, including a total of 15,076 faces. Furthermore, we hope that our study spurs follow-up research in assessing the generative models and improving them. Data and code are available at data and code, respectively.

연구 동기 및 목표

  • 혼잡한 장면에서 포토리얼리스틱 얼굴을 생성하는 세 가지 텍스트-투-이미지 모델의 능력을 평가한다.
  • 제어된 얼굴 데이터셋과 FID를 평가 지표로 사용하여 공정한 정량적 비교를 제공한다.
  • 향후 생성 모델 평가 및 편향 연구를 가능하게 하기 위해 생성된 얼굴의 데이터셋을 생성한다.

제안 방법

  • COCO 캡션을 사용해 세 모델에 얼굴이 포함된 이미지를 생성하도록 프롬프트한다.
  • 생성 이미지와 실제 이미지에서 MediaPipe 얼굴 인식기를 사용해 얼굴을 감지하고 거짓 양성을 제거한다.
  • 생성된 얼굴을 100x100으로 리사이즈하고 실제 얼굴에 대해 Fréchet Inception Distance (FID)를 계산한다; 평균과 표준편차를 추정하기 위해 여러 개의 무작위 샘플에서 반복한다.

실험 결과

연구 질문

  • RQ1Stable Diffusion, Midjourney, DALL-E 2가 혼잡한 장면에서 포토리얼리스틱 얼굴을 생성할 수 있는가, 그리고 그것들이 정량적으로 어떻게 비교되는가?
  • RQ2다른 샘플 크기와 기억화 또는 안전장치 가능성을 고려할 때 FID가 모델 간 얼굴 품질을 신뢰성 있게 구분하는가?
  • RQ3이 시스템들에서 야생에서 생성된 얼굴의 실제적 한계점과 실패 모드는 무엇인가?

주요 결과

  • Stable Diffusion이 생성된 얼굴에 대해 세 모델 중 가장 좋은 FID를 보인다.
  • 세 모델 모두 안경, 눈, 가려짐, 측면 얼굴, 얼굴 비대칭에서 어려움을 겪으며 실제 얼굴이 여전히 품질이 더 높다.
  • DALL-E 2는 안전장치, 초상화에 대한 집중, 더 작은 이미지 세트 등으로 인해 Stable Diffusion보다 성능이 떨어지는 반면, Midjourney는 종종 초현실적이거나 애니메이션 형식의 얼굴을 생성한다.
  • 샘플 크기를 늘리면 FID 비교의 안정성이 향상되며, 저자는 15,076개의 생성 얼굴 세트(Stable Diffusion 8,050, Midjourney 6,350, DALL-E 2 676)를 만들었다.
  • 연구는 기억화 및 워터마크 문제의 가능성을 강조하고, FID 외에 SSIM, LPIPS, 인간 평가와 같은 더 넓은 평가 지표를 제안한다.
  • 본 논문은 향후 벤치마킹 및 야생에서의 얼굴 생성에 대한 더 깊은 분석을 촉진하기 위한 데이터와 코드 접근성을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.