Skip to main content
QUICK REVIEW

[논문 리뷰] DAF:re: A Challenging, Crowd-Sourced, Large-Scale, Long-Tailed Dataset For Anime Character Recognition

Edwin Arkel Rios, Wen-Huang Cheng|arXiv (Cornell University)|2021. 01. 21.
Video Analysis and Summarization참고 문헌 17인용 수 7
한 줄 요약

이 논문은 3,000개의 클래스에 걸쳐 500만 장의 애니메이션 얼굴을 포함하는 대규모, 공동 제작자 기반, 긴 꼬리 분포 데이터셋인 DAF:re를 소개한다. 이는 애니메이션 캐릭터 인식 분야의 발전을 위해 설계되었다. 실험 결과, 소규모 배치(64) 및 소형 이미지(128×128) 설정에서 비전 트랜스포머(ViT)가 전이 학습을 거친 후에 컨볼루션 네트워크(CNN)인 ResNet을 능가하는 것으로 나타났으며, 특히 소규모 설정에서 뛰어난 성능을 보였다. 반면 대규모 배치(1024) 및 대형 이미지(224×224) 조건에서는 CNN이 우세하다.

ABSTRACT

In this work we tackle the challenging problem of anime character recognition. Anime, referring to animation produced within Japan and work derived or inspired from it. For this purpose we present DAF:re (DanbooruAnimeFaces:revamped), a large-scale, crowd-sourced, long-tailed dataset with almost 500 K images spread across more than 3000 classes. Additionally, we conduct experiments on DAF:re and similar datasets using a variety of classification models, including CNN based ResNets and self-attention based Vision Transformer (ViT). Our results give new insights into the generalization and transfer learning properties of ViT models on substantially different domain datasets from those used for the upstream pre-training, including the influence of batch and image size in their training. Additionally, we share our dataset, source-code, pre-trained checkpoints and results, as Animesion, the first end-to-end framework for large-scale anime character recognition: https://github.com/arkel23/animesion

연구 동기 및 목표

  • 컴퓨터 비전 분야에서 애니메이션 캐릭터 인식을 위한 대규모, 다양한 종류의, 긴 꼬리 분포 데이터셋의 부족을 해결하기 위해.
  • 비전 트랜스포머(ViT)가 ImageNet 사전 훈련 분포와 상당히 다른 도메인에서의 일반화 및 전이 학습 성능을 조사하기 위해.
  • 이미지 크기 및 배치 크기와 같은 다양한 하이퍼파라미터 조건에서 비전 트랜스포머(ViT)와 CNN 기반 모델(ResNet) 간의 성능을 비교하기 위해.
  • 연구를 가속화하기 위해 코드, 사전 훈련된 모델, 데이터셋을 포함하는 완전한 엔드 투 엔드 프레임워크인 Animesion을 공개하기 위해.

제안 방법

  • 기존 DanbooruAnimeFaces(DF) 데이터셋을 개선하여 약 500만 장의 이미지와 3,000개의 클래스를 포함하는 공동 제작자 기반, 대규모, 긴 꼬리 분포 데이터셋인 DAF:re로 재구성하였다.
  • 공개된 자료에서 이미지를 수집하고 표준화된 전처리를 적용: 160×160 또는 256×256로 리사이징, 128×128 또는 224×224로 무작위 컷, 데이터 증강을 위한 수평 뒤집기 적용.
  • ImageNet 사전 훈련 여부에 관계없이 ResNet-18, ResNet-152 및 비전 트랜스포머(ViT-B/16, ViT-B/32, ViT-L/16, ViT-L/32) 등의 여러 모델을 훈련하였다.
  • 운동량을 사용한 확률적 경사 하강법를 사용: 초기 학습률(LR) = 0.001, 20 에포크마다 1/3 감소(50 에포크 동안) 또는 50 에포크마다 감소(200 에포크 동안).
  • 검증 및 테스트 분할에서 정확도(상위 1위 및 상위 5위)를 평가하였으며, 추론 시 정규화는 수행했으나 증강은 적용하지 않았다.
  • 데이터셋, 코드, 사전 훈련된 모델, Animesion 프레임워크를 공개하여 재현 가능성 및 향후 연구 지원을 위해 노력하였다.

실험 결과

연구 질문

  • RQ1소규모 배치(64) 및 소형 이미지(128×128) 설정에서 비전 트랜스포머(ViT)가 ResNet과 같은 CNN 모델보다 애니메이션 얼굴 인식에서 어떻게 성능을 내는가?
  • RQ2이하류 작업에서 이미지 크기(128×128 대비 224×224)와 배치 크기(64 대비 1024)가 ViT 및 ResNet 모델의 성능에 어떤 영향을 미치는가?
  • RQ3ImageNet 사전 훈련이 DAF:re와 같은 긴 꼬리 분포, 스타일화된, 그려진 이미지 데이터셋에 적용되었을 때 ViT 및 ResNet 모델에 어떤 영향을 미치는가?
  • RQ4비전 트랜스포머 모델은 사전 훈련 분포(실제 사진)와 상당히 다른 도메인(예: 애니메이션)에 효과적으로 일반화될 수 있는가?
  • RQ5대규모 및 긴 꼬리 분포 데이터셋에서 ViT와 CNN 기반 모델 간의 성능 상호 교환 관계는 어떠한가?

주요 결과

  • 소규모 배치(64) 및 소형 이미지(128×128) 설정에서 ImageNet 사전 훈련을 거친 ViT 모델은 moeImouto 데이터셋에서 상위 1위 정확도 92.80%를 기록했으며, 전이 학습을 거친 ResNet-18(61.20%) 및 ResNet-152(63.06%)를 크게 앞섰다.
  • 대규모 배치(1024) 및 대형 이미지(224×224) 설정에서는 ResNet-18이 68.30%의 상위 1위 정확도를 기록한 반면, ViT-B/32는 59.92%에 머물러, 이 조건에서는 CNN이 우세함을 보였다.
  • ViT-L/16 모델은 64의 배치 크기와 128×128 입력 조건에서 DAF:re에서 상위 5위 정확도 94.23%를 기록하여 유리한 하이퍼파라미터 설정에서 강력한 일반화 능력을 보였다.
  • 사전 훈련이 ViT 성능 향상에 크게 기여함을 확인: ViT-B/16는 사전 훈련 시 moeImouto에서 상위 1위 정확도 91.57%를 기록했고, 사전 훈련 없이 67.28%에 머물렀다. ResNet-18는 동일 조건에서 72.58%에서 61.20%로 감소했다.
  • ViT와 CNN 간의 성능 격차는 하이퍼파라미터에 매우 민감함: 배치 크기가 작고 이미지 크기가 작을 경우 ViT가 CNN을 앞서지만, 반대로 배치 크기가 크고 이미지 크기가 클 경우 성능이 열 劣한다.
  • 사전 훈련 없이도 ViT-B/16는 64의 배치 크기와 128×128 입력 조건에서 DAF:re에서 상위 1위 정확도 82.14%를 기록하여 이 도메인에 강력한 인덕티브 바이어스 또는 능력을 지닌 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.