Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the Annotation of DeepFashion Images for Fine-grained Attribute Recognition

Roshanak Zakizadeh, Michele Sasdelli|arXiv (Cornell University)|2018. 07. 31.
Generative Adversarial Networks and Image Synthesis참고 문헌 8인용 수 7
한 줄 요약

이 논문은 저자들이 저명한 패션 이미지 데이터셋인 DeepFashion의 세분화된 속성 인식 성능을 향상시키기 위해 저자원 속성들을 필터링하고, 시각적으로 중복되는 속성들(예: 'striped'과 'stripe')을 통합하며, 아홉 가지 주요 의류 카테고리에 대해 재표기한 바 있다. 공개된 개선된 주석 데이터는 양자리 CNN에 쌍별 순위 손실를 적용했을 때 다중 레이블 인식 성능을 최대 12% 향상시킨다.

ABSTRACT

DeepFashion is a widely used clothing dataset with 50 categories and more than overall 200k images where each image is annotated with fine-grained attributes. This dataset is often used for clothes recognition and although it provides comprehensive annotations, the attributes distribution is unbalanced and repetitive specially for training fine-grained attribute recognition models. In this work, we tailored DeepFashion for fine-grained attribute recognition task by focusing on each category separately. After selecting categories with sufficient number of images for training, we remove very scarce attributes and merge the duplicate ones in each category, then we clean the dataset based on the new list of attributes. We use a bilinear convolutional neural network with pairwise ranking loss function for multi-label fine-grained attribute recognition and show that the new annotations improve the results for such a task. The detailed annotations for each of the selected categories are provided for public use.

연구 동기 및 목표

  • 세분화된 속성 인식을 방해하는 DeepFashion 원본 1000개 속성의 불균형성과 중복성을 해결한다.
  • 신뢰할 수 있는 훈련을 지원하기 위해 최소 6,000장 이상의 이미지 샘플을 확보한 의류 카테고리만을 식별하고 유지한다.
  • 카테고리 샘플의 2% 미만 빈도를 가진 속성들을 제거하여 주석 노이즈를 감소시키고, 시각적으로 유사한 속성들을 통합한다.
  • 아홉 가지 주요 의류 카테고리에 대해 일관되고 중복되지 않은 주석이 적용된 정제된, 공개 가능한 데이터셋을 제공한다.
  • 개선된 주석 품질이 다중 레이블 속성 인식 성능에 측정 가능한 성과 향상으로 이어지는지 입증한다.

제안 방법

  • 훈련 안정성을 확보하기 위해 최소 6,000장의 이미지를 확보한 아홉 가지 의류 카테고리(예: 드레스, 티셔츠, 블라우스)를 선정한다.
  • 각 카테고리당 빈도가 2% 미만인 속성들을 제거하여 클래스 불균형 문제를 완화한다.
  • 의미적 및 시각적으로 유사한 속성들(예: 'striped'과 'stripe', 'polkadot'과 'dot')을 통합된 레이블로 통합한다.
  • 각 카테고리별로 새로운 속성 목록을 기반으로 훈련, 검증, 테스트 분할을 재구성한다.
  • 쌍별 순위 손실를 사용한 VGG16 기반의 이중선형 CNN을 다중 레이블 속성 인식에 대해 훈련시킨다.
  • ICA 투영과 이중선형 풀링을 활용해 압축되고 구분력 있는 특징을 추출하여 속성 예측에 활용한다.

실험 결과

연구 질문

  • RQ1낮은 빈도 및 중복 속성들을 제거할 경우 세분화된 속성 인식 모델의 성능에 어떤 영향을 미치는가?
  • RQ2의미적으로 유사한 속성들을 통합할 경우 모델의 일반화 능력과 각 속성의 정밀도는 어느 정도 향상되는가?
  • RQ3정제되고 균형 잡힌 DeepFashion의 서브셋이 의류 카테고리에서 다중 레이블 속성 인식을 위한 신뢰할 수 있는 훈련을 지원할 수 있는가?
  • RQ4주석 품질은 특히 샘플 수가 적은 레이블의 각 속성 정밀도에 어떤 영향을 미치는가?
  • RQ5제안된 재주석화 과정이 평균 정밀도 및 가중 평균 평균 정밀도에 측정 가능한 향상 효과를 가져오는가?

주요 결과

  • 빈도가 2% 미만인 속성들을 제거하고 중복 항목을 통합한 후, 카테고리당 속성 수가 23~35개로 감소하여 데이터 균형이 크게 향상되었다.
  • 모델의 순위 기반 평균 정밀도(AvgPrec)는 블라우스에서 0.49에서 0.51로, 드레스에서 0.59에서 0.61로 향상되어 카테고리 간 일관된 성능 향상을 보였다.
  • 가중 평균 정밀도(wmap)는 블라우스에서 0.31에서 0.33으로, 드레스에서 0.40에서 0.42로 향상되어 전체 성능 향상이 확인되었다.
  • 특정 중복 쌍인 티셔츠 카테고리의 'print'와 'printed'의 경우, 통합 후 mAP가 0.06에서 0.54로 상승하여, 통합이 저샘플링 문제를 해결함을 입증했다.
  • 드레스 카테고리에서 'striped'와 'stripe' 쌍은 통합 후 mAP가 0.42에서 0.71로 상승하여, 중복 레이블이 성능을 심각하게 떨어뜨린다는 점을 보여주었다.
  • 정제된 데이터셋으로 훈련된 모델은 일부 카테고리에서 mAP를 최대 12% 상승시켜, 주석 품질이 직접적으로 인식 정확도에 영향을 준다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.