Skip to main content
QUICK REVIEW

[논문 리뷰] Fashion-IQ 2020 Challenge 2nd Place Team's Solution

Minchul Shin, Yoon‐Jae Cho|arXiv (Cornell University)|2020. 07. 13.
Generative Adversarial Networks and Image Synthesis참고 문헌 13인용 수 4
한 줄 요약

이 논문은 N개의 블록을 거쳐 채널별 주의 모듈을 사용하여 텍스트 조건부로 대상 및 후보 이미지 특징 간 잔차를 학습하는 새로운 다중모odal 조합 방법인 RTIC를 제안한다. 이 방법은 이미지 및 텍스트 인코더(ResNet-101/152, LSTM/GRU와 GloVe 임베딩)를 결합하며, 다양한 모델의 유사도 점수를 베이지안 최적화로 가중치를 조정하는 반복적 앙상블 전략을 통해 Fashion-IQ 2020 챌린지에서 2위를 기록했으며, 테스트 점수는 48.02를 기록했다.

ABSTRACT

This paper is dedicated to team VAA's approach submitted to the Fashion-IQ challenge in CVPR 2020. Given a pair of the image and the text, we present a novel multimodal composition method, RTIC, that can effectively combine the text and the image modalities into a semantic space. We extract the image and the text features that are encoded by the CNNs and the sequential models (e.g., LSTM or GRU), respectively. To emphasize the meaning of the residual of the feature between the target and candidate, the RTIC is composed of N-blocks with channel-wise attention modules. Then, we add the encoded residual to the feature of the candidate image to obtain a synthesized feature. We also explored an ensemble strategy with variants of models and achieved a significant boost in performance comparing to the best single model. Finally, our approach achieved 2nd place in the Fashion-IQ 2020 Challenge with a test score of 48.02 on the leaderboard.

연구 동기 및 목표

  • 이미지 및 텍스트 모odal을 공유된 의미 공간으로 효과적으로 통합함으로써 패션 이미지 검색 성능을 향상시키는 것.
  • 텍스트 조건부 주의 메커니즘을 사용하여 대상 및 후보 이미지 특징 간 잔차 차이를 모델링하는 것.
  • 다양한 모델을 최적의 가중치로 조합하는 반복적 앙상블 전략을 통해 검색 성능를 향상시키는 것.
  • 외부 데이터셋에서의 미사전학습 없이도 Fashion-IQ 2020 벤치마크에서 최신 기술 수준의 성능을 달성하는 것.

제안 방법

  • N개의 블록과 채널별 주의 모듈을 사용하여 대상 및 후보 이미지 특징 간 잔차를 모델링하는 다중모달 조합기인 RTIC를 제안한다.
  • 이미지에 대해 ResNet-101/152, 텍스트에 대해 2층의 LSTM+GRU와 900D GloVe 초기화된 단어 임베딩을 사용하는 이중 분기 인코더를 사용한다.
  • 하드 음성 마이닝을 적용한 트리플릿 손실과 AdamW 옵timizer를 사용하며, 이미지 및 텍스트 인코더에 대해 개별적으로 최적화된 학습률을 적용한다.
  • 최고의 검증 점수 행렬을 새로운 후보로 사용하는 반복적 앙상블 과정을 적용하며, 최적의 가중치는 베이지안 최적화(hyperopt)를 통해 확보한다.
  • DeepFashion의 오프더셰프 IR 특징과 일치시켜 이미지 인코더와 다중모달 조합기의 출력을 정렬함으로써 지식 distillation을 통합한다.
  • 랜덤 수평 플립, 애핀 변환, 비율 유지를 유지하는 패딩을 포함한 데이터 증강 기법을 사용하며, 이미지를 224×224로 크기 조정한다.

실험 결과

연구 질문

  • RQ1잔차 기반 다중모달 조합 방법이 TIRG와 같은 기존 방법보다 패션 이미지 검색에서 우월한 성능을 낼 수 있는가?
  • RQ2최고 성능을 보이는 점수 행렬을 점진적으로 통합하는 반복적 앙상블 전략은 모델 조합에 얼마나 효과적인가?
  • RQ3사전학습 없이도 다양한 모델을 최적의 가중치로 조합함으로써 성능 향상은 어느 정도 달성될 수 있는가?
  • RQ4하이브리드 텍스트 인코더(LSTM + GRU)와 더 높은 차원의 특징 공간 사용이 검색 정확도 향상에 기여하는가?

주요 결과

  • RTIC를 사용한 최고의 단일 모델은 검증 세트에서 평균 리콜 38.22를 기록했으며, 기준 모델인 RTIC(33.24)에 비해 뚜렷한 향상이 있었다.
  • 텍스트 전용, IR 매칭, TIRG, RTIC의 네 가지 서로 다른 모델을 조합한 앙상블은 검증 세트에서 45.05를 기록했으며, 모델 다양성으로 인한 강력한 성능 향상이 확인되었다.
  • 반복적 앙상블 과정을 통해 검증 점수는 45.05에서 47.55로 향상되었으며, 이는 최고의 점수 행렬을 점진적으로 통합함으로써 달성된 결과였다.
  • 검증 쌍의 80%를 학습에 포함하고 추가 모델의 결과를 통합함으로써 최종 테스트 점수는 48.02에 도달했으며, 이는 최고의 단일 모델 대비 25.6%의 성능 향상이었다.
  • 앙상블 과정에서 가중치 선택에 베이지안 최적화를 사용한 것이 테스트 성능을 최대화하는 데 핵심적인 역할을 했다.
  • 하이퍼파rameter 튜닝을 尽管 하였지만, SoftTriple, Multi-Similarity, Circle loss와 같은 대안적 손실 함수 사용 시 성능 향상이 관찰되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.