Skip to main content
QUICK REVIEW

[논문 리뷰] Kaleido-BERT: Vision-Language Pre-training on Fashion Domain

Mingchen Zhuge, Dehong Gao|arXiv (Cornell University)|2021. 03. 30.
Multimodal Machine Learning Applications참고 문헌 81인용 수 13
한 줄 요약

Kaleido-BERT는 패션 도메인을 위한 시각-언어 사전학습 모델로, 정렬 유도 마스킹과 다중 척도 패치 수준의 자기지도 학습 작업을 사용하는 새로운 칼라이도 전략을 도입한다. 이 모델은 이미지 검색(R@1)에서 7.13%p 향상 및 카테고리 인식에서 3.28%p 향상된 등 네 가지 후행 작업에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

We present a new vision-language (VL) pre-training model dubbed Kaleido-BERT, which introduces a novel kaleido strategy for fashion cross-modality representations from transformers. In contrast to random masking strategy of recent VL models, we design alignment guided masking to jointly focus more on image-text semantic relations. To this end, we carry out five novel tasks, i.e., rotation, jigsaw, camouflage, grey-to-color, and blank-to-color for self-supervised VL pre-training at patches of different scale. Kaleido-BERT is conceptually simple and easy to extend to the existing BERT framework, it attains new state-of-the-art results by large margins on four downstream tasks, including text retrieval (R@1: 4.03% absolute improvement), image retrieval (R@1: 7.13% abs imv.), category recognition (ACC: 3.28% abs imv.), and fashion captioning (Bleu4: 1.2 abs imv.). We validate the efficiency of Kaleido-BERT on a wide range of e-commerical websites, demonstrating its broader potential in real-world applications.

연구 동기 및 목표

  • 일반 도메인 사전학습을 넘어서 패션 전용 시각-언어 작업에서의 다중 모odal 표현 학습을 향상시키기 위해.
  • 기존 시각-언어 모델에서 무작위 마스킹의 한계를 해결하기 위해 의미 관계 학습을 향상시키는 정렬 유도 마스킹을 도입하기 위해.
  • 색상, 질감, 스타일과 같은 패션 도메인 특성에 맞는 자기지도 학습 작업을 설계하기 위해.
  • 후행 패션 응용 프로그램에서 효율적인 미세조정이 가능한 BERT 아키텍처에 원활하게 통합되는 단순하면서도 효과적인 프레임워크를 개발하기 위해.
  • 전자상거래 플랫폼에서의 실제 효과성을 검증하여 생산 환경에서의 확장성과 강건성을 입증하기 위해.

제안 방법

  • 패션 이미지에서 다중 척도, 패치 불변 표현을 생성하는 칼라이도 패치 생성기(KPG)를 도입하여 세분화된 특징 학습을 향상시킨다.
  • 이미지 패치와 텍스트 토큰 간의 다중 모달 어텐션을 학습하기 위해 어텐션 기반 정렬 생성기(AAG)를 활용한다.
  • 학습된 의미 정렬 기반으로 이미지 및 텍스트 특징를 선택적으로 마스킹하는 정렬 유도 마스킹(AGM)을 제안하여 공동 표현 학습을 향상시킨다.
  • 다양한 패치 척도에서 적용되는 회전, 재배열, 가림, Grayscale에서 색상으로, 공백에서 색상으로의 다섯 가지 새로운 자기지도 학습 작업을 설계하여 강력한 시각적 및 언어적 표현을 학습한다.
  • 통합된 1스트림 트랜스포머 아키텍처를 사용하여 엔드 투 엔드 학습이 가능하고 후행 작업에 대한 효율적 적응을 가능하게 한다.
  • 적응형 손실 함수와 패치 수준의 감독을 적용하여 특징 학습을 향상시키면서도 표준 BERT 스타일의 미세조정과의 호환성을 유지한다.
Figure 1: Different utilization of alignment information in VL pre-training architectures. T = Task . W = Word . V = Visual Token . L = Object Detection Label . E = Embedding . Trm = Transformer Block .
Figure 1: Different utilization of alignment information in VL pre-training architectures. T = Task . W = Word . V = Visual Token . L = Object Detection Label . E = Embedding . Trm = Transformer Block .

실험 결과

연구 질문

  • RQ1무작위 마스킹과 비교해 정렬 유도 마스킹이 패션 시각-언어 작업에서 다중 모달 표현 학습을 향상시키는가?
  • RQ2다중 척도, 패치 수준의 자기지도 학습 작업이 패션 전용 시각-언어 이해를 위한 특징 학습을 향상시키는가?
  • RQ3기존의 시각-언어 모델과 비교해 Kaleido-BERT는 패션 전용 후행 작업에서 성능 면에서 어떻게 다른가?
  • RQ4칼라이도 패치 생성 전략이 고정 척도 또는 무작위 패치 생성과 비교해 특징 표현을 얼마나 향상시키는가?
  • RQ5제안된 프레임워크는 높은 성능을 유지하면서도 실제 전자상거래 시스템에 효율적으로 구현 가능한가?

주요 결과

  • Kaleido-BERT는 Fashion-Gen 벤치마크에서 이전 SOTA 모델 대비 이미지 검색 성능(R@1)에서 7.13%p 절대 향상되었다.
  • 텍스트 검색 성능도 R@1 기준 4.03%p 절대 향상되어 우수한 다중 모달 매칭 능력을 입증했다.
  • 카테고리 인식 정확도는 3.28%p 절대 향상되어 패션 속성의 의미 이해 능력 향상을 시사한다.
  • 패션 캡션 생성 성능은 BLEU-4 기준 1.2 포인트 향상되어 입력 이미지와의 일치도 및 생성 품질 향상을 보였다.
  • 제거 실험 결과 정렬 유도 마스킹는 무작위 마스킹 대비 Sum R 지표에서 +6.7% 향상된 것으로 확인되어 효과성을 입증했다.
  • 새로운 다섯 가지 사전학습 작업(회전, 재배열, 가림, Grayscale에서 색상으로, 공백에서 색상으로)의 통합은 모든 후행 작업에서 일관된 성능 향상을 이끌어냈다.
Figure 2: Illustration of KPG. See \secref sec:KPG for details.
Figure 2: Illustration of KPG. See \secref sec:KPG for details.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.