Skip to main content
QUICK REVIEW

[논문 리뷰] BOSS: Bottom-up Cross-modal Semantic Composition with Hybrid Counterfactual Training for Robust Content-based Image Retrieval

Wenqiao Zhang, Jiannan Guo|arXiv (Cornell University)|2022. 07. 09.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 강력한 콘텐츠 기반 이미지 검색을 위한 하이브리드 반사적 훈련을 갖춘 하향식 교차모달 의미 조합 프레임워크인 BOSS를 제안한다. 텍스트 쿼리에 조건화된 지역적 및 전역적 시각적 특징을 동시에 모델링하고 쿼리-타겟 대응을 정교화하기 위한 이중 감독 전략을 사용함으로써, FashionIQ, Fashion200k 및 Shoes 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

Content-Based Image Retrieval (CIR) aims to search for a target image by concurrently comprehending the composition of an example image and a complementary text, which potentially impacts a wide variety of real-world applications, such as internet search and fashion retrieval. In this scenario, the input image serves as an intuitive context and background for the search, while the corresponding language expressly requests new traits on how specific characteristics of the query image should be modified in order to get the intended target image. This task is challenging since it necessitates learning and understanding the composite image-text representation by incorporating cross-granular semantic updates. In this paper, we tackle this task by a novel \underline{ extbf{B}}ottom-up cr\underline{ extbf{O}}ss-modal \underline{ extbf{S}}emantic compo\underline{ extbf{S}}ition ( extbf{BOSS}) with Hybrid Counterfactual Training framework, which sheds new light on the CIR task by studying it from two previously overlooked perspectives: \emph{implicitly bottom-up composition of visiolinguistic representation} and \emph{explicitly fine-grained correspondence of query-target construction}. On the one hand, we leverage the implicit interaction and composition of cross-modal embeddings from the bottom local characteristics to the top global semantics, preserving and transforming the visual representation conditioned on language semantics in several continuous steps for effective target image search. On the other hand, we devise a hybrid counterfactual training strategy that can reduce the model's ambiguity for similar queries.

연구 동기 및 목표

  • 기존 콘텐츠 기반 이미지 검색(CIR) 방법이 교차 해상도의 시각적 및 언어적 상호작용을 효과적으로 모델링하지 못하는 한계를 해결하기 위해.
  • 조합된 쿼리와 타겟 이미지 간의 대응을 명시적으로 모델링하여 세분화된 쿼리 이해를 향상시키기 위해.
  • 유사한 쿼리에 대한 모호함을 줄이기 위해 새로운 하이브리드 반사적 훈련 전략을 도입하기 위해.
  • 하향식이고 맥락 인식적인 방식으로 지역적 및 전역적 시각적 특징을 통합함으로써 표현 학습을 향상시키기 위해.
  • 향상된 시각어휘 조합과 감독을 통해 여러 CIR 벤치마크에서 최신 기준 성능을 달성하기 위해.

제안 방법

  • 텍스트 입력에 조건화된 지역적 시각적 특징과 전역적 의미를 점진적으로 융합하는 하향식 교차모달 의미 조합 모듈을 제안한다.
  • 맥락을 유지하는 것과 음성 샘플에서 콘텐츠 독립성을 확보하는 것을 동시에 제공하는 이중 감독 전략을 갖춘 하이브리드 반사적 훈련(HCT) 전략을 도입한다.
  • 지역적 및 전역적 특징 조합을 동시에 최적화하는 다수준 표현 학습 체계를 구현하여 richer한 시각어휘 표현을 얻는다.
  • 정렬 및 재구성 손실을 추가로 사용한 트리플릿 손실을 적용하여 의미 공간을 정교화하고 임bedding 품질을 향상시킨다.
  • 조합된 쿼리 표현을 생성하고 이를 공통 임베딩 공간에서 타겟 이미지 특징과 정렬하기 위해 이중 분기 아키텍처를 설계한다.
  • 유사한 쿼리와 그 정답 타겟을 구별할 수 있는 능력을 강화하기 위해 음성 샘플을 포함한 대비 학습을 적용한다.

실험 결과

연구 질문

  • RQ1지역적 및 전역적 시각적 특징의 하향식 조합은 콘텐츠 기반 이미지 검색에서 교차모달 이해를 어떻게 향상시키는가?
  • RQ2하이브리드 반사적 훈련은 유사한 쿼리 상황에서 모호함을 어느 정도 감소시키는가?
  • RQ3조합-타겟 대응에 대한 명시적 감독은 표준 대비 학습 대비 검색 정확도 향상에 기여하는가?
  • RQ4지역적 및 전역적 특징 표현은 검색 성능에 독립적으로 및 함께 어떻게 기여하는가?
  • RQ5제안된 프레임워크에서 각 손실 구성 요소의 상대 기여도는 어떠한가?

주요 결과

  • BOSS는 FashionIQ, Fashion200k 및 Shoes 세 가지 기준 데이터셋에서 최신 기준 성능을 달성하였으며, FashionIQ에서 RC@10은 31.61%이고 RC@50는 56.06%이다.
  • 하이브리드 반사적 훈련(HCT) 구성 요소는 이를 제거한 분석 대비 RC@10에서 1.42%p, RC@50에서 4.40%p의 절대적 성능 향상을 기록하였다.
  • 지역적 또는 전역적 특징 조합을 제거할 경우 성능 저하가 심각하게 발생하여, 다수준 표현 학습의 중요성을 확인하였다.
  • 재구성 손실($\mathcal{L}_{res}$)과 정렬 손실($\mathcal{L}_{ali}$) 각각이 성능 향상에 기여하며, 전체 손실 조합이 가장 우수한 성능을 내었다.
  • 정성적 분석 결과, HCT는 표준 DML 모델이 모호한 경우에 실패하는 상황에서도 RC@10 수준에서 정확한 타겟 이미지를 검색하도록 도와주었다.
  • t-SNE 시각화 결과, HCT 최적화된 의미 공간에서 조합된 쿼리 표현과 타겟 표현이 특히 유사한 쿼리에 대해 더 가까이 위치해 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.