[논문 리뷰] Collaborative Group: Composed Image Retrieval via Consensus Learning from Noisy Annotations
이 논문은 삼중항의 모호성(노이지이고 불완전한 주석으로 인한)을 완화하기 위해 노이지 삼중항에서 학습하고 KL 발산 손실을 통해 공감대를 이루는 네 명의 다양한 컴포지터를 활용하는 새로운 프레임워크인 Consensus Network(Css-Net)을 제안한다. Css-Net은 기존 방법에 비해 FashionIQ에서 R@10에 +2.77% 향상되고 R@50에 +6.67% 향상되어 최신 기준 성능을 달성한다.
Composed image retrieval extends content-based image retrieval systems by enabling users to search using reference images and captions that describe their intention. Despite great progress in developing image-text compositors to extract discriminative visual-linguistic features, we identify a hitherto overlooked issue, triplet ambiguity, which impedes robust feature extraction. Triplet ambiguity refers to a type of semantic ambiguity that arises between the reference image, the relative caption, and the target image. It is mainly due to the limited representation of the annotated text, resulting in many noisy triplets where multiple visually dissimilar candidate images can be matched to an identical reference pair (i.e., a reference image + a relative caption). To address this challenge, we propose the Consensus Network (Css-Net), inspired by the psychological concept that groups outperform individuals. Css-Net comprises two core components: (1) a consensus module with four diverse compositors, each generating distinct image-text embeddings, fostering complementary feature extraction and mitigating dependence on any single, potentially biased compositor; (2) a Kullback-Leibler divergence loss that encourages learning of inter-compositor interactions to promote consensual outputs. During evaluation, the decisions of the four compositors are combined through a weighting scheme, enhancing overall agreement. On benchmark datasets, particularly FashionIQ, Css-Net demonstrates marked improvements. Notably, it achieves significant recall gains, with a 2.77% increase in R@10 and 6.67% boost in R@50, underscoring its competitiveness in addressing the fundamental limitations of existing methods.
연구 동기 및 목표
- 어노테이터가 세밀한 이미지 세부 정보를 놓칠 경우, 동일한 쿼리에 대해 여러 개의 잘못된 음성 후보가 발생하는 삼중항의 모호성을 해결하기 위해.
- 다양한 컴포지터들이 함께 학습하고 훈련 및 추론 과정에서 공감대를 이루도록 하여 노이지 삼중항으로 인한 모델 편향을 줄이기 위해.
- 모호하고 불완전한 주석의 부정적 영향을 최소화함으로써 메트릭 학습 기반 검색의 표현 학습을 향상시키기 위해.
- 기존 아키텍처를 대체하거나 대규모 수정 없이도 강력한 모델을 보완할 수 있는 견고하고 일반화 능력이 뛰어난 방법을 개발하기 위해.
제안 방법
- Css-Net은 네 명의 서로 다른 컴포지터로 구성된 공감대 모듈을 사용하며, 각 컴포지터는 서로 다른 융합 전략을 활용해 다양한 이미지-텍스트 임베딩을 생성한다.
- 각 컴포지터는 피라미드 훈련 파라다임과 보조 텍스트-이미지 컴포지터 설계를 통해 고유한 지식 습득을 보장한다.
- 각 컴포지터 간의 지식 전이를 장려하고 개별 편향을 줄이기 위해 Kullback-Leibler(KL) 발산 손실이 적용된다.
- 훈련 과정에서 컴포지터들은 상호 예측 간의 KL 발산을 최소화함으로써 서로 학습하고, 노이지 데이터에서 공감대를 이루도록 한다.
- 추론 시, 네 명의 컴포지터가 생성한 결정을 가중치를 두고 통합하여 견고성 향상과 개인적 오류 감소를 달성한다.
- 이 방법은 기존 아키텍처와 수직이며, CoSMo와 같은 강력한 베이스라인과 통합되어 성능을 추가로 향상시킬 수 있다.

실험 결과
연구 질문
- RQ1불완전한 주석으로 인해 발생하는 삼중항의 모호성이 언어 유도형 이미지 검색에서 메트릭 학습의 성능에 어떤 영향을 미치는가?
- RQ2노이지 삼중항에서 학습하는 다수의 컴포지터가 공감대 학습을 통해 편향을 줄이고 견고성을 향상시킬 수 있는가?
- RQ3공감대 기반 프레임워크가 모호하고 노이지인 이미지-텍스트 삼중항을 다룰 때 개별 모델보다 얼마나 뛰어난 성능을 보일 수 있는가?
- RQ4제안된 KL 기반 지식 전이 메커니즘이 노이지 주석으로 인한 모델 편향을 효과적으로 줄일 수 있는가?
- RQ5공감대 접근 방식은 다양한 데이터셋에 일반화되어 기존 최신 기준 방법을 초월할 수 있는가?
주요 결과
- Css-Net은 CLIP4cir에 비해 FashionIQ 벤치마크에서 R@10에 +2.77% 향상되고 R@50에 +6.67% 향상되어 삼중항의 모호성 처리에서 뚜렷한 성과를 보였다.
- Shoes 데이터셋에서 Css-Net은 최신 기준인 CLVC-Net에 비해 R@1에 +2.49%, R@10에 +2.42% 향상되어 다양한 데이터셋에서의 견고성을 확인했다.
- FashionIQ의 Dress 서브셋에서 기준 모델에 비해 R@10에 +4.68% 향상되어 강력한 기존 모델이 존재하는 상황에서도 효과적임을 입증했다.
- 네 명의 컴포지터를 모두 통합한 공동 추론이 개별 컴포지터보다 우수한 성능을 보여, 공감대 전략의 효과성을 검증했다.
- Fashion200k에서 Css-Net은 모델 앙상블을 통해 R@1에 23.4%, R@10에 52.0%를 기록하여 기준 모델의 한계에도 불구하고 많은 최신 기준 방법을 능가했다.
- 제거 실험 결과, KL 손실과 다중 컴포지터 설계가 노이지 데이터에서 편향을 줄이고 일반화 능력을 향상시키는 데 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.