[논문 리뷰] Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
이 논문은 다중 해상도 불확실성 모델링과 정규화를 통해 텍스트 피드백이 있는 복합 이미지 검색을 위한 통합 학습 프레임워크를 제안한다. 특징 공간의 변동성을 시뮬레이션하여 굵은 해상도의 쿼리를 표현하고 손실 가중치를 적응적으로 조정함으로써, FashionIQ, Fashion200k, Shoes에서 각각 +4.03%, +3.38%, +2.40%의 Recall 향상을 이룩하며, 강력한 베이스라인을 능가하면서도 기존 모델과의 호환성을 유지한다.
We investigate composed image retrieval with text feedback. Users gradually look for the target of interest by moving from coarse to fine-grained feedback. However, existing methods merely focus on the latter, i.e., fine-grained search, by harnessing positive and negative pairs during training. This pair-based paradigm only considers the one-to-one distance between a pair of specific points, which is not aligned with the one-to-many coarse-grained retrieval process and compromises the recall rate. In an attempt to fill this gap, we introduce a unified learning approach to simultaneously modeling the coarse- and fine-grained retrieval by considering the multi-grained uncertainty. The key idea underpinning the proposed method is to integrate fine- and coarse-grained retrieval as matching data points with small and large fluctuations, respectively. Specifically, our method contains two modules: uncertainty modeling and uncertainty regularization. (1) The uncertainty modeling simulates the multi-grained queries by introducing identically distributed fluctuations in the feature space. (2) Based on the uncertainty modeling, we further introduce uncertainty regularization to adapt the matching objective according to the fluctuation range. Compared with existing methods, the proposed strategy explicitly prevents the model from pushing away potential candidates in the early stage, and thus improves the recall rate. On the three public datasets, i.e., FashionIQ, Fashion200k, and Shoes, the proposed method has achieved +4.03%, +3.38%, and +2.40% Recall@50 accuracy over a strong baseline, respectively.
연구 동기 및 목표
- 텍스트 피드백 상황에서 일대일 정밀한 메트릭 학습과 실제 세계의 일대다 굵은 해상도 검색 간의 불일치 문제를 해결하기 위해.
- 모호하거나 정확하지 않은 사용자 쿼리가 반영된 특징 공간 내 불확실성을 모델링하여 Recall률을 향상시키기 위해.
- 불확실성 기반 정규화를 사용해 굵은 해상도 및 정밀한 해상도 매칭을 하나의 최적화 목표로 통합하기 위해.
- 초기 학습 단계에서 잠재적인 양성 예측 항목을 밀어내는 것을 방지하는 학습 전략을 개발하기 위해.
- 최신 교차 어텐션 백본과 기존 검색 방법과의 호환성을 확보하기 위해.
제안 방법
- 특징 공간에 동일한 분포의 변동성을 주입하여 다중 해상도 쿼리를 시뮬레이션함으로써, 굵은 해상도와 정밀한 해상도 검색 범위를 모두 표현하는 불확실성 모델링을 도입한다.
- 불확실성 정규화를 적용하여 변동 범위에 따라 손실 가중치를 동적으로 조정함으로써, 모호한 쿼리에 대한 처벌을 감소시킨다.
- 굵은 해상도와 정밀한 해상도 학습 간의 트레이드오프를 제어하기 위해 학습 가능한 파라미터 γ₀를 사용하며, γ₀ = 1이 안정적인 초기 설정임을 입증하였다.
- 불확실성 정규화 항목을 손실 함수에 유연한 제약 조건으로 적용하여, 일대일 쌍에 대한 과적합을 방지하고 잠재적인 양성 예측 항목을 유지한다.
- 불확실한 범위를 유효한 매칭 영역로 간주함으로써, 일대일 및 일대다 매칭을 모두 지원하는 매칭 목표로 개선한다.
- 기존의 Clip4Cir 및 BLIP와의 통합이 원활하며, 이를 상위에 쌓을 경우 성능 향상을 이룬다.
실험 결과
연구 질문
- RQ1텍스트 피드백 상황에서 일관된 학습 프레임워크가 굵은 해상도 및 정밀한 해상도 이미지 검색을 효과적으로 모델링할 수 있는가?
- RQ2일대다 쿼리에 적용되었을 때, 쌍 기반 메트릭 학습이 Recall에 어떤 영향을 미치는가?
- RQ3특징 공간 내 불확실성 모델링이 정밀한 해상도 정확도를 떨어뜨리지 않고 Recall을 향상시킬 수 있는가?
- RQ4적응형 불확실성 정규화가 학습 수렴 및 일반화에 어떤 영향을 미치는가?
- RQ5제안된 방법이 최신 교차 어텐션 백본과 얼마나 잘 통합될 수 있는가?
주요 결과
- 제안된 방법은 강력한 베이스라인 대비 FashionIQ에서 +4.03% Recall@50, Fashion200k에서 +3.38%, Shoes에서 +2.40%의 Recall 향상을 달성하였다.
- 고유한 굵은 해상도 검색 전용 평가에서, 모호한 쿼리에 대해 Recall@10은 1.46% 향상되고, Recall@50는 3.34% 향상되었다.
- 제안된 방법의 학습 손실은 0이 아닌 상수로 수렴하며, 이는 일대일 쌍에 대한 과적합을 피하고 있음을 나타내며, 베이스라인은 이와 달리 0으로 수렴한다.
- Clip4Cir와 결합했을 때, FashionIQ에서 Recall@50가 56.74%에서 59.23%로 향상되었다.
- BLIP 백본과 통합했을 때, Shoes 데이터셋에서 Recall@50가 70.21%에서 75.29%로 향상되었다.
- 소스 이미지 특징 증강은 일대다 매칭과 갈등을 일으켜 성능을 저하시키지만, 타겟 특징 증강은 더 효과적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.