Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-modal Active Complementary Learning with Self-refining Correspondence

Qin Yang, Sun Yuan|arXiv (Cornell University)|2023. 10. 26.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 새로운 활성 보완 손실(ACL)과 자기 보완 보정(SCC)을 통해 노이즈 있는 대응 관계(NC)에 대한 강건성을 향상시키는 일반화된 프레임워크인 Cross-modal Robust Complementary Learning(CRCL)을 제안한다. ACL은 활성 학습과 보완 학습을 결합하여 오류가 발생할 수 있는 지도 학습을 줄이고, SCC는 모멘텀 기반 자기 보완 보정을 통해 대응 보정을 안정화하고 향상시킨다. 이는 합성 및 실제 노이즈가 있는 환경에서 Flickr30K, MS-COCO, CC152K에서 최고 성능을 기록한다.

ABSTRACT

Recently, image-text matching has attracted more and more attention from academia and industry, which is fundamental to understanding the latent correspondence across visual and textual modalities. However, most existing methods implicitly assume the training pairs are well-aligned while ignoring the ubiquitous annotation noise, a.k.a noisy correspondence (NC), thereby inevitably leading to a performance drop. Although some methods attempt to address such noise, they still face two challenging problems: excessive memorizing/overfitting and unreliable correction for NC, especially under high noise. To address the two problems, we propose a generalized Cross-modal Robust Complementary Learning framework (CRCL), which benefits from a novel Active Complementary Loss (ACL) and an efficient Self-refining Correspondence Correction (SCC) to improve the robustness of existing methods. Specifically, ACL exploits active and complementary learning losses to reduce the risk of providing erroneous supervision, leading to theoretically and experimentally demonstrated robustness against NC. SCC utilizes multiple self-refining processes with momentum correction to enlarge the receptive field for correcting correspondences, thereby alleviating error accumulation and achieving accurate and stable corrections. We carry out extensive experiments on three image-text benchmarks, i.e., Flickr30K, MS-COCO, and CC152K, to verify the superior robustness of our CRCL against synthetic and real-world noisy correspondences.

연구 동기 및 목표

  • 실제 데이터에서 이미지-텍스트 쌍이 잘못 대응되는 경우가 많기 때문에, 이미지-텍스트 매칭에서 노이즈 있는 대응 관계(NC)의 심각한 과제를 해결한다.
  • 높은 노이즈 수준에서 노이즈 쌍에 과적합되거나 보정이 불안정해지는 기존 방법의 한계를 극복한다.
  • 이미지-텍스트 매칭 모델의 아키텍처를 변경하지 않고도 강건성을 향상시킬 수 있는 일반화된 프레임워크를 개발한다.
  • 활성 학습과 보완 학습을 균형 있게 조율하여 잘못된 지도 학습의 위험을 줄이면서도 모델 성능을 유지한다.
  • 반복적이고 모멘텀 보정이 적용된 자기 보완 보정 과정을 통해 대응 보정의 정확성과 안정성을 향상시킨다.

제안 방법

  • 신뢰할 수 있는 양성 쌍에 초점을 맞춘 활성 학습과 관련 없는 쌍을 간접 지도로 활용하는 보완 학습을 통합한 활성 보완 손실(ACL)을 제안한다. 이는 오해의 신호를 줄인다.
  • 보완 학습 구성 요소에서 지수 정규화를 적용하여 손실 업데이트를 안정화하고 노이즈 지도 학습에 대한 강건성을 향상시킨다.
  • 다중 자기 보완 보정 프로세스를 모멘텀 보정과 함께 적용하여 이전 예측을 통합하는 자기 보완 보정(SCC) 메커니즘을 설계한다.
  • 에포크 수에 따라 대응 예측을 안정화하고 개선하기 위해 모멘텀 보정(MC)을 사용하여 오류 누적을 줄인다.
  • ACL과 SCC를 기존 이미지-텍스트 매칭 모델에 플러그인 모듈로 통합하여 노이즈 있는 데이터에서도 강건한 학습이 가능하도록 한다.
  • 소프트 마진 보정과 활성 샘플 선택을 조합하여 딥 네트워크의 기억 효과를 통제적으로 활용한다.

실험 결과

연구 질문

  • RQ1노이즈 있는 대응 관계에서 이미지-텍스트 매칭의 잘못된 지도 학습 위험을 줄일 수 있는 손실 함수를 어떻게 설계할 수 있는가?
  • RQ2활성 학습과 보완 학습을 함께 최적화할 경우, 노이즈 있는 이미지-텍스트 쌍에 대한 강건성을 얼마나 향상시킬 수 있는가?
  • RQ3모멘텀 보정이 적용된 반복적 자기 보완 보정은 노이즈 있는 환경에서 대응 보정의 정확성과 안정성을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 CRCL 프레임워크는 합성 및 실제 노이즈 있는 대응 관계가 높은 수준일 경우 기존 방법과 비교해 어떻게 성능을 내는가?
  • RQ5이 프레임워크는 아키텍처 수정 없이 다양한 기존 이미지-텍스트 매칭 아키텍처와 일반화되어 작동할 수 있는가?

주요 결과

  • 제안된 CRCL 프레임워크는 합성 및 실제 노이즈 있는 대응 관계 설정에서 Flickr30K, MS-COCO, CC152K에서 최고 성능을 기록한다.
  • ACL은 활성 학습과 보완 학습을 균형 있게 조율하여 노이즈 쌍에 대한 과적합을 크게 줄여 안정적인 학습 동역학을 이끈다.
  • 모멘텀 보정이 적용된 SCC는 오류 누적을 줄이고 특히 높은 노이즈 수준에서 대응 보정 정확도를 향상시킨다.
  • 광범위한 추상화 분석을 통해 ACL과 SCC가 상호 보완적으로 기여함을 확인하였으며, ACL은 신뢰할 수 있는 지도 학습을 제공하고 SCC는 정확한 보정을 보장한다.
  • 이 프레임워크는 강력한 일반화 능력을 보이며, 아키텍처 변경을 최소화하고도 기존 이미지-텍스트 매칭 모델의 성능을 향상시킨다.
  • MS-COCO에서 50%의 노이즈가 존재할 경우, CRCL은 이전 방법들보다 큰 격차로 승리하여 극한의 노이즈 조건에서도 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.