[논문 리뷰] Improving Weakly Supervised Visual Grounding by Contrastive Knowledge Distillation
이 논문은 추론 시 객체 검출기가 필요로 하지 않도록 훈련 중에 사전 훈련된 객체 검출기를 활용하여 영역-구문 매칭을 안내하는 대비 지식 정착 프레임워크를 제안한다. 검출기 예측에서 유도된 소프트 매칭 점수를 통한 영역-구문 점수 함수의 정착과 대비 학습을 통한 이미지-문장 점수 함수의 공동 최적화를 통해, Flickr30K Entities (+50.96% 정확도)와 ReferItGame (+27.59% 정확도)에서 최신 기술 수준을 달성한다. 이는 추론 시 객체 검출기가 필요로 하는 방법들을 능가한다.
Weakly supervised phrase grounding aims at learning region-phrase correspondences using only image-sentence pairs. A major challenge thus lies in the missing links between image regions and sentence phrases during training. To address this challenge, we leverage a generic object detector at training time, and propose a contrastive learning framework that accounts for both region-phrase and image-sentence matching. Our core innovation is the learning of a region-phrase score function, based on which an image-sentence score function is further constructed. Importantly, our region-phrase score function is learned by distilling from soft matching scores between the detected object names and candidate phrases within an image-sentence pair, while the image-sentence score function is supervised by ground-truth image-sentence pairs. The design of such score functions removes the need of object detection at test time, thereby significantly reducing the inference cost. Without bells and whistles, our approach achieves state-of-the-art results on visual phrase grounding, surpassing previous methods that require expensive object detectors at test time.
연구 동기 및 목표
- 정확한 바운딩 박스 애너테이션 없이 약한 감독 시각적 기초화에서 영역-구문 대응을 학습하는 문제에 대응하기 위해.
- 추론 비용을 줄이기 위해 테스트 시 객체 검출기가 필요로 하지 않도록 하면서도 높은 국소화 정확도를 유지하기 위해.
- 객체 검출기의 외부 지식을 활용하여 공존하는 시각적 개념(예: '개' 대비 '개의 머리')의 해석을 향상시키기 위해.
- 대비 학습과 지식 정착을 결합한 원칙적이고 효율적이며 효과적인 방법을 개발하기 위해.
제안 방법
- 이 방법은 이미지-문장 쌍 내의 검출된 객체 이름과 후보 구문 간의 소프트 매칭 점수를 정착하여 영역-구문 점수 함수를 학습한다.
- 이미지-문장 매칭에 대한 감독을 받는 노이즈 대비 추정(NCE) 손실을 사용하는 대비 학습 프레임워크를 도입하여 유사도 기반으로 영역-구문 쌍을 정렬한다.
- 이미지-문장 점수 함수는 정답 이미지-문장 쌍에 의해 감독되며, 이는 영역-구문 매칭과 이미지-문장 매칭을 함께 최적화할 수 있도록 한다.
- 최종 모델은 추론 시 객체 검출기가 필요로 하지 않는 학습된 점수 함수를 사용한다.
- 이 방법은 이중 단계 학습 과정을 활용한다: 먼저 객체 검출기 출력에서 정착(예: Open Images 클래스), 그 다음 대비 이미지-문장 손실과 함께 공동 최적화.
- 백본(예: ResNet-101)과 검출기(예: IRV2-OI)를 사용하여 엔드 투 엔드로 훈련되며, 추론 시 점수 함수를 사용하여 각 구문에 대해 가장 높은 점수를 가진 영역을 예측한다.
실험 결과
연구 질문
- RQ1추론 시 검출기가 필요로 하지 않도록 객체 검출기 예측에서 유도된 지식 정착이 약한 감독 시각적 기초화에서 영역-구문 매칭을 향상시킬 수 있는가?
- RQ2객체 검출기 출력에서 유도된 정착과 함께 이미지-문장 쌍에서의 대비 학습이 국소화 정확도를 향상시키는 방식은 무엇인가?
- RQ3정착과 대비 학습이 약한 감독 기초화에서 성능 향상에 기여하는 상대적 기여도는 무엇인가?
- RQ4정착과 대비 학습을 통해 훈련된 통합된 점수 함수는 추론 시 검출기가 필요한 방법들을 능가할 수 있는가?
- RQ5객체 검출기 지식을 약한 감독 시각적 기초화 모델에 통합하기 위한 최선의 실천 방법은 무엇인가?
주요 결과
- 전체 모델(NCE+Distill)은 Flickr30K Entities에서 50.96%의 정확도를 달성하여 이전 최신 기술 수준의 방법들을 크게 앞서 간다.
- ReferItGame에서는 27.59%의 정확도를 달성하여 이전의 방법들, 특히 테스트 시 강력한 검출기를 사용하는 방법들보다 뚜렷이 뛰어나다.
- NCE 손실은 Flickr30K에서 +6.2% 향상되고 ReferItGame에서는 +3.7% 향상되어 대비 학습의 효과를 입증한다.
- ResNet-101과 IRV2-OI 검출기를 사용할 때 지식 정착은 Flickr30K에서 +2.61%, ReferItGame에서는 +0.96% 향상되어 백본에 관계없이 일관된 성능 향상을 보였다.
- 제거 분석 결과 NCE와 정착은 상호 보완적인 신호를 제공함을 확인: 정착은 공존하는 개념(예: '사람' 대비 '얼굴')의 해석을 돕고, NCE는 세부적인 특성(예: '줄무늬 셔츠')을 포착한다.
- 이 방법은 다양한 백본과 검출기 간에서 일반화되며, 시각적 백본과 검출기 간의 지식 일치 수준이 다를 경우에도 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.