[논문 리뷰] Learning Visual Relation Priors for Image-Text Matching and Image Captioning with Neural Scene Graph Generators
이 논문은 R-SCAN과 관계 기반의 상향식 이미지 자막 생성기를 도입하여 신경 씬 그래프(시각 관계) 특징을 활용해 이미지-텍스트 매칭과 이미지 자막 생성을 개선하며, VrR-VG로 훈련하고 VG150이 아닌, Flickr30K 및 MSCOCO 단모델 성능에서 최첨단 결과를 달성한다.
Grounding language to visual relations is critical to various language-and-vision applications. In this work, we tackle two fundamental language-and-vision tasks: image-text matching and image captioning, and demonstrate that neural scene graph generators can learn effective visual relation features to facilitate grounding language to visual relations and subsequently improve the two end applications. By combining relation features with the state-of-the-art models, our experiments show significant improvement on the standard Flickr30K and MSCOCO benchmarks. Our experimental results and analysis show that relation features improve downstream models' capability of capturing visual relations in end vision-and-language applications. We also demonstrate the importance of learning scene graph generators with visually relevant relations to the effectiveness of relation features.
연구 동기 및 목표
- 씬 그래프 관계 특징을 도입하여 시각-언어 모델에서 언어를 시각 관계에 grounding하는 것을 촉진한다.
- 관계 인식 특징이 강력한 기준선보다 이미지-텍스트 검색 및 자막생성을 향상시킨다는 것을 보여준다.
- 의미적으로 풍부한 관계 데이터셋(VrR-VG)에서 씬 그래프 생성기를 학습하는 것이 VG150보다 중요하다는 것을 보인다.
- 이미지-텍스트 매칭을 위한 SCAN의 관계 인식 변형(R-SCAN)과 관계 기반의 상향식 자막생성기를 개발한다.
- VrR-VG를 통해 학습된 시각적으로 관련된 관계가 다운스트림 작업에서 의미 있는 이득을 낸다는 분석을 제공합니다.
제안 방법
- 씬 그래프 생성기로부터 지역(객체/소재) 및 시각 관계 특징을 인코딩하는 SCAN의 관계 인식 확장인 R-SCAN을 제안한다.
- 단어를 지역 특징과 관계 특징 모두에 맞추기 위해 소프트 어텐션 메커니즘을 사용하고, 단어별로 이를 적응적으로 결합하는 시각 특징 융합 게이트를 도입한다.
- 강화된 융합으로 주의된 지역 표현과 관계 표현을 게이트 로드 융합하여 단어-이미지 유사도를 계산한다.
- 미니배치에서 가장 어려운 부정샘플에 대한 힌지 트리플랭크 로스를 사용해 학습한다.
- 상향식 자막생성기에 씬 그래프에서 얻은 주의된 관계 특징을 지역 특징과 함께 언어 모델로 입력하도록 확장한다.
- VrR-VG에서 Stacked Motif Network 씬 그래프 생성기를 사전 학습하여 의미상 풍부한 관계 임베딩을 얻는다( Visual Genome VG150 편향을 피함).
- 선택적으로 VG150에서 학습된 관계 특징과 비교하고 VrR-VG 학습 관계의 우수성을 입증한다.
실험 결과
연구 질문
- RQ1신 neural scene graph 학습된 관계 특징이 지역-만 기반 베이스라인과 비교해 이미지-텍스트 매칭을 개선하는가?
- RQ2관계 특징이 상향식 자막생성기에 통합될 때 이미지 자막생성에 도움이 되는가?
- RQ3VrR-VG 대 VG150에서 씬 그래프 생성기를 사전 학습하는 것이 최종 작업 성능에 어떤 영향을 미치는가?
- RQ4검색 및 자막생성 작업에서 시각적으로 관련된 관계를 학습하는 것이 시각 콘텐츠에 대한 언어 grounding에 필수적인가?
주요 결과
- VrR-VG 관계 특징을 사용한 R-SCAN이 Flickr30K 및 MSCOCO에서 SCAN 기반선 대비 교차모달 검색을 향상시킨다.
- Flickr30K 1K 테스트에서 R-SCAN VrR-VG의 recall@1은 40.1(텍스트-이미지)이고 39.6(이미지-텍스트)이며, SCAN t-i AVG의 37.9 및 38.5를 상회한다.
- MSCOCO 5K 테스트에서 R-SCAN VrR-VG의 recall@1은 57.6(텍스트-이미지)과 70.3(이미지-텍스트)이며, SCAN t-i AVG의 45.8 및 61.8을 능가한다(한 비교 설정에서); 표 3은 변형의 36.2(텍스트-이미지)와 45.4(이미지-텍스트)를 보고한다.
- VrR-VG에서 관계 특징을 사전 학습하는 것이 다운스트림 작업에서 VG150보다 더 큰 이득을 준다.
- VrR-VG 관계를 이용한 관계 기반 상향식 자막생성은 기반 상향식 자막생성기에 비해 CIDEr와 SPICE 점수를 향상시킨다(CIDEr: 114.9→126.1, 교차 엔트로피 및 CIDEr 최적화; SPICE: 20.9→21.8).
- 본 접근 방식은 그래프 컨벌루션 네트워크를 피하고 씬 그래프에서 파생된 관계 임베딩을 직접 활용하여 언어를 시각으로 grounding한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.