Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Compositional Learning for Low-shot Scene Graph Generation

Tao He, Lianli Gao|arXiv (Cornell University)|2021. 08. 19.
Multimodal Machine Learning Applications참고 문헌 31인용 수 4
한 줄 요약

이 논문은 관계 삼중항을 필수적이고 비필수적 구성요소로 분해한 후, 의미적 또는 시각적으로 유사한 객체를 사용하여 새로운 현실적인 삼중항을 조합함으로써 저샷 및 제로샷 시나리오에서의 장면 그래프 생성 문제를 해결하기 위한 의미적 조합 학습 전략을 제안한다. 이 방법은 세 가지 SGG 벤치마크에서 성능을 크게 향상시키며, 검색 메트릭에서 현재 최고 성능 모델보다 평균적으로 약 50% 향상된다.

ABSTRACT

Scene graphs provide valuable information to many downstream tasks. Many scene graph generation (SGG) models solely use the limited annotated relation triples for training, leading to their underperformance on low-shot (few and zero) scenarios, especially on the rare predicates. To address this problem, we propose a novel semantic compositional learning strategy that makes it possible to construct additional, realistic relation triples with objects from different images. Specifically, our strategy decomposes a relation triple by identifying and removing the unessential component and composes a new relation triple by fusing with a semantically or visually similar object from a visual components dictionary, whilst ensuring the realisticity of the newly composed triple. Notably, our strategy is generic and can be combined with existing SGG models to significantly improve their performance. We performed a comprehensive evaluation on the benchmark dataset Visual Genome. For three recent SGG models, adding our strategy improves their performance by close to 50\%, and all of them substantially exceed the current state-of-the-art.

연구 동기 및 목표

  • 저샷 및 제로샷 상황에서 희귀하고 알려지지 않은 동사어에 대한 데이터 부족 문제를 해결한다.
  • 기존 모델이 애초에 애너테이션된 학습 삼중항에만 의존하고 희귀 관계에서는 실패하는 한계를 극복한다.
  • 추가 애너테이션 없이도 희귀하고 알려지지 않은 관계 삼중항에 대해 효과적으로 학습할 수 있도록 한다.
  • 기존 SGG 프레임워크와 통합이 가능하고 일반적인 전략을 개발하여 성능 향상을 이룬다.
  • 의미적 및 시각적 유사성 기반으로 새로운 현실적인 관계 삼중항을 조합함으로써 제로샷 관계 탐지 성능을 향상시킨다.

제안 방법

  • 관계 삼중항 $<$s, p, o$>$를 동사어에 미치는 영향의 상대적 크기에 따라 필수적 구성요소(예: 주어와 동사어)와 비필수적 구성요소(예: 목적어)로 분해한다.
  • 다양한 목적어 카테고리의 인스턴스를 포함하는 시각적 구성요소 사전을 구축하여 조합의 후보로 삼는다.
  • 의미적 또는 시각적 유사도 측정을 통해 사전에서 유사한 객체를 선택하여 비필수적 구성요소를 대체한다.
  • 유사도 기반 선택을 통해 현실성을 확보하면서 필수적 구성요소와 선택된 객체 인스턴스를 융합하여 새로운 관계 삼중항을 생성한다.
  • 주된 SGG 모델의 특징 학습 메커니즘과 독립적으로 작동하는 데이터 증강 기법으로 조합 전략을 통합한다.
  • 동일 카테고리 내(인트라 클래스) 및 의미적으로 유사한 카테고리 간(인터 클래스) 조합을 모두 적용하여 희귀 및 알려지지 않은 관계에 대해 다양한 현실적인 학습 샘플을 생성한다.

실험 결과

연구 질문

  • RQ1모델에 종속되지 않는 전략이 현실적인 추가 학습 삼중항을 생성함으로써 저샷 및 제로샷 장면 그래프 생성 성능을 향상시킬 수 있는가?
  • RQ2의미적 및 시각적 조합 기법이 장면 그래프 생성에서 희귀 동사어에 대한 데이터 부족 문제를 얼마나 효과적으로 완화하는가?
  • RQ3기존 방법과 비교했을 때 조합 학습이 소수 샘플 및 제로샷 관계 검색 작업에서 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 유사도 기반의 대체 객체 선택 전략이 현실성을 유지하면서도 알려지지 않은 관계 상황에서 일반화 성능을 향상시키는가?
  • RQ5이러한 조합 전략은 기존 SGG 모델과 원활하게 통합되어 다양한 아키텍처에서 일관된 성능 향상을 이끌 수 있는가?

주요 결과

  • 제안된 DeC(의미적 조합 학습) 전략은 현재 최고 성능 모델 대비 세 가지 SGG 벤치마크(RR, FR, ZR)에서 평균적으로 약 50% 성능 향상을 기록한다.
  • 희귀 동사어 작업(PredCls)에서 Motifs에 적용했을 경우, mR@50/100이 35.7/38.6로 이전 최고 성능 모델인 TDE(13.2/17.1)를 크게 능가한다.
  • 제로샷 관계 검색(ZR)에서는 기존 최고 성능 모델(TDE)의 13.2/17.1에서 13.6/16.5 mR@50/100으로 향상되어 알려지지 않은 관계에 대한 강력한 일반화 능력을 입증한다.
  • 절단 실험 결과, 인트라 클래스 및 인터 클래스 조합 모두 긍정적인 기여를 하며, 소수 샘플 설정에서는 인트라 클래스 조합이 더 효과적이고, 제로샷 설정에서는 인터 클래스 조합이 더 유리하다.
  • 유사도 기반 선택을 무작위 선택으로 대체할 경우 모든 작업에서 성능이 저하되며, 제안된 유사도 측정 기법의 필요성을 입증한다.
  • 세 가지 평가 작업—관계 검색(RR), 소수 샘플 관계 검색(FR), 제로샷 관계 검색(ZR)—모두에서 최근 세 종류의 SGG 모델에서 최고 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.