Skip to main content
QUICK REVIEW

[논문 리뷰] SPAN: Learning Similarity between Scene Graphs and Images with Transformers

Yuren Cong, Wentong Liao|arXiv (Cornell University)|2023. 04. 02.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 시나리오 그래프와 이미지 간의 의미적 유사도를 측정하기 위해 그래프 및 이미지 트랜스포머를 사용하는 대비 학습 프레임워크인 GICON을 제안한다. 구조적 인코딩을 통해 시나리오 그래프를 순차화함으로써, 모델은 강력한 그래프 인식 이미지 검색을 가능하게 하고, 시나리오 그래프 생성을 위한 노이즈에 강건한 평가 지표인 R-Precision를 도입한다. 이는 Visual Genome 및 Open Images 데이터셋에서 트리플릿 기반 지표보다 뛰어난 성능을 보인다.

ABSTRACT

Learning similarity between scene graphs and images aims to estimate a similarity score given a scene graph and an image. There is currently no research dedicated to this task, although it is critical for scene graph generation and downstream applications. Scene graph generation is conventionally evaluated by Recall$@K$ and mean Recall$@K$, which measure the ratio of predicted triplets that appear in the human-labeled triplet set. However, such triplet-oriented metrics fail to demonstrate the overall semantic difference between a scene graph and an image and are sensitive to annotation bias and noise. Using generated scene graphs in the downstream applications is therefore limited. To address this issue, for the first time, we propose a Scene graPh-imAge coNtrastive learning framework, SPAN, that can measure the similarity between scene graphs and images. Our novel framework consists of a graph Transformer and an image Transformer to align scene graphs and their corresponding images in the shared latent space. We introduce a novel graph serialization technique that transforms a scene graph into a sequence with structural encodings. Based on our framework, we propose R-Precision measuring image retrieval accuracy as a new evaluation metric for scene graph generation. We establish new benchmarks on the Visual Genome and Open Images datasets. Extensive experiments are conducted to verify the effectiveness of SPAN, which shows great potential as a scene graph encoder.

연구 동기 및 목표

  • Recall@K와 같은 트리플릿 중심 지표가 시나리오 그래프와 이미지 간의 전반적인 의미적 정렬을 포착하지 못하는 한계를 해결하기 위해.
  • 트랜스포머를 사용하여 시나리오 그래프와 이미지를 공통 잠재 공간에 정렬하는 통합된 대비 학습 프레임워크를 개발하기 위해.
  • 생성된 시나리오 그래프를 쿼리로 사용하여 이미지 검색 정확도에 기반한 새로운 평가 지표인 R-Precision를 도입하기 위해.
  • 제안된 유사도 기반 평가를 사용하여 Visual Genome 및 Open Images에서 새로운 벤치마크를 설정하기 위해.
  • 구조 정보를 유지하는 그래프 순차화 기법이 그래프 트랜스포머 인코더를 위한 효과적인 그래프 표현 학습을 가능하게 하는지 확인하기 위해.

제안 방법

  • 구조적 인코딩을 사용하여 시나리오 그래프를 순서화하는 기법이 도입되어, 그래프 트랜스포머가 그래프 구조 데이터를 처리할 수 있도록 한다.
  • 이미지 및 그래프 트랜스포머를 별도로 학습시켜 공통 잠재 공간 내에서 시나리오 그래프와 해당 이미지를 정렬하는 대비 학습을 수행한다.
  • 대비 손실을 사용하여 양성 이미지-시나리오 그래프 쌍 간의 유사도를 최대화하고, 부정 쌍 간의 유사도를 최소화한다.
  • R-Precision는 후보 집합에서 가장 유사한 상위-K개의 이미지를 검색하고, 정확히 검색된 참값 이미지의 비율을 측정하여 계산된다.
  • 위치 무관 및 위치 기반 시나리오 그래프 모두를 지원하며, 경계 상자 정보가 그래프 표현에 통합된다.
  • 아블레이션 연구를 통해 트랜스포머의 깊이 및 아키텍처가 성능에 미치는 영향을 평가하였으며, 6층이 최적의 성능을 보였다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 대비 학습 프레임워크가 시나리오 그래프와 이미지 간의 의미적 유사도를 효과적으로 측정할 수 있는가?
  • RQ2제안된 그래프 순차화 기법이 효과적인 그래프 표현 학습을 가능하게 할 정도로 구조적 정보를 충분히 유지하는가?
  • RQ3특히 데이터 편향이나 노이즈가 존재할 경우, R-Precision는 Recall@K에 비해 시나리오 그래프 생성 품질 평가에서 어떻게 성능을 발휘하는가?
  • RQ4생성된 시나리오 그래프를 쿼리로 사용할 때, 제안된 프레임워크가 이미지 검색 성능을 향상시킬 수 있는가?
  • RQ5성능과 과적합의 균형을 고려할 때, 그래프 및 이미지 트랜스포머의 최적의 깊이는 얼마인가?

주요 결과

  • 제안된 GICON 프레임워크는 Open Images V6 데이터셋에서 K=100일 때 위치 기반 시나리오 그래프를 사용해 R-Precision 78.9%를 달성한다.
  • Visual Genome 데이터셋에서는 위치 기반 그래프와 K=100을 사용하여 R-Precision 76.1%를 기록하며, 뛰어난 검색 성능를 입증한다.
  • 최적의 모델 구성은 그래프 및 이미지 트랜스포머 모두 6층을 사용하며, 더 깊은 네트워크(8층)는 과적합으로 인해 성능 저하를 초래한다.
  • Open Images에서 정확한 이미지를 상위 결과로 검색한 비율은 78.9%로, 시나리오 그래프 쿼리를 사용할 때 CLIP보다 뛰어난 성능을 보였다.
  • 정성적 결과에서는 트리플릿 수준의 지표가 레이블 편향으로 인해 실패할 때조차도 모델이 의미적으로 유사한 이미지를 올바르게 식별하는 것으로 나타났다.
  • Visual Genome 및 Open Images 양쪽에서 참값 시나리오 그래프와 이미지 간 평균 유사도는 0.56로, 잠재 공간 내에서 일관된 정렬이 이루어졌음을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.