Skip to main content
QUICK REVIEW

[논문 리뷰] Visual Relationship Detection using Scene Graphs: A Survey

Aniket Agarwal, Ayush Mangal|arXiv (Cornell University)|2020. 05. 16.
Multimodal Machine Learning Applications참고 문헌 97인용 수 13
한 줄 요약

이 종합 검토에서는 시각적 관계 검출을 위해 장면 그래프를 사용하는 효율적인 방법인 Factorizable-Net을 제안한다. 관계 예측 작업을 의미적으로 유사한 객체 쌍의 부분 그래프로 분해함으로써 계산 비용을 줄인다. 공간 가중 메시지 전파와 희소 그래프 생성 전략을 통해 계산 비용을 감소시키며, Visual Genome에서 최신 기술 성능을 달성하고 장꼬리 관계에 대한 일반화 능력을 향상시킨다.

ABSTRACT

Understanding a scene by decoding the visual relationships depicted in an image has been a long studied problem. While the recent advances in deep learning and the usage of deep neural networks have achieved near human accuracy on many tasks, there still exists a pretty big gap between human and machine level performance when it comes to various visual relationship detection tasks. Developing on earlier tasks like object recognition, segmentation and captioning which focused on a relatively coarser image understanding, newer tasks have been introduced recently to deal with a finer level of image understanding. A Scene Graph is one such technique to better represent a scene and the various relationships present in it. With its wide number of applications in various tasks like Visual Question Answering, Semantic Image Retrieval, Image Generation, among many others, it has proved to be a useful tool for deeper and better visual relationship understanding. In this paper, we present a detailed survey on the various techniques for scene graph generation, their efficacy to represent visual relationships and how it has been used to solve various downstream tasks. We also attempt to analyze the various future directions in which the field might advance in the future. Being one of the first papers to give a detailed survey on this topic, we also hope to give a succinct introduction to scene graphs, and guide practitioners while developing approaches for their applications.

연구 동기 및 목표

  • 객체 수가 증가할수록 전체 연결 장면 그래프의 계산 비효율성을 해결한다.
  • 모든 쌍방향 관계를 처리하는 대신 의미적으로 유사한 객체 쌍을 부분 그래프로 묶어 재중복 관계 제안을 줄인다.
  • 객체-관계 공존 관련 사전 지식을 통합하여 장꼬리 관계 분포에서 모델의 일반화 능력을 향상시킨다.
  • 그래프 구축 과정에서 비미분 가능 요소를 다루기 위한 하이브리드 학습 전략을 개발한다.
  • 요소 그래프 간 메시지 전파를 통해 부분 그래프와 객체 간의 특징 정련을 향상시킨다.

제안 방법

  • 공유 기반 CNN을 사용하는 RPN을 통해 객체 영역 제안을 생성하고, 검출된 객체들 간에 전체 연결 그래프를 형성한다.
  • 유니온 박스 신뢰도와 비최대 억제를 기반으로 객체 쌍을 부분 그래프로 그룹화하여 재중복성을 줄인다.
  • 2차원 특징 맵을 부분 그래프용으로, 1차원 벡터를 객체용으로 추출하기 위해 ROI 풀링을 적용하여 공간적 및 의미적 특징 융합을 가능하게 한다.
  • 요소화된 그래프를 따라 주의 기반 메시지 전파를 통해 객체 및 부분 그래프 특징을 개선하기 위해 공간 가중 메시지 전파(SMP) 모듈을 사용한다.
  • 통합된 맥락, 경계 상자 및 RoIAlign 특징을 사용하여 술어를 예측하기 위해 공간 감지 관계 추론 모듈(SRI)을 도입한다.
  • 하이브리드 학습 전략을 사용한다: 트리 구축 과정에서 비미분 가능한 점수 행렬 S에 대해서는 정책 강화학습을, 나머지 모든 파라미터에 대해서는 지도 학습을 적용한다.

실험 결과

연구 질문

  • RQ1관계 예측 정확도를 유지하면서 장면 그래프 구축을 어떻게 더 효율적으로 만들 수 있는가?
  • RQ2부분 그래프 분해를 통해 시각적 관계 검출에서 재중복 관계 제안 수를 얼마나 줄일 수 있는가?
  • RQ3객체-관계 동시 발생에 대한 사전 지식을 통합하면 장꼬리 관계 클래스에서 성능 향상에 기여하는가?
  • RQ4기본 GCN과 비교해 볼 때, 요소화된 그래프를 따라 메시지 전파가 특징 표현을 어떻게 향상시키는가?
  • RQ5비미분 가능 요소를 포함한 장면 그래프 모델 학습에서 강화학습과 지도 학습을 조합할 경우 어떤 영향을 미치는가?

주요 결과

  • Factorizable-Net은 의미적으로 유사한 객체 쌍을 부분 그래프로 묶어 관계 제안 수를 줄여 계산 비용을 크게 감소시킨다.
  • Visual Genome 데이터셋에서 최신 기술 성능을 달성하며, 시각적 관계 검출의 평균 정밀도에서 이전 방법들을 능가한다.
  • 비미분 가능한 점수 행렬 S의 그래프 구축 과정에도 불구하고 하이브리드 학습 전략이 효과적인 학습을 가능하게 한다.
  • SMP 및 SRI 모듈은 공간적 및 맥락적 신호를 효과적으로 활용하여 특징 정련과 술어 분류 성능을 향상시킨다.
  • 객체 클래스와 관계 간 통계적 상관관계를 명시적으로 모델링함으로써 장꼬리 관계에서 개선된 일반화 능력을 보였다.
  • 간단한 베이스라인(주어진 객체 쌍에 대해 빈도가 가장 높은 관계를 예측하는 것)조차도 이전 최고 성능(SOTA) 대비 3.6% 상대적 향상을 기록하여 데이터셋 내 강한 편향이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.