Skip to main content
QUICK REVIEW

[논문 리뷰] One-shot Scene Graph Generation

Yuyu Guo, Jingkuan Song|arXiv (Cornell University)|2022. 02. 22.
Multimodal Machine Learning Applications참고 문헌 42인용 수 5
한 줄 요약

이 논문은 한 개의 레이블링된 예시에서 시각적 관계를 예측할 수 있도록 요구하는 새로운 과제인 원샷 시나리오 그래프 생성을 소개한다. 모델이 사전 지식을 활용하기 위해 인스턴스 관계 트랜스포머와 다중 구조적 지식(관계적 지식 및 일반 지식)을 제안하며, 구성된 원샷 데이터셋에서 최신 기술 수준의 성능을 달성하여 기존 방법들보다 최소한의 감독으로 크게 승리한다.

ABSTRACT

As a structured representation of the image content, the visual scene graph (visual relationship) acts as a bridge between computer vision and natural language processing. Existing models on the scene graph generation task notoriously require tens or hundreds of labeled samples. By contrast, human beings can learn visual relationships from a few or even one example. Inspired by this, we design a task named One-Shot Scene Graph Generation, where each relationship triplet (e.g., "dog-has-head") comes from only one labeled example. The key insight is that rather than learning from scratch, one can utilize rich prior knowledge. In this paper, we propose Multiple Structured Knowledge (Relational Knowledge and Commonsense Knowledge) for the one-shot scene graph generation task. Specifically, the Relational Knowledge represents the prior knowledge of relationships between entities extracted from the visual content, e.g., the visual relationships "standing in", "sitting in", and "lying in" may exist between "dog" and "yard", while the Commonsense Knowledge encodes "sense-making" knowledge like "dog can guard yard". By organizing these two kinds of knowledge in a graph structure, Graph Convolution Networks (GCNs) are used to extract knowledge-embedded semantic features of the entities. Besides, instead of extracting isolated visual features from each entity generated by Faster R-CNN, we utilize an Instance Relation Transformer encoder to fully explore their context information. Based on a constructed one-shot dataset, the experimental results show that our method significantly outperforms existing state-of-the-art methods by a large margin. Ablation studies also verify the effectiveness of the Instance Relation Transformer encoder and the Multiple Structured Knowledge.

연구 동기 및 목표

  • 기존의 시나리오 그래프 생성 모델이 대규모 레이블링 데이터를 필요로 하는 한계를 해결하기 위해.
  • 모델이 인간의 소수 샘플 학습과 유사하게 단일 레이블링된 예시에서 시각적 관계를 학습할 수 있도록 하기 위해.
  • 특히 관계적 지식과 일반 지식을 포함한 사전 지식을 시나리오 그래프 생성 과정에 통합하기 위해.
  • 객체 간의 상황적 관계를 더 잘 포착하기 위해 새로운 아키텍처인 인스턴스 관계 트랜스포머를 설계하기 위해.
  • 소수 샘플 시나리오 그래프 생성을 평가하기 위해 데이터셋을 구축하고, 이를 기반으로 성능을 평가하기 위해.

제안 방법

  • 이 방법은 다중 구조적 지식을 도입한다: 시각적 그라운드에서 유래한 관계적 지식은 객체 쌍 간의 가능성이 높은 시각적 관계(예: '서 있는', '앉아 있는')를 포착한다.
  • 개념넷에서 유래한 일반 지식은 일반 세계 사실(예: '개는 마당을 경비할 수 있다')을 인코딩하여 시각적 신호를 초월한 추론을 지원한다.
  • 이 두 가지 지식 유형은 그래프로 정렬되고, 그래프 컬러션 네트워크(GCNs)를 통해 처리되어 지식이 통합된 엔티티 특징을 생성한다.
  • 인스턴스 관계 트랜스포머 인코더는 모든 객체 쌍 간의 관계에 주목함으로써 상호 객체 간의 맥락을 모델링하여 고립된 페처 R-CNN 특징을 넘어서는 특징 표현을 향상시킨다.
  • 모델는 새로 구축한 원샷 시나리오 그래프 데이터셋에서 엔드 투 엔드로 훈련되며, 각 관계에 대해 단 한 개의 레이블링된 예시만 존재한다.
  • 성능 평가는 예측된 객체 카테고리가 사전 정의된 PredCls 설정에서 평가되며, 관계 예측 정확도를 측정하기 위해 Recall@K 지표를 사용한다.

실험 결과

연구 질문

  • RQ1모델은 인간의 소수 샘플 학습과 유사하게 단 한 개의 레이블링된 예시에서 시각적 관계 예측을 일반화할 수 있는가?
  • RQ2관계적 지식과 일반 지식의 통합은 소수 샘플 시나리오 그래프 생성 성능 향상에 얼마나 효과적인가?
  • RQ3주목적 기반의 관계 인코더(인스턴스 관계 트랜스포머)는 상호 객체 맥락을 포착하는 데 있어 표준 특징 추출 방식을 능가하는가?
  • RQ4사전 지식은 시각적 관계 이해를 위한 대규모 레이블링 데이터셋의 필요성을 줄일 수 있는가?
  • RQ5공간적 신호가 오해의 소지가 있거나 모호할 경우 모델의 실패 유형은 무엇인가?

주요 결과

  • 제안된 방법은 원샷 시나리오 그래프 생성 벤치마크에서 기존 최신 기술 수준의 방법들을 크게 앞서며, 강력한 소수 샘플 일반화 능력을 입증한다.
  • 절단 실험을 통해 인스턴스 관계 트랜스포머와 다중 구조적 지식이 성능 향상에 기여한다는 것이 확인된다.
  • 모델은 단 한 개의 예시만을 사용하여 공간 관계(예: '셔츠 위에', '핸드 위에')와 일반 지식 기반 관계(예: '개는 머리가 있다', '개는 코가 있다')를 성공적으로 예측한다.
  • 실패 사례는 주로 공간 모호성 때문이며, 예를 들어 겹치는 바운딩 박스나 완전한 포함 관계로 인해 잘못된 '위에' 예측이 발생하는 경우로, 공간 신호에 과도하게 의존함을 시사한다.
  • 모델는 PredCls 설정에서 강력한 성능을 유지하며, 특히 객체 카테고리가 고정된 경우 강화 학습 기반 방법들조차도 앞서며, 성능이 뛰어나다.
  • 이 방법은 표준 시나리오 그래프 생성 과제로의 일반화가 잘 되어 있으며, 표준 벤치마크에서 경쟁력 있는 성능을 달성하여 소수 샘플 학습 외적으로도 광범위한 적용 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.