Skip to main content
QUICK REVIEW

[논문 리뷰] Classification by Attention: Scene Graph Classification with Prior Knowledge

Sahand Sharifzadeh, Sina Moayed Baharlou|arXiv (Cornell University)|2020. 11. 19.
Advanced Graph Neural Networks인용 수 4
한 줄 요약

이 논문은 주목적 기반 분류층을 통해 시각적 인식과 일반 지식 사전 지식을 통합하는 다중 작업 학습 프레임워크를 제안한다. 이는 개체 간 관계에 대한 반복적 추론을 가능하게 한다. 분류를 주목적 메커니즘으로 간주함으로써 모델은 시각적 표현에 사전 지식을 통합하는 방식으로 학습하며, 자기지도 사전학습과 결합할 경우 레이블이 부여된 데이터의 1%만으로도 시나리오 그래프 분류 정확도가 26% 향상되고, 동사 예측 성능이 36% 향상된다.

ABSTRACT

A major challenge in scene graph classification is that the appearance of objects and relations can be significantly different from one image to another. Previous works have addressed this by relational reasoning over all objects in an image or incorporating prior knowledge into classification. Unlike previous works, we do not consider separate models for perception and prior knowledge. Instead, we take a multi-task learning approach, where we implement the classification as an attention layer. This allows for the prior knowledge to emerge and propagate within the perception model. By enforcing the model also to represent the prior, we achieve a strong inductive bias. We show that our model can accurately generate commonsense knowledge and that the iterative injection of this knowledge to scene representations leads to significantly higher classification performance. Additionally, our model can be fine-tuned on external knowledge given as triples. When combined with self-supervised learning and with 1% of annotated images only, this gives more than 3% improvement in object classification, 26% in scene graph classification, and 36% in predicate prediction accuracy.

연구 동기 및 목표

  • 이미지 내 개체 및 관계의 외관에 대한 시각적 변동성 문제를 다루기 위해, 이는 시나리오 그래프 분류를 어렵게 한다.
  • 기존 모델에서 인식과 사전 지식를 별개의 독립적 구성요소로 간주하는 데서 비롯하는 한계를 극복하기 위해.
  • 공유된 엔드 투 엔드 학습을 통해 시각적 특징과 관계 기반 일반 지식 간 상호 지식 전이를 가능하게 하기 위해.
  • 주목적을 통한 사전 지식 통합이 일반화 능력을 향상시키며, 특히 데이터가 적은 환경에서 효과적임을 입증하기 위해.
  • 외부 지식 삼중항에 대해 미세조정할 수 있으며, 최소한의 감독 하에서도 높은 성능을 유지할 수 있음을 보여주기 위해.

제안 방법

  • 분류를 완전히 연결된 층이 아닌 주목적 레이어로 재구성하여, 사전 지식이 인식 모델 내부로 전파될 수 있도록 한다.
  • 다중 작업 학습을 통해 시각적 표현 학습과 사전 지식 통합을 동시에 학습하며, 두 작업 간에 파라미터를 공유한다.
  • 지식 그래프(임bedding를 통해)에서 온 사전 지식을 반복적 통합을 통해 이미지 기반 표현에 통합한다.
  • 자기지도 사전학습(BYOL 등)을 통해 모델을 초기화한 후, 레이블이 제한된 Visual Genome에서 미세조정한다.
  • 시나리오를 공유된 임베딩으로 표현하여 이미지 기반 지식과 관계 기반 지식을 모두 인코딩함으로써, 볼 수 있는 삼중항을 초월한 일반화를 가능하게 한다.
  • 시각적 입력 없이도 시나리오 표현에 대한 링크 예측을 수행하여, 모델이 관계 기반 일반 지식을 얼마나 잘 이해하고 있는지 평가한다.

실험 결과

연구 질문

  • RQ1주목적 기반 분류가 별도의 모델링 없이도 사전 지식을 시각적 표현에 통합할 수 있는가?
  • RQ2사전 지식을 반복적으로 통합함으로써, 데이터가 적은 설정에서 시나리오 그래프 분류 성능이 향상되는가?
  • RQ3시각적 신호가 약할 경우에도 모델이 일반 지식 기반 관계 지식(예: '과일은 박스 안에 있다')을 학습하고 일반화할 수 있는가?
  • RQ4외부 지식 삼중항에 대해 미세조정했을 때 모델의 성능은 얼마나 효과적인가, 특히 최소한의 감독 하에서도?
  • RQ5모델의 내부 표현이 의미적이고 관계 기반의 의미 있는 구조를 얼마나 잘 반영하고 있는가?

주요 결과

  • 레이블이 부여된 이미지의 1%만으로도 기존 기준 모델 대비 시나리오 그래프 분류 정확도가 26% 향상되었다.
  • 동일한 낮은 데이터 환경에서 동사 예측 정확도가 36% 향상되어, 예상치 못한 관계로의 일반화 능력이 뛰어나다는 것을 입증했다.
  • 사전 학습된 시나리오와 외부 지식 삼중항을 사용할 경우, 시각적 입력 없이도 동사 예측 성능이 거의 최고 수준에 도달했다.
  • t-SNE 시각화 결과, 사전 지식 통합 후 개체 표현이 더 분리되어 있음을 확인하여 의미적 군집화가 향상됨을 나타냈다.
  • 시각적 입력 없이도 시나리오 표현에 대한 링크 예측이 의미 있는 정확도를 달성하여, 모델이 관계 기반 일반 지식을 내재화했다는 것을 보여주었다.
  • 모든 평가 지표에서 기준 모델을 능가했으며, 특히 데이터가 적은 환경에서 뛰어난 성능을 보였고, 다양한 랜덤 시드에 걸쳐 통계적 안정성도 확보했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.