Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge-augmented Few-shot Visual Relation Detection

Tianyu Yu, Yangning Li|arXiv (Cornell University)|2023. 03. 09.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 사전 훈련된 언어 모델을 활용한 텍스트 지식과 자동으로 구축된 시각적 관계 지식 그래프를 통합하여 희귀 관계에 대한 일반화 능력을 크게 향상시키는 지식 보강형 소수 샘플 시각적 관계 탐지 프레임워크를 제안한다. 이 방법은 세 가지 Visual Genome 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 동적이고 지식 보강된 관계 표현을 통해 기존 모델들보다 큰 격차로 앞서며, 희귀 관계에 대한 일반화 능력 향상에 기여한다.

ABSTRACT

Visual Relation Detection (VRD) aims to detect relationships between objects for image understanding. Most existing VRD methods rely on thousands of training samples of each relationship to achieve satisfactory performance. Some recent papers tackle this problem by few-shot learning with elaborately designed pipelines and pre-trained word vectors. However, the performance of existing few-shot VRD models is severely hampered by the poor generalization capability, as they struggle to handle the vast semantic diversity of visual relationships. Nonetheless, humans have the ability to learn new relationships with just few examples based on their knowledge. Inspired by this, we devise a knowledge-augmented, few-shot VRD framework leveraging both textual knowledge and visual relation knowledge to improve the generalization ability of few-shot VRD. The textual knowledge and visual relation knowledge are acquired from a pre-trained language model and an automatically constructed visual relation knowledge graph, respectively. We extensively validate the effectiveness of our framework. Experiments conducted on three benchmarks from the commonly used Visual Genome dataset show that our performance surpasses existing state-of-the-art models with a large improvement.

연구 동기 및 목표

  • 관계의 장꼬리 분포와 의미적 다양성으로 인해 소수 샘플 시각적 관계 탐지(VRD) 모델의 일반화 능력이 떨어지는 문제를 해결하기 위해.
  • 사전 훈련된 언어 모델에서 유래한 텍스트 지식과 자체 구축한 지식 그래프에서 유래한 시각적 관계 지식을 통합하여 소수 샘플 VRD 성능을 향상시키기 위해.
  • 대규모 애너테이션 데이터에 대한 의존도를 줄이기 위해 외부 지식을 활용하여 소수의 예시에서 일반화할 수 있도록 하기 위해.
  • 텍스트 지식과 시각적 관계 지식을 융합한 방식이 소수 샘플 VRD에 효과적이고 광범위하게 적용 가능함을 입증하기 위해.

제안 방법

  • 사전 훈련된 언어 모델과 프롬프트 템플릿을 사용하여 주어진 주어-서술어-목적어 삼중항에 대한 지식 보강된 표현을 동적으로 생성하여 의미적 다양성을 반영한다.
  • 오픈 도메인 이미지 캡션에서 규칙 기반 파서를 활용해 공통적인 시각적 관계를 추출하고 표현하여 시각적 관계 지식 그래프를 구축한다.
  • 유사한 관계 삼중항이 임베딩 공간에서 가까워지도록 하는 메트릭 학습 프레임워크를 통해 텍스트 지식과 시각적 관계 지식을 통합한다.
  • 메시지 전파 메커니즘을 사용하여 시각적 관계 지식 그래프 내의 노드들 간에 지식을 전파함으로써 관계 표현을 풍부하게 한다.
  • 대조 손실을 최적화하여 지원 예제와 쿼리 샘플 간의 유사도를 향상시키기 위해 모델을 피지컬 튜닝함으로써 소수 샘플 일반화 능력을 강화한다.
  • 기존의 VRD 모델들인 MotifNet과 IMP에 지식 보강 프레임워크를 적용하여 이식 가능성과 성능 향상을 입증한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 언어 모델에서 유래한 텍스트 지식과 지식 그래프에서 유래한 시각적 관계 지식을 융합하면 소수 샘플 VRD의 일반화 능력이 향상되는가?
  • RQ2외부 지식 통합이 VRD에서 자원이 부족한 희귀 관계에 대한 성능에 어떤 영향을 미치는가?
  • RQ3지식 그래프의 다양한 분해능 수준(예: 0-홉 vs. 1-홉 vs. 전체 그래프)이 모델 성능에 어떤 영향을 미치는가?
  • RQ4제안된 지식 보강 프레임워크는 기존 최신 기술 수준의 VRD 모델을 효과적으로 향상시킬 수 있는가?

주요 결과

  • 제안된 프레임워크는 Visual Genome 데이터셋의 세 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 기존 SOTA 모델들을 압도적으로 앞선다.
  • 1-홉 시각적 관계 지식을 통합할 경우 성능이 크게 향상되며(62.3 psR, 37.7 puR), 그러나 전체 그래프를 포함시킬 경우 노이즈로 인해 성능이 저하됨을 확인하여 최적의 성능은 1-홉에서 도달함을 입증한다.
  • 지식 그래프 내에서 가장 빈도가 높은 50개의 관계만을 사용할 경우 전체 관계를 사용한 경우보다 성능이 떨어지며, 이는 다양성이 일반화 능력을 향상시킨다는 것을 시사한다.
  • 시각적 관계 지식 그래프의 도입으로 기존 모델의 성능 향상이 이루어지며, MotifNet은 +4.0 psR 및 +5.7 puR 향상, IMP는 +8.2 psR 및 +6.0 puR 향상됨을 확인함.
  • 정성적 결과 분석에서, 훈련 데이터에 존재하지 않는 조합인 '고양이-먹이를 먹는다' 또는 '기린-나무 위에 누워있다'와 같은 관계도 정확히 예측함을 확인함.
  • 제거 실험 결과에서 텍스트 지식과 시각적 관계 지식 모두 필수적임을 입증하였으며, 두 가지 지식의 융합이 가장 높은 성능을 달성함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.