Skip to main content
QUICK REVIEW

[논문 리뷰] Referring Expression Grounding by Marginalizing Scene Graph Likelihood

Daqing Liu, Hanwang Zhang|arXiv (Cornell University)|2019. 06. 09.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 참조 표현 기반 작업을 위한 새로운 접근법인 Marginalized Scene Graph Likelihood (MSGL)을 제안한다. MSGL은 시나리오 그래프를 통해 객체, 속성, 관계를 모델링하고, 조건부 랜덤 필드와 합-곱 신뢰 전파를 사용하여 레이블이 지정되지 않은 맥락에서 추론한다. MSGL은 세 가지 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하면서 문장에 언급된 모든 객체에 대해 해석 가능하고 완전한 기반을 제공한다.

ABSTRACT

We focus on task of grounding referring expressions images, e.g., localizing the white truck front of a one. To resolve this task fundamentally, one should first find out contextual objects (e.g., yellow truck) and then exploit them to disambiguate referent from other similar objects, by using attributes and relationships (e.g., white, yellow, in front of). However, it is extremely challenging to train such a model as ground-truth of contextual objects and their relationships are usually missing due to prohibitive annotation cost. Therefore, nearly all existing methods attempt to evade above joint grounding and reasoning process, but resort to a holistic association between sentence and region feature. As a result, they suffer from heavy parameters of fully-connected layers, poor interpretability, and limited generalization to unseen expressions. In this paper, we tackle this challenge by training and inference with proposed Marginalized Scene Graph Likelihood (MSGL). Specifically, we use scene graph: a graphical representation parsed from referring expression, where nodes are objects with attributes and edges are relationships. Thanks to conditional random field (CRF) built on scene graph, we can ground every object to its corresponding region, and perform reasoning with unlabeled contexts by marginalizing out them using sum-product belief propagation. Overall, our proposed MSGL is effective and interpretable, e.g., on three benchmarks, MSGL consistently outperforms state-of-the-arts while offers a complete grounding of all objects a sentence.

연구 동기 및 목표

  • 높은 주석 비용으로 인해 실제 맥락 객체와 관계가 거의 제공되지 않는 이미지에서 참조 표현 기반 작업의 과제를 해결하기 위해.
  • 전체 문장-영역 연관에 의존하는 기존 방법의 한계를 극복하기 위해, 이는 높은 파라미터 수, 낮은 설명 가능성, 제한된 일반화 능력으로 이어진다.
  • 구조화된 시나리오 그래프 표현을 사용하여 참조 표현 내의 객체, 속성, 관계에 대한 동시 추론을 가능하게 하기 위해.
  • 조건부 랜덤 필드에서 합-곱 신뢰 전파를 사용하여 레이블이 지정되지 않은 맥락 객체를 최소화하는 학습 및 추론 프레임워크를 개발하기 위해.
  • 문장 내 모든 객체를 해당 이미지 영역에 기반시키는 방식으로 높은 성능과 해석 가능성을 동시에 달성하기 위해

제안 방법

  • 참조 표현에서 시나리오 그래프를 구성하여, 노드는 속성이 있는 객체를 나타내고, 간선은 객체 간의 관계를 나타낸다.
  • 객체 예측 간의 의존성과 공간적 또는 의미적 관계를 모델링하기 위해 시나리오 그래프에 조건부 랜덤 필드(CRF)를 구축한다.
  • 추론 중에 레이블이 지정되지 않은 맥락 객체를 최소화하기 위해 합-곱 신뢰 전파를 사용하여, 모든 객체에 대한 완전한 주석이 필요로 하지 않는 강력한 추론을 가능하게 한다.
  • 전체 시나리오 그래프의 최소화된 가능도를 최대화하는 미분 가능한 목적 함수를 사용하여 엔드 투 엔드 학습을 가능하게 한다.
  • 로컬 특징과 관계적 맥락을 모두 활용하여, 시나리오 그래프 내 각 객체에 대해 가장 가능성이 높은 영역을 예측함으로써 기반 작업을 수행한다.
  • 시나리오 그래프 구문 분석과 기반 작업을 통합된 프레임워크로 통합하여 동시 추론과 해석을 지원한다.

실험 결과

연구 질문

  • RQ1시나리오 그래프 기반 표현은 참조 표현 기반 작업 모델의 해석 가능성과 성능을 향상시키는가?
  • RQ2신뢰 전파를 통한 레이블이 지정되지 않은 맥락 객체의 최소화는 완전히 주석이 지정된 관계에 대한 의존도를 줄이는 데 얼마나 효과적인가?
  • RQ3속성과 관계를 명시적으로 모델링하는 것이 전체 문장-영역 매칭 방식보다 새로운 참조 표현에 대한 일반화 능력을 향상시키는가?
  • RQ4CRF 기반의 구조화된 예측 프레임워크는 모든 문장 내 객체의 완전한 기반을 유지하면서 최신 기술 수준(SOTA) 성능을 달성할 수 있는가?
  • RQ5제안된 MSGL 방법은 다양한 벤치마크에서 정확도와 내구성 측면에서 기존 방법보다 얼마나 뛰어나게 성능을 발휘하는가?

주요 결과

  • MSGL은 세 가지 표준 참조 표현 기반 작업 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 이는 이전 방법들을 지속적으로 능가한다.
  • 모델은 참조 표현에 언급된 모든 객체, 즉 참조 대상과 맥락 객체를 포함하여 완전한 기반을 제공한다.
  • 레이블이 지정되지 않은 맥락을 최소화함으로써, 완전히 주석이 지정된 관계에 대한 의존도를 줄여 내구성과 일반화 능력을 향상시킨다.
  • 시나리오 그래프와 CRF 기반 추론을 사용함으로써 모델의 해석 가능성이 향상되어 사용자가 관계와 속성이 기반 결정에 어떻게 기여하는지 추적할 수 있다.
  • 관계의 구조화된 모델링 덕분에 완전히 연결된 레이어 기반 접근법보다 더 적은 파라미터로도 높은 정확도를 달성한다.
  • 합-곱 신뢰 전파를 통해 모든 객체에 대한 진정한 관계가 필요로 하지 않는 복잡한 관계적 구조에 대한 효과적인 추론을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.