Skip to main content
QUICK REVIEW

[논문 리뷰] Graph-Structured Referring Expression Reasoning in The Wild

Sibei Yang, Guanbin Li|arXiv (Cornell University)|2020. 04. 19.
Multimodal Machine Learning Applications참고 문헌 28인용 수 7
한 줄 요약

이 논문은 언어적 및 시각적 그래프에서 언어 모듈을 문장 구조로 이끌어내어 구조적 추론을 수행하는 시나리오 그래프 유도 모듈러 네트워크(SGMN)를 제안한다. 이는 기준 데이터셋에서 최신 기술 성능을 달성하며, 의미적으로 풍부하고 균형 잡힌 표현과 그래프 주의 메커니즘을 통한 추론 추적 가능성을 갖춘 대규모 실생활 데이터셋인 Ref-Reasoning을 도입한다.

ABSTRACT

Grounding referring expressions aims to locate in an image an object referred to by a natural language expression. The linguistic structure of a referring expression provides a layout of reasoning over the visual contents, and it is often crucial to align and jointly understand the image and the referring expression. In this paper, we propose a scene graph guided modular network (SGMN), which performs reasoning over a semantic graph and a scene graph with neural modules under the guidance of the linguistic structure of the expression. In particular, we model the image as a structured semantic graph, and parse the expression into a language scene graph. The language scene graph not only decodes the linguistic structure of the expression, but also has a consistent representation with the image semantic graph. In addition to exploring structured solutions to grounding referring expressions, we also propose Ref-Reasoning, a large-scale real-world dataset for structured referring expression reasoning. We automatically generate referring expressions over the scene graphs of images using diverse expression templates and functional programs. This dataset is equipped with real-world visual contents as well as semantically rich expressions with different reasoning layouts. Experimental results show that our SGMN not only significantly outperforms existing state-of-the-art algorithms on the new Ref-Reasoning dataset, but also surpasses state-of-the-art structured methods on commonly used benchmark datasets. It can also provide interpretable visual evidences of reasoning. Data and code are available at https://github.com/sibeiyang/sgmn

연구 동기 및 목표

  • 기존 방법이 언어적 구조를 간과하거나 문법을 모델링하기 위해 오직 자기 주의(self-attention)만을 사용하는 한계를 해결하기 위해, 언어적 표현의 문법적 구조를 명시적으로 활용하여 구조적 추론을 수행한다.
  • 기존 벤치마크에서의 데이터셋 편향을 극복하기 위해 균형 잡히고 의미적으로 풍부한 표현과 진짜 중간 추론 단계를 갖춘 대규모 실생활 데이터셋을 구축한다.
  • 언어적 시각 그래프의 각 단계에서 객체들에 대한 주의 맵을 생성함으로써 해석 가능한 시각적 추론을 가능하게 한다. 이는 추론 과정의 추적 가능한 증거를 제공한다.
  • 언어적 구조에 의해 유도되는 모듈러 신경망을 통해 관계와 속성을 모델링하여 복잡한 장문의 언어 표현에서 성능을 향상시킨다.

제안 방법

  • 이 방법은 객체 검출기와 관계 분류기를 사용하여 이미지를 객체를 나타내는 노드와 관계를 나타내는 간선을 갖는 의미적 그래프로 모델링한다.
  • 외부 파서를 사용하여 언어적 표현을 언어적 시각 그래프로 분석하며, 명사구는 노드로, 국적/동사구는 간선으로 표현하여 이미지 그래프와 일관성을 확보한다.
  • 모듈러 신경망은 언어적 시각 그래프를 따라 단계적으로 추론을 수행하기 위해 AttendNode, AttendRelation, Transfer, Merge, Norm 등의 연산을 적용한다.
  • 추론 과정은 언어적 시각 그래프의 각 노드에서 관련된 이미지 객체를 강조하는 그래프 주의 메커니즘을 통해 유도되며, 이는 해석 가능한 중간 예측을 가능하게 한다.
  • Ref-Reasoning 데이터셋은 템플릿과 기능 프로그램을 사용하여 이미지 시각 그래프에서 다양하게 표현을 자동 생성함으로써 구성되며, 모든 추론 단계에 진짜 레이블이 포함되어 있다.
  • 균일한 샘플링과 분포 제어를 통해 추론 단계 간의 표현 난이도를 균형 잡아 데이터셋 편향을 감소시킨다.

실험 결과

연구 질문

  • RQ1언어적 구조에 의해 유도되는 모듈러 신경망이 전반적 매칭 방법보다 언어적 표현의 정착에 더 뛰어난 성능을 보일 수 있는가?
  • RQ2균형 잡히고 의미적으로 풍부한 표현과 중간 단계 레이블이 있는 대규모 실생활 데이터셋이 모델의 일반화 능력을 향상시키고 데이터셋 편향을 줄일 수 있는가?
  • RQ3주의 맵을 활용한 그래프 기반 추론이 언어적 표현 정착 과정에서 중간 추론 단계의 해석 가능한 시각적 증거를 제공할 수 있는가?
  • RQ4신경 모듈의 설계(예: Transfer, Norm, Merge)가 복잡한 표현에서 추론 성능에 어떤 영향을 미치는가?

주요 결과

  • SGMN은 RefCOCO에서 평균 정확도 86.67%, RefCOCO+에서 85.36%, RefCOCOg에서 78.66%를 기록하여 기존의 구조적 방법보다 각각 0.92%, 2.54%, 2.96% 높은 성능을 달성한다.
  • RefCOCOg 데이터셋은 평균 길이가 8.43인 더 긴 복잡한 표현을 포함하고 있으나, SGMN는 최고의 전반적 방법과 비교해도 성능이 유사하여 강력한 추론 능력을 입증한다.
  • 절단 실험 결과, Transfer 모듈을 제거할 경우 성능이 크게 떨어지며(검증 세트에서 40.66%), 이는 다중 노드 간 관계 추론에서의 중요성을 확인한다.
  • Sum-merge를 사용한 SGMN가 가장 우수한 성능(검증 세트에서 51.04%)을 기록하여 max-merge(44.50%)와 min-merge(45.25%)를 모두 앞서며, 다중 관계 정보 처리에 sum-merge가 더 효과적임을 시사한다.
  • 정성적 결과에서는 SGMN가 언어적 시각 그래프를 따라 추론 단계를 추적할 수 있는 해석 가능한 주의 맵을 생성함을 확인할 수 있으며, 예를 들어 여자와 분홍색·검은색 머리카락을 가진 사람이 개를 산책시키는 것을 식별하는 등이다.
  • 실생활 장면으로의 일반화 능력이 뛰어나, 다양한 실생활 시각적·언어적 내용을 포함한 대규모 데이터셋인 Ref-Reasoning에서 뛰어난 성능을 보이며 이를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.