Skip to main content
QUICK REVIEW

[논문 리뷰] VrR-VG: Refocusing Visually-Relevant Relationships

Yuanzhi Liang, Yalong Bai|arXiv (Cornell University)|2019. 02. 01.
Multimodal Machine Learning Applications참고 문헌 42인용 수 11
한 줄 요약

이 논문은 시각적 판별망 네트워크(VD-Net)를 사용해 Visual Genome에서 시각적으로 관련성이 없는 관계를 필터링함으로써 더 균형 잡히고 다양한, 인지적으로 유용한 데이터셋인 VrR-VG라는 새로운 시나리오 그래프 데이터셋을 제안한다. 물체, 특성, 시각적으로 관련성이 있는 관계로부터 함께 표현을 학습함으로써, 이미지 캡션 생성 및 시각적 질의 응답(VQA)에서 뚜렷한 성능 향상을 달성하였으며, 고급 시각 인지 작업을 향상시키기 위해 고품질의 시각적 관계가 필수적임을 입증한다.

ABSTRACT

Relationships encode the interactions among individual instances, and play a critical role in deep visual scene understanding. Suffering from the high predictability with non-visual information, existing methods tend to fit the statistical bias rather than ``learning'' to ``infer'' the relationships from images. To encourage further development in visual relationships, we propose a novel method to automatically mine more valuable relationships by pruning visually-irrelevant ones. We construct a new scene-graph dataset named Visually-Relevant Relationships Dataset (VrR-VG) based on Visual Genome. Compared with existing datasets, the performance gap between learnable and statistical method is more significant in VrR-VG, and frequency-based analysis does not work anymore. Moreover, we propose to learn a relationship-aware representation by jointly considering instances, attributes and relationships. By applying the representation-aware feature learned on VrR-VG, the performances of image captioning and visual question answering are systematically improved with a large margin, which demonstrates the gain of our dataset and the features embedding schema. VrR-VG is available via http://vrr-vg.com/.

연구 동기 및 목표

  • 기존의 시각적 관계 데이터셋이 통계적 편향이 강하고 시각적으로 관련성이 없는 관계로 지배되어 있어 고수준의 시각 인지 작업을 저해한다는 한계를 해결하기 위해.
  • 시각적 판별망 네트워크(VD-Net)를 사용해 Visual Genome에서 시각적으로 관련성이 없는 관계를 자동으로 제거함으로써 새로운 데이터셋 VrR-VG를 구축하기 위해.
  • 시각적으로 관련성이 있는 관계에서 학습하는 것이 이미지 캡션 생성 및 시각적 질의 응답과 같은 인지 작업을 위한 향상된 표현을 이끌어낸다는 것을 입증하기 위해.
  • 빈도 기반 기준 모델이 VrR-VG에서 성능을 내지 못함으로써 통계적 편향이 감소하고 더 높은 시각적 관련성이 있음을 입증하기 위해.
  • 물체, 특성, 관계를 통합하여 통합된 관계 인식 특징 표현을 만드는 공동 학습 프레임워크를 개발하기 위해.

제안 방법

  • 시각적 관련성 있는 관계와 없는 관계를 구분할 수 있도록 이미지 특징과 바운딩 박스 위치를 입력으로 사용하는 시각적 판별망 네트워크(VD-Net)를 학습한다.
  • VD-Net을 원본 Visual Genome 데이터셋에 적용하여 공간 레이아웃이나 언어 사전 지식만으로 예측 가능한 관계를 제거한다.
  • 필터링된 데이터셋은 VG150에 비해 더 균형 잡히고 다양한 관계 레이블 분포를 가진 시각적으로 관련된 관계 데이터셋(VrR-VG)으로 명명된다.
  • 물체 정체성, 공간적 위치, 특성, 관계를 동시에 통합된 특징 공간에 인코딩하는 공동 표현 학습 프레임워크를 제안한다.
  • VrR-VG에서 학습된 특징을 사용하여 이미지 캡션 생성 및 VQA 작업에서 평가하며, VG150, R-VG, 물체 전용 기준 모델과의 추론 분석을 통해 성능을 비교한다.
  • 성능 평가에 Cross-Entropy 및 CIDEr 최적화를 사용하며, MSCOCO 2014 및 VQA 2.0 벤치마크에서 성능을 측정한다.

실험 결과

연구 질문

  • RQ1학습된 시각적 판별망이 대규모 시나리오 그래프 데이터셋에서 시각적으로 관련성이 없는 관계를 효과적으로 식별하고 제거할 수 있는가?
  • RQ2시각적으로 관련성이 있는 관계만 포함된 데이터셋을 구성하면 이미지 캡션 생성 및 VQA와 같은 시각 인지 작업에서 성능 향상이 이루어지는가?
  • RQ3물체, 특성, 관계의 공동 학습이 물체 전용 또는 특성 전용 특징보다 더 정보가 풍부한 시각적 표현을 생성할 수 있는가?
  • RQ4빈도 기반 통계 기준 모델이 신규 VrR-VG 데이터셋에서 얼마나 성능을 내지 못하는가? 이는 통계적 편향 감소와 더 높은 시각적 관련성을 의미하는가?
  • RQ5VrR-VG에서 유도된 관계 인식 특징은 VG150 및 R-VG와 비교해 캡션 생성에서 의미적 풍부함과 다양성 측면에서 어떻게 다른가?

주요 결과

  • VrR-VG는 VG150에서 31.9%를 차지했던 'on', 'of', 'in'과 같은 비시각적 관계의 지배를 크게 감소시켜 더 균형 잡히고 다양한 레이블 분포를 확보하였다.
  • 빈도 기반 기준 모델이 더 이상 VrR-VG에서 성능을 내지 못함으로써, 데이터셋이 통계적 편향에 덜 민감하고 더 높은 수준의 시각 이해에 의존하고 있음을 시사한다.
  • VrR-VG에서 학습된 특징을 사용해 미세조정한 이미지 캡션 모델은 CIDEr 점수 120.7을 기록하여, CIDEr 최적화 기준에서 VG150(118.2) 및 R-VG(118.8)를 모두 초월하였다.
  • VQA 작업에서 VrR-VG의 관계 인식 특징은 성능 향상을 이끌어내었으며, 이는 시각적으로 관련성이 있는 관계가 추론 능력을 향상시킨다는 것을 입증한다.
  • VrR-VG에서 학습된 모델은 'hanging'이나 'covered'와 같은 더 의미적으로 풍부하고 다양한 술어를 생성하는 반면, 'on'이나 'with'와 같은 단순한 술어에 그치는 경향이 있었다.
  • BottomUp-VG보다 이미지 수와 애너테이션 수가 적지만, VrR-VG에서 유도된 특징은 이미지 캡션 작업에서 유사하거나 더 뛰어난 성능을 기록하였으며, 이는 단순한 양보다 고품질의 관계가 더 가치가 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.