Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Visual Commonsense for Robust Scene Graph Generation

Alireza Zareian, Zhecan Wang|arXiv (Cornell University)|2020. 06. 17.
Multimodal Machine Learning Applications참고 문헌 34인용 수 10
한 줄 요약

이 논문은 외부 지식 없이 시각적 공통지식—예를 들어 물체의 기능 가능성과 직관적 물리 법칙—을 시나리오 그래프 데이터로부터 자동으로 학습하는 새로운 방법, 글로벌-로컬 어텐션 트랜스포머(GLAT)를 제안한다. 인지와 공통지식을 별도의 모델로 분리하고, 신뢰도 기반으로 출력을 융합함으로써 시나리오 그래프 생성에서 비합리적인 예측을 수정함으로써, 특히 희귀 및 제로샷 시나리오에서 Visual Genome에서의 정확도를 크게 향상시킨다.

ABSTRACT

Scene graph generation models understand the scene through object and predicate recognition, but are prone to mistakes due to the challenges of perception in the wild. Perception errors often lead to nonsensical compositions in the output scene graph, which do not follow real-world rules and patterns, and can be corrected using commonsense knowledge. We propose the first method to acquire visual commonsense such as affordance and intuitive physics automatically from data, and use that to improve the robustness of scene understanding. To this end, we extend Transformer models to incorporate the structure of scene graphs, and train our Global-Local Attention Transformer on a scene graph corpus. Once trained, our model can be applied on any scene graph generation model and correct its obvious mistakes, resulting in more semantically plausible scene graphs. Through extensive experiments, we show our model learns commonsense better than any alternative, and improves the accuracy of state-of-the-art scene graph generation methods.

연구 동기 및 목표

  • 실제 시각적 과제로 인해 인지 오류가 발생하기 쉬운 기존의 시나리오 그래프 생성(SGG) 모델의 한계를 해결하기 위해.
  • SGG에서 완전하지 않거나 편향된 외부 공통지식 기반 시스템이나 단순 공시도 통계에 의존하는 것을 극복하기 위해.
  • 구조화된 시각적 공통지식을 직접 애너테이션된 시나리오 그래프 코퍼스에서 학습할 수 있는 자기지도 학습 방법을 개발하기 위해.
  • 모델의 신뢰도에 기반해 인지와 공통지식 출력을 지능적으로 융합하는 융합 기법을 설계하여 견고성을 향상시키기 위해.
  • 공통지식 학습 시 데이터셋 편향을 피함으로써, 희귀 및 제로샷 시나리오로의 일반화를 보장하기 위해.

제안 방법

  • 마스크된 엔티티나 술어를 문맥을 이용해 예측하는 방식으로, 시나리오 그래프의 마스크된 인코딩을 기반으로 한 자기지도 사전학습 프레임워크를 제안한다.
  • 구조적 의존성을 명시적으로 모델링하기 위해 트랜스포머 아키텍처에 국소 어텐션 헤드를 추가함으로써, 그래프 인식 기반 표현 학습을 향상시킨다.
  • 큰 규모의 애너테이션된 시나리오 그래프 코퍼스에서 GLAT를 훈련시켜 물체의 기능 가능성과 직관적 물리 법칙 등의 시각적 공통지식 패턴을 학습한다.
  • SGG 파이프라인을 두 모델—인지 모델(e.g., IMP, SNM, KERN)과 공통지식 모델(GLAT)—으로 분리하여 독립적으로 훈련시킨다.
  • 각 트리플릿에 대해 더 높은 신뢰도를 가진 출력에 더 많은 가중치를 주는 신뢰도 기반 융합 모듈을 설계한다.
  • 인지가 불확실할 경우(예: 저조도 조건) 공통지식 추론을 활용하여 비합리적인 예측—예를 들어 잘못 분류된 물체나 비현실적인 관계—를 수정하기 위해 융합 모듈을 사용한다.

실험 결과

연구 질문

  • RQ1외부 지식 없이 시나리오 그래프 데이터에서 직접 시각적 공통지식, 예를 들어 물체의 기능 가능성과 직관적 물리 법칙을 학습할 수 있는가?
  • RQ2구조화된 공통지식을 사용하여 시나리오 그래프 생성에서 인지 오류를 인식하고 수정할 수 있는 모델을 어떻게 훈련시킬 수 있는가?
  • RQ3공통지식 모델이 데이터셋 편향을 유전하지 않도록 하여, 희귀 또는 제로샷 인스턴스로의 일반화 능력은 어느 정도까지 가능할 수 있는가?
  • RQ4불확실성을 고려하면서 인지와 공통지식을 어떻게 융합할 수 있는가? 이는 전체적인 견고성을 향상시키는가?
  • RQ5일반적인 평균화나 고정 규칙 기반 통합 방식보다, 신뢰도 기반 융합 기법이 SGG 오류 수정에서 더 우수한 성능을 보일까?

주요 결과

  • GLAT는 시나리오 그래프 데이터에서 마스크된 예측 정확도 측정 기준으로 기존 트랜스포머 및 그래프 기반 모델보다 시각적 공통지식 학습에서 뛰어난 성능을 보였다.
  • Visual Genome 데이터셋에서, GLAT를 사용한 융합 모델은 최고의 베이스라인(KERN) 대비 mR@50에서 최대 1.4점, mR@100에서 0.9점 향상된 평균 리콜을 달성했다.
  • GLAT는 표준 SGG 모델에서 부재하는 복잡한 공통지식 패턴—예를 들어 의자에 앉는 것과 같은 물체의 기능 가능성, 또는 물체가 떠다니지 않는 것과 같은 직관적 물리 법칙—을 학습했다.
  • 이 방법은 데이터셋 편향에 강하다: 예를 들어 새나 새를 쓰고 있는 헤어스타일을 잘못 분류한 경우와 같은 희귀 또는 제로샷 시나리오에서 실수를 정확히 수정함을 보였다.
  • 융합 기법은 신뢰도 점수를 효과적으로 활용하여, 인지가 불확실한 경우(예: 저조도 조건)에는 공통지식을 우선시하고, 인지가 확신이 있을 경우에는 인지 결과를 우선시한다.
  • 제거 실험에서 GLAT와 융합 모듈을 추가하면, IMP, SNM, KERN을 포함한 모든 SGG 방법에서 성능 향상이 일관되게 관찰되어, 이 방법의 일반화 가능성과 효과성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.