Skip to main content
QUICK REVIEW

[논문 리뷰] Introduction to the 1st Place Winning Model of OpenImages Relationship Detection Challenge

Ji Zhang, Kevin J. Shih|arXiv (Cornell University)|2018. 11. 01.
Multimodal Machine Learning Applications참고 문헌 5인용 수 6
한 줄 요약

이 논문은 OpenImages Visual Relationship Detection 챌린지에서 1등을 차지한 모델을 제시하며, 강력한 언어적 편향 기반 모델과 공간적, 시각적 특징 융합을 결합한다. 경험적 술어 분포, 공간 상자 델타, ROI 정렬 특징에서 유도된 시각적 특징을 활용하여, 의미, 공간, 시각적 브랜치를 모듈러하고 덧셈 방식으로 융합함으로써 최신 기술 수준의 성능을 달성한다. 검증 세트에서 45.14 mAP, 공개 테스트 세트에서 33.21 mAP의 성능을 기록하였다.

ABSTRACT

This article describes the model we built that achieved 1st place in the OpenImage Visual Relationship Detection Challenge on Kaggle. Three key factors contribute the most to our success: 1) language bias is a powerful baseline for this task. We build the empirical distribution $P(predicate|subject,object)$ in the training set and directly use that in testing. This baseline achieved the 2nd place when submitted; 2) spatial features are as important as visual features, especially for spatial relationships such as "under" and "inside of"; 3) It is a very effective way to fuse different features by first building separate modules for each of them, then adding their output logits before the final softmax layer. We show in ablation study that each factor can improve the performance to a non-trivial extent, and the model reaches optimal when all of them are combined.

연구 동기 및 목표

  • OpenImages 챌린지에 대응하는 고성능 시각적 관계 검출 모델을 개발하여, 공간적 및 의미적 관계를 포함한 주어-서술어-목적어 삼중항을 예측하는 복잡성을 다루는 것.
  • 학습 데이터에서 술어의 제한적이고 편향된 분포를 감안할 때, 언어적 편향이 시각적 관계 검출에서 강력한 기반 모델로 얼마나 효과적인지 조사하는 것.
  • 특히 '아래에' 또는 '안에'와 같은 공간 관계를 정확히 예측하기 위해 상대적 상자 좌표가 공간적 특징에 얼마나 기여하는지 평가하는 것.
  • 종합적인 학습 없이 의미, 공간, 시각적 특징을 모듈러하고 덧셈 방식으로 융합하는 전략을 설계하는 것.
  • 언어적 편향, 공간 인코딩, 시각적 특징 학습을 모두 통합하여 최적의 성능을 달성하는 것.

제안 방법

  • 모델은 작업을 두 단계로 분해한다: 사전 훈련된 검출기(f_det)를 통한 객체 검출, 그 다음 검출된 주어 및 목적어 특징을 사용한 관계 분류(f_rel).
  • 의미 모듈은 학습 데이터에서 유도된 경험적 분포 P(predicate|subject,object)를 사용하여 관계 구성에서의 언어적 편향을 포착하는 강력한 기반 모델로 활용한다.
  • 공간 모듈은 상대적 상자 위치를 상자 델타 Δ(b_S, b_O)와 정규화된 좌표 c(b)를 통해 인코딩하여 '위에' 또는 '아래에'와 같은 공간적 술어를 정확히 예측할 수 있도록 한다.
  • 시각 모듈은 주어 및 목적어 영역에서 유도된 ROI 정렬 특징을 두 계층의 피드포워드 네트워크를 통해 처리하며, 외형 기반 관계를 포착하기 위해 주어 또는 목적어 전용 예측을 위한 추가 브랜치를 포함한다.
  • 최종 관계 점수는 의미, 공간, 시각적 브랜치의 로짓을 모두 합산한 후 소프트맥스를 적용하여 계산되며, 이는 효과적인 덧셈 방식의 특징 융합을 가능하게 한다.
  • 'is' 관계(속성 예측)의 경우, 객체 제안을 기반으로 한 별도의 Fast-RCNN 기반 모델을 훈련하여 속성 분포를 예측한다.

실험 결과

연구 질문

  • RQ1경험적 술어 빈도에 기반한 언어적 편향 기반 모델은 시각적 관계 검출에서 얼마나 효과적인가?
  • RQ2상자 델타와 정규화된 좌표로 인코딩된 공간적 특징은 공간 관계 예측 성능에 얼마나 기여하는가?
  • RQ3의미, 공간, 시각적 특징을 모듈러하고 덧셈 방식으로 융합하는 전략은 종합적 학습 또는 원소별 융합 방식보다 성능이 뛰어나다고 할 수 있는가?
  • RQ4각 구성 요소(언어적 편향, 공간, 시각적)가 전체 성능에 기여하는 정도는 어떻게 되며, 상호작용은 어떠한가?
  • RQ5객체 검출기의 미세조정 없이도 단순한 기반 모델에 보완적인 특징을 결합하여 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 언어적 편향 기반 모델만으로도 공개 테스트 세트에서 22.21 mAP를 기록하여, 시각적 관계 검출에서 언어적 사전 지식이 매우 강력한 예측 능력을 지닌다는 것을 입증하였다.
  • 시각 모듈을 추가함으로써 mAP_rel는 기반 모델의 26.54에서 34.16으로 상승하였으며, '놀이' 또는 '입고 있다'와 같은 비공간적 관계에서 외형적 특징이 매우 중요하다는 것을 보여주었다.
  • 공간 특징을 통합함으로써 mAP_rel는 34.16에서 34.96으로, mAP_phr는 39.59에서 40.70으로 상승하여 공간 인코딩이 공간 술어 예측에 필수적임을 확인하였다.
  • 모든 구성 요소(의미, 공간, 시각적, 주어/목적어 전용 예측)를 통합한 최종 모델은 검증 세트에서 45.14 mAP, 공개 테스트 세트에서 33.21 mAP를 기록하여 1등을 차지하였다.
  • 제거 실험을 통해 각 구성 요소가 비중 있는 기여를 하며, 기반 모델 대비 가장 큰 성능 향상은 시각적 및 공간적 특징에서 유도되었다.
  • 다중 인스턴스 시나리오에서 참조 모호성을 성공적으로 해결하여, 복잡한 장면에서 어느 사람이 어떤 말을 타고 있는지 정확히 식별하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.