Skip to main content
QUICK REVIEW

[논문 리뷰] Describing Natural Images Containing Novel Objects with Knowledge Guided Assitance

Aditya Mogadala, Umanga Bista|arXiv (Cornell University)|2017. 10. 17.
Image Retrieval and Classification Techniques참고 문헌 1인용 수 9
한 줄 요약

이 논문은 지식 기반(KB)을 활용해 의미적 어조 및 제약 있는 추론을 유도함으로써, 새로운 객체에 대한 이미지 캡션 생성을 향상시키는 이중 단계 방법인 지식 유도 보조(KGA)를 제안한다. 먼저 다중 엔티티 레이블 이미지 분류기를 훈련시어 시각적 객체를 KB 엔티티에 연결하고, 이후 이 레이블을 캡션 생성 시 외부 어조 및 동적 제약 조건으로 사용한다. 이는 MSCOCO와 같은 도메인 외 이미지 캡션 벤치마크에서 성능을 크게 향상시킨다.

ABSTRACT

Images in the wild encapsulate rich knowledge about varied abstract concepts and cannot be sufficiently described with models built only using image-caption pairs containing selected objects. We propose to handle such a task with the guidance of a knowledge base that incorporate many abstract concepts. Our method is a two-step process where we first build a multi-entity-label image recognition model to predict abstract concepts as image labels and then leverage them in the second step as an external semantic attention and constrained inference in the caption generation model for describing images that depict unseen/novel objects. Evaluations show that our models outperform most of the prior work for out-of-domain captioning on MSCOCO and are useful for integration of knowledge and vision in general.

연구 동기 및 목표

  • 학습 데이터에 포함되지 않은 새로운 또는 알려지지 않은 객체를 포함한 이미지를 기술하는 데에 한계를 보이는 이미지 캡션 모델의 문제를 해결하기 위해.
  • 지식 기반(KB)에서 구조화된 지식을 통합하여 도메인 외 시각적 개념에 대한 캡션 생성을 향상시키기 위해.
  • 캡션 생성 중에 KB 엔티티를 외부 의미 어조 및 동적 제약 조건으로 활용하는 방법을 개발하기 위해.
  • 단지 이미지-캡션 병렬 데이터로만 훈련된 모델의 어휘 및 의미적 한계를 극복하기 위해.

제안 방법

  • 시각적 객체를 KB 엔티티에 연결하기 위해, 이미지 레이블로 지식 기반 엔티티를 예측하는 다중 레이블 이미지 분류기를 훈련시킨다.
  • 지식 유도 보조(KGA)는 예측된 KB 엔티티 레이블을 캡션 생성 중 외부 의미 어조로 사용한다.
  • KGA는 어조 기반 메커니즘에 엔티티 관련도 점수를 통합하여 디코더에 동적 제약 조건을 적용한다.
  • 모델은 이중 단계 훈련 프로세스를 사용한다: 첫째, 이미지-KB 엔티티 쌍으로 이미지 분류기를 훈련시킨다; 둘째, KGA 가이드를 통해 캡션 생성기를 미세조정한다.
  • 캡션 생성 모델은 소프트 어조를 사용하는 LSTM 기반 디코더를 활용하며, 어조 가중치는 KB에서 유도된 엔티티 관련도 점수에 의해 조정된다.
  • 모델은 KGA 제약 조건을 포함한 범프 서치 추론을 사용하여, 알려지지 않은 객체로의 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1지식 기반(KB)이 훈련 캡션 데이터에 존재하지 않는 새로운 또는 알려지지 않은 객체를 포함한 이미지에 대한 캡션 생성을 향상시킬 수 있는가?
  • RQ2KB에서 유도된 구조화된 지식을 캡션 생성 모델의 어조 기반 메커니즘에 효과적으로 통합할 수 있는가?
  • RQ3추론 중에 KB 엔티티를 동적 제약 조건으로 사용할 경우 도메인 외 객체에 대한 캡션 품질이 향상되는가?
  • RQ4KGA는 DCC, NOC, LSTM-C와 같은 기존 방법과 비교해 보면 새로운 객체 캡션 생성에서 성능 면에서 어떻게 다른가?
  • RQ5언어 모델의 은닉 차원 수와 범프 서치 전략을 변화시킬 경우 KGA 성능에 어떤 영향을 미치는가?

주요 결과

  • KGA-CGM은 MSCOCO의 'unseen' 스플릿에서 최고의 METEOR 점수 22.2를 기록하여, NOC 및 LSTM-C를 포함한 기존 방법들을 능가했다.
  • 새로운 객체 스플릿에서 KGA-CGM은 SPICE 점수 14.6을 기록하여, NOC(13.3) 및 LSTM-C(13.9)보다 유의미하게 높았다.
  • 512차원 LSTM 레이어를 사용한 모델은 'unseen' 스플릿에서 F1 점수 54.5를 기록하여 더 큰 은닉 상태로 인해 더 뛰어난 내성성을 확보했다.
  • 정성적 분석 결과 예측된 엔티티-레이블(예: 'Wine_bottle', 'Bus', 'Zebra')이 캡션의 관련성과 의미 정확도를 향상시켰다.
  • 어조 시각화 결과 KGA가 새로운 객체에 대해 특히 효과적으로 관련 KB 엔티티에 초점을 맞추는 것으로 확인되었다.
  • 제거 실험 결과 LSTM 은닉 레이어 차원을 256에서 512로 증가시킬 경우 'unseen' 스플릿에서 F1 점수가 6.3%p 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.