Skip to main content
QUICK REVIEW

[논문 리뷰] C3VQG: Category Consistent Cyclic Visual Question Generation

Shagun Uppal, Anish Madan|arXiv (Cornell University)|2020. 05. 15.
Multimodal Machine Learning Applications참고 문헌 39인용 수 5
한 줄 요약

C3VQG는 이미지와 카테고리 쌍을 활용하여 정답 애너테이션의 필요성을 제거함으로써 카테고리 일관성 있는 순환 변동형 오토에코더를 위한 시각질문 생성을 제안한다. 순환 일관성과 구조화된 잠복 공간 제약을 통해 모델은 다양하고 카테고리별이며 이미지 관련 질문을 생성하며, 다양한 지표에서 최신의 약한 감독 방법을 능가한다.

ABSTRACT

Visual Question Generation (VQG) is the task of generating natural questions based on an image. Popular methods in the past have explored image-to-sequence architectures trained with maximum likelihood which have demonstrated meaningful generated questions given an image and its associated ground-truth answer. VQG becomes more challenging if the image contains rich contextual information describing its different semantic categories. In this paper, we try to exploit the different visual cues and concepts in an image to generate questions using a variational autoencoder (VAE) without ground-truth answers. Our approach solves two major shortcomings of existing VQG systems: (i) minimize the level of supervision and (ii) replace generic questions with category relevant generations. Most importantly, by eliminating expensive answer annotations, the required supervision is weakened. Using different categories enables us to exploit different concepts as the inference requires only the image and the category. Mutual information is maximized between the image, question, and answer category in the latent space of our VAE. A novel category consistent cyclic loss is proposed to enable the model to generate consistent predictions with respect to the answer category, reducing redundancies and irregularities. Additionally, we also impose supplementary constraints on the latent space of our generative model to provide structure based on categories and enhance generalization by encapsulating decorrelated features within each dimension. Through extensive experiments, the proposed model, C3VQG outperforms state-of-the-art VQG methods with weak supervision.

연구 동기 및 목표

  • 비용이 많이 드는 정답 애너테이션을 쉽게 확보할 수 있는 카테고리 레이블로 대체하여 시각질문 생성의 감독을 줄이기 위해.
  • 정답 애너테이션에 의존하지 않고 이미지에서 의미적으로 관련 있고 다양한, 카테고리별 질문을 생성하기 위해.
  • 생성된 질문과 관련된 정답 카테고리 간의 일관성을 강제하여 질문 품질을 향상시키기 위해.
  • 센터 손실과 잠복 분산에 대한 초우량자(hiper-prior)를 포함한 구조화된 잠복 공간 제약을 통해 모델의 일반화 능력과 다양성을 향상시키기 위해.
  • 이미지와 카테고리 입력을 사용하여 다중모odal 표현을 모델링하여 창의적이고 맥락 인식형 질문 생성을 가능하게 하기 위해.

제안 방법

  • 이미지와 카테고리 쌍을 기반으로 변동형 오토에코더(VAE)를 훈련시어, 이미지, 질문, 정답 카테고리 간의 상호정보량을 최대화하는 공동 잠복 공간을 학습한다.
  • 훈련 중에 생성된 질문이 지정된 정답 카테고리와 일관성을 유지하도록 보장하기 위해 새로운 카테고리 일관성 있는 순환 손실을 도입한다.
  • 정답 카테고리별로 샘플이 군집화되도록 복합 잠복 공간에 센터 손실을 적용하여 카테고리 특이성을 향상시킨다.
  • 각 잠복 차원의 역분산에 초우량자를 적용하여 내재적으로 독립적인 특징을 장려함으로써 분리성과 다양성을 향상시킨다.
  • 이중 단계 훈련 절차를 사용한다: 먼저 이미지와 카테고리로부터 질문을 생성하고, 그 다음 생성된 질문로부터 이미지와 카테고리를 재구성하여 순환 일관성을 강제한다.
  • 다중 목표 손실 함수를 사용하여 이미지 재구성, 카테고리 재구성, 질문 생성을 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1이미지와 카테고리 감독만을 사용하여 정답 애너테이션 없이 시각질문 생성을 효과적으로 수행할 수 있는가?
  • RQ2이미지, 질문, 카테고리 간의 순환 일관성을 어떻게 강제하여 생성된 질문의 정답 카테고리 관련성을 향상시킬 수 있는가?
  • RQ3구조화된 잠복 공간 제약(예: 센터 손실, 초우량자)이 생성된 질문의 다양성과 카테고리 특이성에 얼마나 기여하는가?
  • RQ4정답 감독을 카테고리 감독으로 대체하면 질문 생성의 일반화 능력 향상과 중복 감소에 기여하는가?
  • RQ5약한 감독 하에서 VAE 기반 프레임워크가 고품질의 맥락 관련성 있고 일반적이지 않은 질문을 생성할 수 있는가?

주요 결과

  • C3VQG는 VQG 벤치마크에서 ROUGE-L 점수 60.50을 기록하여 정답 애너테이션 없이도 이전 최신 기술(SOTA)인 Krishna 등(2019)을 능가했다.
  • 모델은 97.80의 관련성 점수를 기록하여 생성된 질문과 입력 이미지 간의 높은 의미 일치를 보였다.
  • 제거 실험 결과, 순환 일관성과 센터 손실의 조합이 카테고리 일관성에 크게 기여하여 정답 카테고리의 오분류를 감소시켰다.
  • 잠복 분산에 대한 초우량자를 도입함으로써 잠복 공간 내 특징 간 상관관계를 줄여 더 다양한 질문 생성을 가능케 하였다.
  • 정성적 결과는 C3VQG가 특정 정답 카테고리와 일관되며 맥락이 풍부하고 반복적이지 않은 질문을 생성함을 확인하였으며, 기준 모델들은 종종 카테고리 일관성이 없는 출력을 생성하는 반면 C3VQG는 그렇지 않음을 보였다.
  • 잠복 공간을 통한 카테고리 특이성 제약을 강제함으로써 일반적인 질문 형성(예: '네', '모르겠어요')을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.