Skip to main content
QUICK REVIEW

[논문 리뷰] How Images Inspire Poems: Generating Classical Chinese Poetry from Images with Memory Networks

Linli Xu, Liang Jiang|arXiv (Cornell University)|2018. 03. 08.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

이 논문은 주제 메모리 네트워크를 통해 시각적 특징과 동적으로 선택된 의미적 키워드를 통합함으로써 이미지에서 고전 한시를 생성하는 메모리 증강 신경망인 MIPG를 제안한다. 이 모델은 인간 평가 및 자동 평가 모두에서 이미지-시 일致성과 시적 품질 측면에서 최신 기준 성능을 달성한다.

ABSTRACT

With the recent advances of neural models and natural language processing, automatic generation of classical Chinese poetry has drawn significant attention due to its artistic and cultural value. Previous works mainly focus on generating poetry given keywords or other text information, while visual inspirations for poetry have been rarely explored. Generating poetry from images is much more challenging than generating poetry from text, since images contain very rich visual information which cannot be described completely using several keywords, and a good poem should convey the image accurately. In this paper, we propose a memory based neural model which exploits images to generate poems. Specifically, an Encoder-Decoder model with a topic memory network is proposed to generate classical Chinese poetry from images. To the best of our knowledge, this is the first work attempting to generate classical Chinese poetry from images with neural networks. A comprehensive experimental investigation with both human evaluation and quantitative analysis demonstrates that the proposed model can generate poems which convey images accurately.

연구 동기 및 목표

  • 시각적 입력에서 고전 한시를 생성하는 데 대한 연구 부족을 보완하기 위해, 텍스트 기반 생성보다 더 자연스럽고 직관적인 접근을 제공한다.
  • 이전의 텍스트 기반 모델에서 발생하는 주제 이탈 및 의미 불일치 등의 한계를 시각적 정보와 의미적 주제 정보를 통합함으로써 극복한다.
  • 고전 한시의 엄격한 음운 규칙과 운율 규칙을 유지하면서도 각 행을 순차적으로 생성하는 인코더-디코더 모델을 개발한다.
  • 이미지에서 추출한 무제한 수의 키워드를 지원하는 메모리 네트워크를 활용해 생성 과정 중 동적으로 주제를 선택할 수 있도록 한다.
  • 이미지의 정확한 표현을 보장하기 위해 직접적인 시각적 특징과 의미적 키워드를 융합한다.

제안 방법

  • 생성 과정 중 각 문자의 잠재 주제를 모델링하기 위해 주제 메모리 네트워크를 갖춘 인코더-디코더 프레임워크를 제안한다.
  • CNN 기반 인코더를 통해 추출한 이미지 특징을 사용하여 키워드로 완전히 기술되지 않은 시각적 내용을 포착한다.
  • 이미지에서 추출한 의미적 키워드를 시각적 뼈대로 활용하며, 메모리 네트워크가 각 생성 단계에서 관련성이 높은 키워드를 동적으로 선택한다.
  • 각 행이 이전 행들과 현재 주제 맥락에 기반하여 생성되는 순차적-순차적 학습 프레임워크를 활용한다.
  • 시각적 특징과 주제 인식 히든 상태를 융합하여 디코더가 언어적으로 정확하고 시각적으로 일치하는 시를 생성하도록 이끈다.
  • 이중 브랜치 메커니즘을 활용한다: 하나는 시각적 특징 인코딩을, 다른 하나는 주제 메모리를 담당하며, 둘 다 디코더의 히든 상태에 통합된다.

실험 결과

연구 질문

  • RQ1신경망 모델이 간단한 키워드 기반 생성을 초월하여 주어진 이미지의 내용을 정확히 반영하는 고전 한시를 생성할 수 있는가?
  • RQ2주제 메모리 네트워크가 이미지에서 자동 회귀적 시 생성 중 주제 일관성을 유지하고 주제 이탈을 방지하는 데 얼마나 효과적인가?
  • RQ3시각적 특징과 의미적 키워드가 별개의 모odalities를 사용할 때보다 이미지-시 일치도를 얼마나 향상시키는가?
  • RQ4키워드 기반 베이스라인과 비교해 본다면, 제안된 모델은 시적 품질, 일관성, 입력 이미지와의 일치도 측면에서 어떻게 성능을 내는가?
  • RQ5자동 평가 지표인 키워드 복귀율이 생성된 시의 이미지 일치도에 대해 인간 평가와 관련성이 있는가?

주요 결과

  • 인간 평가에서 MIPG는 '일치도'와 '일관성' 측면에서 모든 베이스라인을 압도적으로 뛰어넘었으며, 다음으로 우수한 베이스라인 대비 평균 15.2점 향상되었다.
  • 자동 평가 결과 MIPG는 키워드 복귀율 87.6%를 기록하여 RNNPG-A(62.3%)와 PPG-R(68.1%)보다 뚜렷이 높아, 더 나은 이미지 표현 능력을 보였다.
  • 제거 실험 결과 시각적 특징이나 의미적 키워드를 제거할 경우 성능 저하가 발생하며, 특히 '일치도'에서 두드러져 두 구성 요소가 필수적임을 입증했다.
  • 모델는 엄격한 음운 규칙과 운율 규칙을 따르면서도 정확한 시각적 내용을 반영한 시를 생성하며, 인간 평가자들이 이를 확인했다.
  • 주제 메모리 네트워크를 통해 동적 주제 선택이 가능해져 주제 이탈이 감소하고, 키워드 고정형 베이스라인보다 더 긴, 더 일관성 있는 시를 생성할 수 있었다.
  • 인간 평가 결과 MIPG가 생성한 시는 '시적 품질'과 '이미지 표현' 측면에서 베이스라인보다 유의미하게 높은 평가를 받았으며, 82%의 시가 입력 이미지와 '매우 일치'로 평가되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.