Skip to main content
QUICK REVIEW

[논문 리뷰] MERMAID: Metaphor Generation with Symbolism and Discriminative Decoding

Tuhin Chakrabarty, Xurui Zhang|arXiv (Cornell University)|2021. 03. 11.
Language, Metaphor, and Cognition참고 문헌 45인용 수 4
한 줄 요약

이 논문은 상징적 의미와 분류적 디코딩을 활용하여 직설적 문장을 은유로 변환하는 메타포 생성 모델인 MERMAID를 제안한다. 막힌 언어 모델링과 공통된 지식 추론을 통해 자동으로 93,498개의 병렬 코퍼스를 구성하고, 메타포 식별자로 BART를 미세조정함으로써 고품질의 은유를 생성한다. 인간 평가에서 66%의 선호도를 기록하며 베이스라인을 초월하고, 임무 기반 평가에서는 인간이 작성한 시의 품질을 향상시켜 68%의 선호도를 확보한다.

ABSTRACT

Generating metaphors is a challenging task as it requires a proper understanding of abstract concepts, making connections between unrelated concepts, and deviating from the literal meaning. In this paper, we aim to generate a metaphoric sentence given a literal expression by replacing relevant verbs. Based on a theoretically-grounded connection between metaphors and symbols, we propose a method to automatically construct a parallel corpus by transforming a large number of metaphorical sentences from the Gutenberg Poetry corpus (Jacobs, 2018) to their literal counterpart using recent advances in masked language modeling coupled with commonsense inference. For the generation task, we incorporate a metaphor discriminator to guide the decoding of a sequence to sequence model fine-tuned on our parallel data to generate high-quality metaphors. Human evaluation on an independent test set of literal statements shows that our best model generates metaphors better than three well-crafted baselines 66% of the time on average. A task-based evaluation shows that human-written poems enhanced with metaphors proposed by our model are preferred 68% of the time compared to poems without metaphors.

연구 동기 및 목표

  • 직설적 문장에서 은유적 문장으로의 변환을 위한 병렬 훈련 데이터 부족 문제를 해결하기 위해.
  • 직설적 문장과 은유적 문장 간 의미 일관성을 유지하면서 어휘적 다양성을 가능하게 하기 위해.
  • 자기회귀 모델이 직설적 언어를 은유적 언어보다 더 자주 생성하는 경향을 극복하기 위해.
  • 메타포 식별자를 통해 유도되는 분류적 디코딩을 통해 은유 품질을 향상시키기 위해.
  • 실제 창작 글쓰기 작업, 예를 들어 인간이 작성한 시의 품질 향상에 모델의 영향을 평가하기 위해.

제안 방법

  • 막힌 언어 모델링과 COMET의 공통된 지식 지식을 활용해 구텐베르크 시 코퍼스의 은유적 문장을 변형하여 93,498개의 [직설적 문장, 은유적 문장] 쌍으로 구성된 병렬 코퍼스를 구축한다.
  • 개념넷의 SymbolOf 관계를 사용하여 직설화 과정에서 상징적 의미가 유지되도록 하여 은유를 공통된 개념적 상징에 기반하게 한다.
  • 구축된 병렬 코퍼스를 기반으로 BART 시퀀스-투-시퀀스 모델을 미세조정하여 직설적 문장에서 은유적 문장으로의 변환을 학습한다.
  • 디코딩 중에 생성기를 더 은유적 적절한 출력으로 유도하기 위해 보상 모델로 분류적 메타포 검출기를 통합한다.
  • 추론 중에 생성된 가설의 품질을 향상시키기 위해 메타포 검출 모델(Liu 등, 2019)을 사용해 재순서 정렬을 적용한다.
  • 인간 평가와 임무 기반 평가를 통해 독립적 생성 및 실제 창작 글쓰기 작업에서의 모델 성능을 검증한다.

실험 결과

연구 질문

  • RQ1상징적 의미를 효과적으로 활용하여 직설적 문장에서 은유적 문장으로의 변환을 위한 대규모 병렬 코퍼스를 구축할 수 있는가?
  • RQ2분류적 메타포 식별자가 디코딩 중에 생성된 문장의 품질과 은유적 적합성을 향상시킬 수 있는가?
  • RQ3제안된 방법이 인간 평가에서 강력한 베이스라인보다 선호되는 은유를 생성하는가?
  • RQ4창작 글쓰기 보조 도구로 사용되었을 때 모델이 인간이 작성한 시의 품질을 향상시킬 수 있는가?
  • RQ5상징적 의미를 유지함으로써 직설적 및 은유적 출력 간 의미 일관성이 얼마나 향상되는가?

주요 결과

  • 제안된 방법은 막힌 언어 모델링과 공통된 지식 추론을 활용하여 상징적 의미에 기반한 93,498개의 [직설적, 은유적] 문장 쌍으로 구성된 병렬 코퍼스를 생성하였다.
  • 인간 평가 결과, 최고의 MERMAID 모델이 세 개의 정교하게 제작된 베이스라인보다 66%의 선호도를 기록하였다.
  • 모델은 두 개의 문학 전문가 베이스라인과 비교했을 때 21%의 경우에서 승리했고, 두 개의 강력한 베이스라인과 비교했을 때 81%의 경우에서 승리했다.
  • 임무 기반 평가에서 MERMAID가 생성한 은유를 포함한 시는 은유가 없는 시보다 68%의 선호도를 기록했다.
  • 디코딩 중에 메타포 식별자를 통합함으로써 생성 출력의 품질과 은유적 적합성이 뚜렷이 향상되었다.
  • 모델는 새로운 직설적 입력에 대해 강력한 일반화 능력을 보였으며, 다양한 은유적 표현을 도입하면서도 의미 일관성을 유지하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.