Skip to main content
QUICK REVIEW

[논문 리뷰] $R^3$: Reverse, Retrieve, and Rank for Sarcasm Generation with Commonsense Knowledge

Tuhin Chakrabarty, Debanjan Ghosh|arXiv (Cornell University)|2020. 04. 28.
Topic Modeling참고 문헌 28인용 수 9
한 줄 요약

이 논문은 $R^3$를 제안하며, 이를 통해 평가어의 반전, COMET를 통한 공통지식 검색, 그리고 미세조정된 RoBERTa 모델에서 유도된 모순 점수를 활용한 검색된 문맥의 순위 매기기를 통해 비지도적 풍자 생성 프레임워크를 구현한다. 이 방법은 인간 평가에서 34%의 비율로 인간 평가자보다 뛰어나고, 강화된 하이브리드 기준 모델보다 90%의 비율로 뛰어나며, 통합된 평가어 반전과 의미적 부조화를 통해 품질 높은 풍자를 생성함을 입증한다.

ABSTRACT

We propose an unsupervised approach for sarcasm generation based on a non-sarcastic input sentence. Our method employs a retrieve-and-edit framework to instantiate two major characteristics of sarcasm: reversal of valence and semantic incongruity with the context which could include shared commonsense or world knowledge between the speaker and the listener. While prior works on sarcasm generation predominantly focus on context incongruity, we show that combining valence reversal and semantic incongruity based on the commonsense knowledge generates sarcasm of higher quality. Human evaluation shows that our system generates sarcasm better than human annotators 34% of the time, and better than a reinforced hybrid baseline 90% of the time.

연구 동기 및 목표

  • 풍자 생성에서의 학습 데이터 부족 문제를 해결하기 위해 비지도 프레임워크를 제안한다.
  • 공통지식을 활용하여 평가어 반전과 의미적 부조화를 포함한 다수의 풍자 요소를 모델링한다.
  • 풍자 품질을 향상시키기 위해 풍자적 유머와 부조화를 강화하는 검색된 공통지식 문맥을 통합한다.
  • 자동화 평가 및 인간 평가에서 기존 기준 모델과 인간이 생성한 풍자보다 뛰어나도록 성능을 향상시킨다.
  • 의미적 부조화가 고품질의 풍자 어휘 생성에 미치는 역할을 조사한다.

제안 방법

  • 입력 문장의 평가어에 부정 또는 어휘 반대어를 적용하여 평가어를 반전시켜 풍자 기반 문장을 생성한다.
  • ConceptNet에 대해 미세조정된 언어 모델인 COMET을 사용하여 관련된 문맥적 개념을 검색한다.
  • 평가어 반전 문장과 검색된 공통지식 문장을 연결하여 후보 풍자 어휘를 구성한다.
  • 다양한 장르의 NLI 코퍼스에 대해 미세조정된 모순 탐지 모델을 사용하여 의미적 부조화를 측정함으로써 후보 문맥을 순위 매긴다.
  • 모순 점수 기반으로 가장 높은 점수를 받은 문맥을 선택하고, 평가어 반전 문장에 이어 붙여 최종 출력을 생성한다.
  • 고정된 생성 패턴을 사용한다: 평가어 반전 문장 다음에 최상위 순위의 공통지식 문맥을 이어 붙인다.

실험 결과

연구 질문

  • RQ1평가어 반전과 공통지식 기반 의미적 부조화를 조합하면 풍자 생성 품질이 향상되는가?
  • RQ2공통지식의 통합은 생성된 어휘의 유머감 및 풍자성에 어떤 영향을 미치는가?
  • RQ3검색된 문맥을 모순 기반으로 순위 매기는 방식이 무작위 또는 순위 없이 검색하는 것보다 풍자 품질 향상에 얼마나 기여하는가?
  • RQ4제안된 프레임워크는 인간이 생성한 풍자와 최신 기준 모델을 모두 인간 평가에서 앞서는가?
  • RQ5자동 모순 점수는 인간의 풍자성 및 부조화 인식 평가와 상관관계를 가지는가?

주요 결과

  • $R^3$ 모델은 풍자 품질 기준에서 인간이 생성한 풍자보다 34%의 비율로 더 높은 평가를 받았다.
  • 다양한 기준, 즉 풍자성, 유머, 창의성에서 인간 평가에서 강화된 하이브리드 기준 모델보다 90%의 비율로 뛰어났다.
  • 제거 실험 결과, 평가어 반전과 순위 매겨진 공통지식 검색을 조합하면 개별 구성 요소보다 성능 향상이著명했다.
  • 최상위 순위의 검색된 문맥을 사용할 경우 인간의 풍자 평가와 자동 모순 점수 사이에 높은 피어슨 상관관계가 관찰되어 부조화의 역할이 풍자 인식에 기여함을 확인했다.
  • 전반적인 성공에도 불구하고, 일부 경우에 랜덤으로 검색된 문맥이 순위 매겨진 문맥보다 더 나은 풍자를 생성하는 경우가 있었으며, 이는 모순 점수 정확도에 한계가 있음을 시사한다.
  • 모델의 성능은 생성 순서에 민감했으며, 초기 테스트에서 고정된 순서(반전 문장 먼저)가 반전 순서보다 더 좋은 결과를 냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.