Skip to main content
QUICK REVIEW

[논문 리뷰] Keyphrase Generation with Correlation Constraints

Jun Chen, Xiaoming Zhang|arXiv (Cornell University)|2018. 08. 22.
Advanced Text Analysis Techniques참고 문헌 29인용 수 8
한 줄 요약

이 논문은 다중 키워드 간 상관관계를 명시적으로 모델링하기 위해 커버리지 메커니즘을 통해 주제 커버리지를 향상시키고, 중복을 줄이기 위해 리뷰 메커니즘을 도입한 sequence-to-sequence 모델인 CorrRNN을 제안한다. 이 모델은 일对다 키워드 관계를 엔드 투 엔드 학습을 통해 직접 학습함으로써 벤치마크 데이터셋에서 정확도와 다양성 측면에서 최신 기술을 뛰어넘는 성능을 보인다.

ABSTRACT

In this paper, we study automatic keyphrase generation. Although conventional approaches to this task show promising results, they neglect correlation among keyphrases, resulting in duplication and coverage issues. To solve these problems, we propose a new sequence-to-sequence architecture for keyphrase generation named CorrRNN, which captures correlation among multiple keyphrases in two ways. First, we employ a coverage vector to indicate whether the word in the source document has been summarized by previous phrases to improve the coverage for keyphrases. Second, preceding phrases are taken into account to eliminate duplicate phrases and improve result coherence. Experiment results show that our model significantly outperforms the state-of-the-art method on benchmark datasets in terms of both accuracy and diversity.

연구 동기 및 목표

  • 키워드 간 상관관계를 忽시함으로써 발생하는 중복 및 커버리지 문제를 해결하기 위해.
  • 문서와 그에 대응하는 다수의 키워드 간 일대다 관계를 시퀀스 투 시퀀스 프레임워크 내에서 모델링하기 위해.
  • 상관관계 제약 조건을 직접 데이터에서 학습함으로써 문서 주제의 커버리지와 생성된 키워드의 다양성을 향상시키기 위해.
  • 히우리스틱 규칙과 이전의 Seq2Seq 모델을 포함한 기존 방법보다 정확하고 중복이 없는 키워드를 생성하기 위해.

제안 방법

  • 이전에 생성된 키워드들이 소스 문서의 어떤 단어를 요약했는지 추적하는 커버리지 벡터를 도입하여 주제 커버리지를 향상시킨다.
  • 이전에 생성된 키워드들을 디코더의 은닉 상태에 통합하는 리뷰 메커니즘을 적용하여 반복을 방지한다.
  • 이미 생성된 키워드들과 다음에 생성할 키워드 간의 상관관계를 명시적으로 모델링하는 새로운 어텐션 메커니즘을 표준 Seq2Seq 아키텍처에 통합한다.
  • 희귀어 또는 OOV(Out-of-Vocabulary)어를 보존하기 위해 커프 메커니즘을 사용하여 원본에 명시적으로 존재하지 않는 키워드도 생성한다.
  • 커버리지 및 리뷰 메커니즘을 하나의 RNN 기반 디코더에 통합하여 일관성, 커버리지, 다양성 간 균형을 이룬다.
  • 문서-키워드 쌍에 대해 엔드 투 엔드로 모델을 학습하여 상관관계 제약 조건을 데이터에서 직접 학습한다.

실험 결과

연구 질문

  • RQ1다수의 키워드 간 상관관계를 모델링하면 키워드 생성의 커버리지 향상과 중복 감소에 기여하는가?
  • RQ2요약된 내용을 추적하는 커버리지 메커니즘이 생성된 키워드의 주제 커버리지에 어떤 영향을 미치는가?
  • RQ3디코딩 과정에서 이전에 생성된 키워드들을 고려할 경우 중복은 어느 정도 감소하는가?
  • RQ4상관관계 제약 조건의 엔드 투 엔드 학습이 히우리스틱 후처리 규칙보다 키워드 다양성과 정확도 측면에서 더 우수한가?

주요 결과

  • CorrRNN은 벤치마크 데이터셋에서 CopyRNN 모델보다 키워드 정확도와 다양성 측면에서 뚜렷한 성능 향상을 보였다.
  • 사례 연구에서 CorrRNN은 CopyRNN 대비 한 개 더 많은 정확한 존재 키워드와 한 개 더 많은 부재 키워드를 생성하여 주제 커버리지가 향상되었다.
  • CorrRNN은 CopyRNN의 네 개에서 두 개로 감소시킨 'conferencing' 키워드 생성으로 인해 중복을 줄여 결과의 일관성을 향상시켰다.
  • CorrRNN은 더 많은 파라미터(94.9M)를 가졌음에도 불구하고 더 빠른 수렴 속도를 보이며 더 높은 성능을 달성하여 훈련 효율성이 향상됨을 시사한다.
  • 실증 결과는 상관관계 제약 조건의 엔드 투 엔드 학습이 다양성과 정확도 향상에 히우리스틱 규칙보다 더 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.