Skip to main content
QUICK REVIEW

[논문 리뷰] Regularizing Output Distribution of Abstractive Chinese Social Media Text Summarization for Improved Semantic Consistency

Bingzhen Wei, Xuancheng Ren|arXiv (Cornell University)|2018. 05. 10.
Topic Modeling참고 문헌 21인용 수 5
한 줄 요약

이 논문은 노이즈가 많고 일관성 없는 데이터셋에서 허위어휘 대응에 의존하는 것을 줄이기 위해 훈련 중 출력 단어 분포를 부드럽게 하는 정규화 방법을 제안한다. 이는 개괄적 중국어 소셜미디어 텍스트 요약의 의미 일관성을 향상시킨다. 인간 평가에 따르면 의미 일관성에서 4% 향상되며, 기존 모델들을 능가한다.

ABSTRACT

Abstractive text summarization is a highly difficult problem, and the sequence-to-sequence model has shown success in improving the performance on the task. However, the generated summaries are often inconsistent with the source content in semantics. In such cases, when generating summaries, the model selects semantically unrelated words with respect to the source content as the most probable output. The problem can be attributed to heuristically constructed training data, where summaries can be unrelated to the source content, thus containing semantically unrelated words and spurious word correspondence. In this paper, we propose a regularization approach for the sequence-to-sequence model and make use of what the model has learned to regularize the learning objective to alleviate the effect of the problem. In addition, we propose a practical human evaluation method to address the problem that the existing automatic evaluation method does not evaluate the semantic consistency with the source content properly. Experimental results demonstrate the effectiveness of the proposed approach, which outperforms almost all the existing models. Especially, the proposed approach improves the semantic consistency by 4\% in terms of human evaluation.

연구 동기 및 목표

  • 훈련 데이터에 원본 콘텐츠와 관련이 없는 요약문이 포함되어 있어 지속적인 의미 불일치 문제가 발생하는 중국어 소셜미디어 텍스트의 개괄적 요약 문제를 해결한다.
  • 히ュ리스틱적 데이터 수집 방식이 허위어휘 대응을 초래하며, 이는 모델의 일반화 능력과 의미 충실도에 악영향을 준다는 점을 규명한다.
  • 훈련 중 출력 분포를 연마하여 의미적으로 관련 없는 어휘 쌍의 기억을 줄이기 위한 정규화 기법을 제안한다.
  • 자동 메트릭의 한계를 극복하기 위해 의미 일관성을 정확히 평가할 수 있는 실용적인 인간 평가 프레임워크를 개발한다.
  • LCSTS 및 유사 데이터셋에서 생성된 요약의 충실도와 일관성을 향상시켜 모델 성능을 향상시킨다.

제안 방법

  • 각 디코딩 단계에서 참조 단어 외에도 부드러운 훈련 타겟을 도입하여 출력 단어 분포를 정규화한다.
  • 스모وذ스 함수의 온도를 높여 더 부드럽고 부드러운 출력 분포를 생성함으로써 잘못된 단어 선택에 대한 과신을 줄인다.
  • 디코더의 출력 레이어를 활용해 부드러운 분포를 생성함으로써 어휘 선택의 강건성을 높이고 허위 대응에 대한 의존도를 감소시킨다.
  • 골드 기준 단어와의 교차 엔트로피와 함께, 부드러운 분포와의 KL 발산을 조합한 손실 함수로 시퀀스-투-시퀀스 모델을 훈련시킨다.
  • 훈련 및 추론 모두에 정규화를 적용하여 출력 생성의 안정성과 일관성을 향상시킨다.
  • 유창성, 관련성, 충실도의 세 가지 기준을 포함한 인간 평가 프로토콜을 설계하여 자동 메트릭보다 더 정확하게 의미 일관성을 측정한다.

실험 결과

연구 질문

  • RQ1훈련 데이터에 의미적으로 불일치하는 요약문이 존재할 경우, 이는 개괄적 요약 모델의 성능과 일관성에 어떤 영향을 미치는가?
  • RQ2훈련 중 출력 분포를 부드럽게 하는 것이 모델이 허위어휘 대응을 기억하는 경향을 어느 정도 줄일 수 있는가?
  • RQ3유창성, 관련성, 충실도를 종합한 인간 평가 프레임워크는 자동 메트릭보다 의미 일관성 평가에 더 신뢰할 수 있는가?
  • RQ4제안된 정규화 방법은 중국어 소셜미디어 텍스트 요약에서 인간 평가 기반 의미 일관성에 측정 가능한 향상을 이끌 수 있는가?
  • RQ5자동 평가 및 인간 평가 메트릭 모두에서 기존 최첨단 모델과 비교해 모델 성능은 어떻게 되는가?

주요 결과

  • 제안된 정규화 방법은 인간 평가에서 의미 일관성을 4% 향상시켜 기존 모델보다 유의미하고 측정 가능한 성과를 보였다.
  • 모델은 LCSTS 벤치마크에서 거의 모든 기존 개괄적 요약 모델을 능가하며, 그 효과성을 확인했다.
  • 인간 평가 결과, 이 방법은 생성된 요약문에서 환각 현상과 사실 오류를 크게 줄였다.
  • 출력 분포의 부드러움은 어휘 예측에 대한 과신을 감소시켜 더 충실하고 맥락에 부합하는 요약문을 생성하게 했다.
  • 자동 메트릭이 감지하지 못하는 불일치를 인간 평가 프레임워크가 성공적으로 식별함으로써, 의미 충실도 평가에 대한 신뢰성을 입증했다.
  • 허위어휘 대응의 기억을 줄이기 위해 히ュ리스틱적으로 구성된 노이즈가 많은 훈련 데이터의 영향을 효과적으로 완화했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.