[논문 리뷰] Improving Neural Text Simplification Model with Simplified Corpora
이 논문은 네트워크 아키텍처를 수정하지 않고 대규모 간단문장 코퍼스를 활용하여 백트랜스레이션 기반 방법을 제안함으로써 신경망 텍스트 단순화(NTS) 모델의 성능을 향상시킨다. 간단문장에서 합성된 일반문장 쌍을 생성함으로써, WikiLarge에서 BLEU(+2.11), SARI(+1.07), FKGL(-1.7)가 향상되었으며, 새로운 SOTA 성능을 달성함으로써 간단문장 코퍼스가 백트랜슬레이션을 통해 효과적으로 NTS 성능을 향상시킬 수 있음을 입증한다.
Text simplification (TS) can be viewed as monolingual translation task, translating between text variations within a single language. Recent neural TS models draw on insights from neural machine translation to learn lexical simplification and content reduction using encoder-decoder model. But different from neural machine translation, we cannot obtain enough ordinary and simplified sentence pairs for TS, which are expensive and time-consuming to build. Target-side simplified sentences plays an important role in boosting fluency for statistical TS, and we investigate the use of simplified sentences to train, with no changes to the network architecture. We propose to pair simple training sentence with a synthetic ordinary sentence via back-translation, and treating this synthetic data as additional training data. We train encoder-decoder model using synthetic sentence pairs and original sentence pairs, which can obtain substantial improvements on the available WikiLarge data and WikiSmall data compared with the state-of-the-art methods.
연구 동기 및 목표
- 신경망 텍스트 단순화(NTS)에서 평행 일반-간단 문장 쌍의 부족 문제를 해결하기 위해 대규모 간단문장 코퍼스를 활용하는 것.
- 신경망 네트워크 아키텍처를 수정하지 않고도 NTS 모델 성능을 향상시키는 것.
- 기반 NMT 모델을 사용한 텍스트 단순화에서 간단문장 코퍼스가 유창성 및 단순화 품질을 향상시킬 수 있는지 조사하는 것.
- 간단문장에서 합성 훈련 데이터를 생성하기 위해 백트랜슬레이션의 효과성을 탐색하는 것.
- 기존 NTS 프레임워크에 간단문장 코퍼스를 통합하기 위한 간단하고 이식 가능한 방법을 수립하는 것.
제안 방법
- 사전 훈련된 NMT 모델을 사용하여 10만 개의 랜덤 샘플 간단문장을 백트랜슬레이션하여 합성된 일반문장 쌍을 생성한다.
- 합성된 문장 쌍을 원본 평행 훈련 데이터와 결합하여 NMT 모델의 공동 훈련을 수행한다.
- 어텐션 기반 인코더-디코더 아키텍처, LSTM 레이어, 표준 하이퍼파rameter를 사용하여 OpenNMT 프레임워크에서 모델을 훈련시킨다.
- 이 방법은 백트랜슬레이션된 문장을 추가 훈련 데이터로 간주함으로써 훈련 세트의 크기와 다양성을 효과적으로 증가시킨다.
- 기본 NMT 모델의 아키텍처에 어떠한 변경도 가하지 않으며, 기존 NTS 시스템과 호환된다.
- 실제 평행 데이터와 합성 데이터를 혼합하여 훈련함으로써 일반화 능력과 단순화 품질을 향상시킨다.
실험 결과
연구 질문
- RQ1평행 데이터가 부족한 상황에서 간단문장 코퍼스를 효과적으로 활용하여 신경망 텍스트 단순화 모델의 성능을 향상시킬 수 있는가?
- RQ2간단문장을 일반 문장으로 백트랜슬레이션하는 것이 NTS 성능에 의미 있는 향상을 가져오는가?
- RQ3아키텍처 수정 없이도 간단문장 코퍼스에서 유도된 합성 데이터 통합이 기존 SOTA 방법을 초월할 수 있는가?
- RQ4간단문장 코퍼스의 통합이 생성된 텍스트의 유창성, 문법성, 단순성에 어떤 영향을 미치는가?
- RQ5이 방법은 WikiLarge 및 WikiSmall과 같은 다양한 데이터셋에 일반화되는가?
주요 결과
- WikiLarge 데이터셋에서 NMT+synthetic 모델은 기준 NMT 모델 대비 BLEU 점수 2.11 포인트 향상하였다.
- NMT+synthetic 모델은 Flesch-Kincaid Grade Level(FKGL)을 1.7 포인트 감소시켜 독해력 향상을 시사하였다.
- 기준 모델 대비 SARI 점수는 1.07 포인트 향상되어 의미 유지 능력 향상을 나타내었다.
- 인간 평가 결과, NMT+synthetic는 PBMT-R, Dress, SBMT-SARI 대비 +0.42의 단순성 점수를 기록하여 유의미하게 뛰어난 성능을 보였다.
- WikiSmall에서 이 방법은 기준 NMT 모델 대비 BLEU 점수 6.37 포인트 향상되었으며, 더 작은 데이터셋에서도 강력한 성능 향상을 보였다.
- NMT+synthetic 모델은 WikiLarge 및 WikiSmall 양쪽에서 새로운 SOTA 성능을 달성하였으며, 기존에 보고된 최고 성능 모델인 Dress 및 SBMT-SARI를 뛰어넘었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.