[논문 리뷰] Generating Syntactically Controlled Paraphrases without Using Annotated Parallel Pairs
이 논문은 별도의 애너테이션된 평행 쌍이 없이도 문법적 제어가 가능한 문장 어울림 생성을 가능하게 하기 위해 의미와 문법을 분리하는 SynPG라는 신경 어울림 생성기를 제안한다. 순서가 없는 단어 집합과 목표 문법 분석 트리를 사용하여 문장을 재구성하는 방식으로 훈련함으로써, 애너테이션된 데이터가 많을 경우 비감독 기반 모델에 비해 뛰어난 문법 제어 성능을 달성하고, 감독 기반 모델과 경쟁 가능한 성능을 보인다.
Paraphrase generation plays an essential role in natural language process (NLP), and it has many downstream applications. However, training supervised paraphrase models requires many annotated paraphrase pairs, which are usually costly to obtain. On the other hand, the paraphrases generated by existing unsupervised approaches are usually syntactically similar to the source sentences and are limited in diversity. In this paper, we demonstrate that it is possible to generate syntactically various paraphrases without the need for annotated paraphrase pairs. We propose Syntactically controlled Paraphrase Generator (SynPG), an encoder-decoder based model that learns to disentangle the semantics and the syntax of a sentence from a collection of unannotated texts. The disentanglement enables SynPG to control the syntax of output paraphrases by manipulating the embedding in the syntactic space. Extensive experiments using automatic metrics and human evaluation show that SynPG performs better syntactic control than unsupervised baselines, while the quality of the generated paraphrases is competitive. We also demonstrate that the performance of SynPG is competitive or even better than supervised models when the unannotated data is large. Finally, we show that the syntactically controlled paraphrases generated by SynPG can be utilized for data augmentation to improve the robustness of NLP models.
연구 동기 및 목표
- 비용이 많이 들는 애너테이션된 어울림 쌍에 의존하지 않고도 문법적 구조를 제어할 수 있는 어울림 생성 모델을 개발하는 것.
- 오직 애너테이션되지 않은 텍스트만을 사용하여 문장 내 의미적 의미와 문법적 구조를 분리하는 것.
- 명시적인 문법적 제어 신호를 통해 다양한 문법 형태를 가진 고품질의 어울림 생성을 가능하게 하는 것.
- 큰 애너테이션되지 않은 코퍼스에서 훈련된 모델이 감독 기반 기준 모델과 성능을 견줄 수 있는지 평가하는 것.
- SynPG가 생성한 어휘를 데이터 증강에 활용하여 하위 NLP 모델의 문법적 적대적 공격에 대한 강건성을 향상시킬 수 있음을 보여주는 것.
제안 방법
- 소스 문장을 재구성하기 위해 두 입력을 사용하는 트랜스포저 기반 인코더-디코더 모델(SynPG)을 훈련한다: 단어 집합 표현(의미 인코더)과 목표 구성 분석 트리(문법 인코더).
- 의미 인코더는 순열 불변 방식으로 단어를 처리하여 순수한 의미 임베딩을 추출한다.
- 문법 인코더는 목표 분석 트리를 컨텍스트 기반의 문법 표현으로 임베딩한다.
- 디코더에서 의미적 표현과 문법적 표현을 결합하여 의미는 유지하면서도 목표 문법 구조를 따르는 어휘를 생성한다.
- 애너테이션된 평행 어휘 쌍이 필요 없이, 애너테이션되지 않은 텍스트에서 재구성 손실을 통해 모델을 종합적으로 훈련한다.
- 추론 시기에 소스 문장과 원하는 목표 분석 트리를 제공하여 문법적 제어가 가능한 어휘를 생성한다.
실험 결과
연구 질문
- RQ1애너테이션된 어휘 쌍을 사용하지 않고도 문법적 제어가 가능한 어휘 생성이 가능한가?
- RQ2애너테이션되지 않은 텍스트에서 의미와 문법을 분리함으로써 어휘 생성에서 효과적인 문법 제어가 가능한가?
- RQ3SynPG의 문법 제어 성능은 비감독 기반 기준 모델에 비해 어떻게 비교되는가?
- RQ4큰 애너테이션되지 않은 데이터가 가용할 경우 SynPG가 감독 기반 모델과 경쟁 가능한 어휘 품질을 달성할 수 있는가?
- RQ5SynPG가 생성한 어휘는 데이터 증강을 통해 하위 NLP 모델의 강건성을 향상시킬 수 있는가?
주요 결과
- SynPG는 비감독 기반 기준 모델에 비해 문법 제어 성능이 뛰어나며, 목표 분석 트리의 구조와 유사한 어휘를 상당히 잘 생성한다.
- 인간 평가 결과, SynPG가 생성한 어휘는 문법 사양을 더 정확히 따르는 것으로 확인되었고, 동시에 자연어 수준의 유창성과 의미 유지 능력에서도 경쟁 수준을 유지한다.
- 충분한 애너테이션되지 않은 데이터가 확보될 경우, SynPG의 성능은 어휘 생성 과제에서 감독 기반 모델과 견줄 수 있거나 이를 초월한다.
- SynPG가 생성한 어휘를 통해 데이터 증강을 실시한 결과, 모델의 강건성이 향상되었다: GLUE 벤치마크에서 SynPG 데이터 증강을 적용한 모델은 문법적 적대적 공격에 대해 기준 모델 대비 유의미하게 낮은 성공률(예: RTE에서 33.9% 브레이크 대비 58.3%)을 보였다.
- 모델은 평행 데이터 없이도 문법 표현을 조작함으로써 의미 내용을 유지하면서 다양한 어휘를 효과적으로 생성한다.
- 이러한 접근은 어휘 쌍의 애너테이션이 부족한 저자원 도메인에서 특히 유용하며, 이는 애너테이션되지 않은 텍스트는 많지만 애너테이션된 어휘 쌍은 부족한 상황에서 유의미한 가치를 지닌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.