Skip to main content
QUICK REVIEW

[논문 리뷰] BARTpho: Pre-trained Sequence-to-Sequence Models for Vietnamese

Nguyen Luong Tran, Duong Minh Le|arXiv (Cornell University)|2021. 09. 20.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 20GB의 베트남어 코퍼스를 기반으로 BART의 디노이징 오토인코더 프레임워크를 사용해 훈련한, 음절 수준 및 어절 수준 버전을 모두 갖춘 베트남어를 위한 첫 번째 대규모 단일 언어 시퀀스 투 시퀀스 사전 훈련 모델인 BARTpho를 소개한다. BARTpho는 자동 평가와 인간 평가 모두에서 텍스트 요약 및 대문자/标점 복원 작업에서 mBART를 능가하며, 생성형 베트남어 NLP 작업의 새로운 최고 성능을 기록한다.

ABSTRACT

We present BARTpho with two versions, BARTpho-syllable and BARTpho-word, which are the first public large-scale monolingual sequence-to-sequence models pre-trained for Vietnamese. BARTpho uses the "large" architecture and the pre-training scheme of the sequence-to-sequence denoising autoencoder BART, thus it is especially suitable for generative NLP tasks. We conduct experiments to compare our BARTpho with its competitor mBART on a downstream task of Vietnamese text summarization and show that: in both automatic and human evaluations, BARTpho outperforms the strong baseline mBART and improves the state-of-the-art. We further evaluate and compare BARTpho and mBART on the Vietnamese capitalization and punctuation restoration tasks and also find that BARTpho is more effective than mBART on these two tasks. We publicly release BARTpho to facilitate future research and applications of generative Vietnamese NLP tasks. Our BARTpho models are available at https://github.com/VinAIResearch/BARTpho

연구 동기 및 목표

  • 생성형 NLP 작업에 필수적인 대규모 단일 언어 시퀀스 투 시퀀스 사전 훈련 모델의 부족을 해결하기 위해.
  • 언어의 고유한 음절-어절 구조를 고려할 때, 어절 분할이 사전 훈련 효과성에 미치는 영향을 조사하기 위해.
  • 텍스트 요약, 대문자 복원, 문장 부호 복원과 같은 생성형 작업의 성능을 향상시키기 위해.
  • 미래의 베트남어 NLP 연구를 위한 강력한 베이스라인으로 사용할 수 있도록 공개적으로 이용 가능한 고품질의 사전 훈련 모델을 제공하기 위해.
  • 특정 언어에 특화된 단일 언어 모델이 베트남어 NLP 작업에서 다국어 모델보다 뛰어난 성능을 내는지 입증하기 위해.

제안 방법

  • 20GB의 단일 언어 베트남어 코퍼스를 기반으로 BART의 디노이징 오토인코더 프레임워크를 사용해 BARTpho 음절 및 BARTpho 어절 버전을 사전 훈련한다.
  • BART와 동일한 사전 훈련 목표를 갖춘 대규모 아키텍처를 사용하여, 시퀀스를 마스킹하고 재구성함으로써 문맥적 표현을 학습한다.
  • BARTpho 어절 버전의 경우, VnCoreNLP의 RDRSegmenter를 사용해 어절 수준 입력을 처리한다.
  • 검증 손실 기반 조기 정지 기법을 사용한 표준 미세 조정 절차를 통해 다운스트림 작업에 모델을 미세 조정한다.
  • 표준 평가 지표를 사용해 성능을 평가한다: 요약 작업에는 ROUGE, 대문자 및 문장 부호 복원 작업에는 F1을 사용한다.
  • 공개된 모델의 간편한 통합 및 배포를 위해 Hugging Face의 transformers 및 fairseq 라이브러리를 활용한다.

실험 결과

연구 질문

  • RQ1다국어 기반 모델 대비 단일 언어 시퀀스 투 시퀀스 사전 훈련이 베트남어 생성형 NLP 작업 성능에 크게 기여하는가?
  • RQ2베트남어 시퀀스 투 시퀀스 모델에서 어절 수준 사전 훈련이 음절 수준 사전 훈련보다 우수한가?
  • RQ3ASR 전사본에서 대문자 및 문장 부호 복원 작업에서 BARTpho 모델은 mBART보다 얼마나 효과적인가?
  • RQ4BARTpho는 베트남어 텍스트 요약 작업에서 최고 성능을 달성할 수 있는가?
  • RQ5언어적 구조—특히 어절 분할—는 베트남어에서 사전 훈련된 시퀀스 투 시퀀스 모델의 성능에 얼마나 영향을 미치는가?

주요 결과

  • BARTpho는 자동 평가(ROUGE)와 인간 평가 모두에서 텍스트 요약 작업에서 mBART를 능가하며, 새로운 최고 성능을 기록했다.
  • BARTpho 어절은 대문자 복원 작업에서 mBART보다 1.1% 높은 F1 점수를 기록했고, 문장 부호 복원 작업에서는 0.7% 높은 F1 점수를 기록했다.
  • 문장 부호 복원 작업에서 BARTpho 어절은 BARTpho 음절 및 mBART를 모두 앞서는 최고의 총합 F1 점수를 기록했다.
  • 문장 부호 '마침표'의 경우, mBART가 BARTpho 어절 및 음절 버전보다 약간 높은 성능을 보였지만, 격차는 극히 미미했다(각각 0.14% 및 0.4% 향상).
  • 쉼표 및 물음표 문장 부호 복원 작업에서 BARTpho 음절 및 BARTpho 어절 모두 mBART를 뛰어넘었으며, 뚜렷한 성능 격차를 보였다.
  • 모든 작업에서 BARTpho 어절이 BARTpho 음절을 일관되게 능가함으로써, 어절 분할이 베트남어에서 사전 훈련 효과성을 향상시킨다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.