[논문 리뷰] ProphetNet-X: Large-Scale Pre-training Models for English, Chinese, Multi-lingual, Dialog, and Code Generation
ProphetNet-X는 ProphetNet 아키텍처를 기반으로 한 대규모 사전 훈련 모델의 통합 가족을 제안하며, 영어, 중국어, 다국어, 대화, 코드 생성 작업으로 확장한다. 단일 모델 구조를 공유하고 미래 n-gram 예측을 활용함으로써 10개의 벤치마크(요약, 질의 생성, 코드 요약 포함)에서 최신 기술 성능을 달성한다. 공개 모델과 미세조정 스크립트를 제공한다.
Now, the pre-training technique is ubiquitous in natural language processing field. ProphetNet is a pre-training based natural language generation method which shows powerful performance on English text summarization and question generation tasks. In this paper, we extend ProphetNet into other domains and languages, and present the ProphetNet family pre-training models, named ProphetNet-X, where X can be English, Chinese, Multi-lingual, and so on. We pre-train a cross-lingual generation model ProphetNet-Multi, a Chinese generation model ProphetNet-Zh, two open-domain dialog generation models ProphetNet-Dialog-En and ProphetNet-Dialog-Zh. And also, we provide a PLG (Programming Language Generation) model ProphetNet-Code to show the generation performance besides NLG (Natural Language Generation) tasks. In our experiments, ProphetNet-X models achieve new state-of-the-art performance on 10 benchmarks. All the models of ProphetNet-X share the same model structure, which allows users to easily switch between different models. We make the code and models publicly available, and we will keep updating more pre-training models and finetuning scripts.
연구 동기 및 목표
- 다양한 자연어 생성 작업과 다국어, 다양한 도메인에 대응할 수 있도록 ProphetNet 프레임워크를 확장하는 것.
- 다양한 언어와 도메인 작업 간을 원활하게 전환할 수 있는 통합 모델 아키텍처를 개발하는 것.
- 영어, 중국어, 다국어, 대화, 코드 데이터를 포함한 대규모이고 다양한 코퍼스에서 사전 훈련된 모델을 개발하는 것.
- NLG, 대화, 코드 생성 작업 분야의 10개 공개 벤치마크에서 최신 기술 성능을 달성하는 것.
- 광범위한 접근성과 재사용을 위해 오픈소스 모델과 미세조정 스크립트를 공개하는 것.
제안 방법
- ProphetNet-X 모델은 다중 스트림 자기주의와 미래 n-gram 예측을 사용하는 Transformer 인코더-디코더 아키텍처를 기반으로 한다.
- 표준 언어 모델링 손실과 미래 n-gram 예측 손실을 조합한 손실 함수를 최적화하며, 이는 학습 가능한 계수 αj로 가중된다.
- 각 모델 버전(예: ProphetNet-En, ProphetNet-Zh, ProphetNet-Dialog-En)은 동일한 모델 구조를 사용하지만, 다른 어휘와 사전 훈련 코퍼스를 사용한다.
- 대규모 도메인 전용 코퍼스에서 사전 훈련을 수행한다: 영어 및 중국어 텍스트 160GB, 다국어용 1.5TB Common Crawl, 대화용 60M Reddit 대화 세션, 코드 생성용 10M 코드 스니펫.
- 미래 n-gram 예측 메커니즘은 자동회귀 예측을 대체하여 다음 n개 토큰을 동시에 예측함으로써 생성의 유창성과 일관성을 향상시킨다.
- 모델 선택은 단일 설정 파일 변경만으로 가능하며, 표준 미세조정 스크립트를 사용해 다운스트림 작업에 적용한다.
실험 결과
연구 질문
- RQ1통합 사전 훈련 아키텍처가 다양한 자연어 생성 작업에서 최신 기술 성능을 달성할 수 있는가?
- RQ2미래 n-gram 예측은 다국어, 대화, 코드 생성 환경에서 생성 품질을 어떻게 향상시키는가?
- RQ3아키텍처 변경 없이도 단일 모델 구조가 언어와 도메인 간에 얼마나 잘 일반화되는가?
- RQ4다양하고 대규모 코퍼스에서 사전 훈련하면 자원이 적거나 전문화된 생성 작업에서 성능 향상이 이루어지는가?
- RQ5동일한 모델 아키텍처가 자연어와 프로그래밍 언어 생성 작업 양쪽에서 뛰어난 성능을 낼 수 있는가?
주요 결과
- ProphetNet-En은 ROUGE-L 점수가 40.2인 MSNews 요약 벤치마크에서 BART 및 이전 모델을 능가하는 새로운 최신 기술 성능을 기록했다.
- ProphetNet-Dialog-Zh는 평가자 간 Fleiss’ Kappa > 0.6를 기록하며, 검색 기반의 Xiaoice 시스템에 비해 인간 평가에서 뚜렷한 승리를 거두었다.
- ProphetNet-Code는 CNN/DM 데이터셋에서 스무딩 BLEU-4 점수가 32.7인 CodeXGLUE 코드 요약 벤치마크에서 최신 기술 성능을 달성했다.
- ProphetNet-En은 ROUGE-L 점수가 51.5인 SQuAD 1.1 질의 생성 벤치마크에서 BART와 MASS를 능가하며 새로운 최신 기술 성능을 기록했다.
- ProphetNet-Multi는 XGLUE NTG 및 QG 벤치마크에서 최신 기술 성능을 기록하며 강력한 다국어 생성 능력을 입증했다.
- 모든 ProphetNet-X 모델은 동일한 아키텍처를 공유하며, 모델 파일과 어휘만 변경하면 작업 간 전환을 쉽게 할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.