Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Non-autoregressive Generation with Mixup Training

Ting Jiang, Shaohan Huang|arXiv (Cornell University)|2021. 10. 21.
Topic Modeling참고 문헌 33인용 수 8
한 줄 요약

이 논문은 사전 훈련된 인코더 모델(예: BERT, UniLM)을 사용하여 비자기적 텍스트 생성 성능을 향상시키기 위해 동적으로 입력 소스를 모델이 생성한 가짜 타겟 시퀀스와 혼합하는 MIST라는 새로운 훈련 방법을 제안한다. 추론 속도에 영향을 주지 않으면서도 반복적 개선을 가능하게 함으로써, 요약, 질의 생성, 재구성 등 다양한 작업에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

While pre-trained language models have achieved great success on various natural language understanding tasks, how to effectively leverage them into non-autoregressive generation tasks remains a challenge. To solve this problem, we present a non-autoregressive generation model based on pre-trained transformer models. To bridge the gap between autoregressive and non-autoregressive models, we propose a simple and effective iterative training method called MIx Source and pseudo Target (MIST). Unlike other iterative decoding methods, which sacrifice the inference speed to achieve better performance based on multiple decoding iterations, MIST works in the training stage and has no effect on inference time. Our experiments on three generation benchmarks including question generation, summarization and paraphrase generation, show that the proposed framework achieves the new state-of-the-art results for fully non-autoregressive models. We also demonstrate that our method can be used to a variety of pre-trained models. For instance, MIST based on the small pre-trained model also obtains comparable performance with seq2seq models.

연구 동기 및 목표

  • 사전 훈련된 인코더 모델을 비자기적 텍스트 생성 작업에 효과적으로 적용하는 데 도전한다.
  • 자기적 모델과 비자기적 모델 간의 성능 격차를 해소하면서도 추론 속도를 희생하지 않는다.
  • 동적 데이터 증강을 통해 모델 수렴과 일반화를 향상시키는 훈련 전략을 개발한다.
  • 기존의 사전 훈련된 모델(예: BERT, UniLM)을 아키텍처 수정 없이 비자기적 생성에 활용할 수 있도록 한다.
  • 다양한 생성 작업과 사전 훈련된 모델 아키텍처에서 일관된 성능 향상을 입증한다.

제안 방법

  • 원본 소스 시퀀스와 모델이 생성한 가짜 타겟 시퀀스를 입력으로 혼합하는 MIST를 도입한다.
  • 훈련 중에 모델이 먼저 전체 타겟 시퀀스를 생성한 후, 이를 두 번째 순전파의 입력 소스로 간주한다.
  • 이 과정은 훈련 진행 상황에 따라 진화하는 모델 인지 기반의 동적 데이터 증강을 생성하며, 정렬도 향상시키고 과적합을 줄인다.
  • 혼합 입력에 대한 종속성을 모델링하기 위해 트랜스포머 디코더의 자체 어텐션과 교차 어텐션 메커니즘을 활용한다.
  • MIST는 미세조정 중에 적용되며 추론 과정에 영향을 주지 않아 비자기적 모델의 속도 우수성을 유지한다.
  • 조건부 종속성 모델링을 가능하게 하며, 오류를 일으킬 만한 토큰을 강조함으로써 잘못된 예측에 집중하도록 돕는다.

실험 결과

연구 질문

  • RQ1MIST와 같은 단순한 훈련 시 방법이 자기적 모델과 비자기적 모델 간의 성능 격차를 효과적으로 줄일 수 있는가?
  • RQ2소스와 가짜 타겟 시퀀스의 동적 믹스업이 비자기적 생성에서 일반화 및 수렴에 기여하는가?
  • RQ3MIST는 아키텍처 수정 없이 다양한 사전 훈련된 인코더 모델(예: BERT, UniLM, MiniLM)에 효과적으로 적용될 수 있는가?
  • RQ4MIST는 Mask-Predict와 같은 반복적 디코딩 방법과 비교해 성능 안정성과 수렴 속도 면에서 어떻게 다른가?
  • RQ5MIST를 통해 소형 사전 훈련된 모델이 대규모 자기적 또는 사전 훈련된 시퀀스-투-시퀀스 모델의 성능을 따라하거나 초월할 수 있는가?

주요 결과

  • MIST는 요약, 질문 생성, 재구성 등 세 가지 NLG 벤치마크에서 최신 기술 수준(SOTA)의 성능을 달성했다: SQuAD1.1(ROUGE-L 46.49), XSum(ROUGE-L 28.70), Quora(BLEU-4 29.77).
  • SQuAD1.1에서 MIST는 기준 모델 대비 ROUGE-L을 0.82점 향상시키며, 정적 믹스업 대비 0.75점 향상시켜 동적 데이터 증강의 우수성을 입증했다.
  • XSum에서 MIST는 기준 모델보다 수렴 속도가 더 빠르며, 훈련 스텝 수를 절반으로 줄여도 더 높은 성능을 달성했다.
  • Mask-Predict보다 반복적 디코딩에서 더 안정적인 성능 향상을 보였으며, 1, 3, 6회의 반복에서 모두 뛰어난 성능을 기록했으며, 특히 SQuAD1.1과 Quora에서 두드러졌다.
  • MiniLM에 MIST를 적용한 결과, BANG과 같은 대규모 자기적 모델 수준의 성능을 달성했으며, XSum에서 ROUGE-L 21.00, SQuAD1.1에서 BLEU-4 12.98의 성능을 기록했다.
  • MIST는 BERT와 UniLM 등의 사전 훈련된 NLU 모델을 활용해 뛰어난 성능을 내며, UniLM를 사용해 XSum에서 ROUGE-L 47.13의 성능을 기록했고, 일부 설정에서는 BANG을 초월했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.