Skip to main content
QUICK REVIEW

[논문 리뷰] s2s-ft: Fine-Tuning Pretrained Transformer Encoders for Sequence-to-Sequence Learning

Hangbo Bao, Li Dong|arXiv (Cornell University)|2021. 10. 26.
Topic Modeling참고 문헌 26인용 수 11
한 줄 요약

이 논문은 사전에 훈련된 양방향 트랜스포머(예: BERT, RoBERTa, UniLM)를 사용하여 순서-순서 생성 작업을 위한 세 가지 새로운 미세조정 전략인 인과적, 마스크된, 가짜 마스크된 미세조정을 사용하는 s2s-ft라는 툴킷을 소개한다. 통합된 자기주의 마스크와 공유된 모델 파라미터를 활용하여 s2s-ft는 단일 및 다국어 벤치마크에서 摘要 요약 및 질문 생성 작업에서 최신 기술 성능을 달성하며, T5-11B나 PEGASUS와 같은 더 큰 모델을 능가한다.

ABSTRACT

Pretrained bidirectional Transformers, such as BERT, have achieved significant improvements in a wide variety of language understanding tasks, while it is not straightforward to directly apply them for natural language generation. In this paper, we present a sequence-to-sequence fine-tuning toolkit s2s-ft, which adopts pretrained Transformers for conditional generation tasks. Inspired by UniLM, we implement three sequence-to-sequence fine-tuning algorithms, namely, causal fine-tuning, masked fine-tuning, and pseudo-masked fine-tuning. By leveraging the existing pretrained bidirectional Transformers, experimental results show that s2s-ft achieves strong performance on several benchmarks of abstractive summarization, and question generation. Moreover, we demonstrate that the package s2s-ft supports both monolingual and multilingual NLG tasks. The s2s-ft toolkit is available at https://github.com/microsoft/unilm/tree/master/s2s-ft.

연구 동기 및 목표

  • 사전에 훈련된 양방향 트랜스포머(예: BERT)를 순서-순서 생성 작업에 효과적으로 적용하는 데 도전하는 것 — 이 경우 양방향 어텐션 메커니즘이 직접적으로 적합하지 않다.
  • pre-training과 fine-tuning 목표 간 격차를 줄이기 위해 단일 트랜스포머 아키텍처 내에서 인코딩과 디코딩을 통합하는 것.
  • 기존 사전에 훈련된 모델을 다양한 조건부 생성 작업(예: 개괄적 요약, 질문 생성 포함)에 대해 미세조정할 수 있도록 유연하고 오픈소스 툴킷을 개발하는 것.
  • XLM-RoBERTa와 같은 모델을 사용하여 단일 및 다국어 생성 작업에서 제안된 접근법의 효과성을 입증하는 것.
  • 특정 작업을 위한 사전 훈련이나 대규모 모델 재훈련 없이도, 기존 사전에 훈련된 모델을 최소한의 아키텍처 변경으로 활용하여 뛰어난 성능을 달성할 수 있음을 보여주는 것.

제안 방법

  • s2s-ft 툴킷은 소스 및 타겟 시퀀스를 특수 토큰 [CLS], [SEP], [SOS]를 사용해 하나의 입력 시퀀스로 압축하는 통합된 트랜스포머 아키텍처를 사용한다.
  • 작업별 자기주의 어텐션 마스크를 적용하여 어텐션 범위를 제한한다: 소스 토큰은 양방향으로 어텐션을 받고, 타겟 토큰은 이전의 타겟 토큰과 소스 토큰만 어텐션한다. 이는 자동회귀 생성을 가능하게 한다.
  • 인과 미세조정은 타겟 토큰의 위치를 이동시켜 왼쪽에서 오른쪽 어텐션을 통해 자동회귀 예측을 가능하게 한다. 이는 인과적 언어 모델링과 유사하다.
  • 마스크된 미세조정은 훈련 중에 타겟 토큰을 무작위로 마스크하고 이를 예측함으로써 사전 훈련(마스크된 언어 모델링)과 미세조정 간의 불일치를 최소화한다.
  • 가짜 마스크된 미세조정은 각 타겟 토큰에 대해 가짜 마스크 토큰을 삽입하고, 동일한 위치 임베딩을 할당함으로써 인과적 및 마스크된 훈련의 장점을 결합한다.
  • 툴킷은 HuggingFace Transformers 기반으로 제작되었으며, RoBERTa 및 XLM-RoBERTa를 포함한 단일 및 다국어 모델을 지원하여, zero-shot 또는 few-shot 적응을 가능하게 한다.

실험 결과

연구 질문

  • RQ1BERT와 같은 사전에 훈련된 양방향 트랜스포머를 아키텍처 재설계 없이 순서-순서 생성 작업에 효과적으로 미세조정할 수 있는가?
  • RQ2인과적, 마스크된, 가짜 마스크된 세 가지 미세조정 전략이 개괄적 요약 및 질문 생성 작업에서 성능적으로 어떻게 비교되는가?
  • RQ3XLM-RoBERTa와 같은 오프더쇼프 사전에 훈련된 모델이 s2s-ft를 통해 다국어 생성 작업에서 뛰어난 성능을 낼 수 있는가?
  • RQ4s2s-ft에서 통합된 모델링 접근법이 pre-training과 fine-tuning 간 도메인 격차를 줄여 더 나은 일반화를 이끌어내는가?
  • RQ5s2s-ft는 특정 작업을 위한 사전 훈련이나 대규모 모델 재훈련 없이도 최신 기술 성능을 달성할 수 있는가?

주요 결과

  • UniLMv2-LARGE를 사용한 s2s-ft는 XSum에서 27.12 ROUGE-L, CNN/DailyMail에서 54.25 ROUGE-L을 기록하며, T5-11B나 PEGASUS와 같은 더 큰 모델을 능가한다.
  • RoBERTa-LARGE를 사용한 s2s-ft는 XSum에서 26.82 ROUGE-L, CNN/DailyMail에서 53.92 ROUGE-L을 기록하여 기본 크기의 모델임에도 강력한 성능을 보여준다.
  • 다국어 개괄적 요약 작업에서, XLM-RoBERTa-LARGE를 사용한 s2s-ft는 중국어 Gigaword에서 58.09 ROUGE-L, 프랑스어 Gigaword에서 55.04 ROUGE-L을 기록하며, XLM 및 XNLG 기반 모델을 초월한다.
  • 중국어 질문 생성 작업에서, XLM-RoBERTa-LARGE를 사용한 s2s-ft는 28.49 BLEU-4 및 52.94 METEOR를 기록하여 XLM 및 XNLG를 능가한다.
  • 가짜 마스크된 미세조정 방법은 모든 벤치마크에서 일관되게 최고의 성능을 기록하여, 사전 훈련과 미세조정 목표 간 균형을 잘 맞추는 효과적인 방법임을 시사한다.
  • 툴킷은 다국어 작업에서 강력한 zero-shot 및 few-shot 성능을 제공하며, 다국어 사전에 훈련된 모델이 최소한의 적응으로 생성 작업에 효과적으로 재사용될 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.