[논문 리뷰] English Intermediate-Task Training Improves Zero-Shot Cross-Lingual Transfer Too
이 논문은 영어 언어 이해 작업에 대한 중간 작업 미세조정이 XTREME 벤치마크에서 제로샷 다국어 전이 성능을 크게 향상시킨다는 것을 보여준다. 목표 작업 미세조정 이전에 XLM-R을 고자원 영어 작업(MNLI, SQuAD, HellaSwag 등)으로 미세조정함으로써, 이 방법은 XLM-R Large 대비 평균 5.4점 향상률을 기록했으며, 2020년 6월 기준으로 새로운 최고 성능을 달성했다.
Intermediate-task training---fine-tuning a pretrained model on an intermediate task before fine-tuning again on the target task---often improves model performance substantially on language understanding tasks in monolingual English settings. We investigate whether English intermediate-task training is still helpful on non-English target tasks. Using nine intermediate language-understanding tasks, we evaluate intermediate-task transfer in a zero-shot cross-lingual setting on the XTREME benchmark. We see large improvements from intermediate training on the BUCC and Tatoeba sentence retrieval tasks and moderate improvements on question-answering target tasks. MNLI, SQuAD and HellaSwag achieve the best overall results as intermediate tasks, while multi-task intermediate offers small additional improvements. Using our best intermediate-task models for each target task, we obtain a 5.4 point improvement over XLM-R Large on the XTREME benchmark, setting the state of the art as of June 2020. We also investigate continuing multilingual MLM during intermediate-task training and using machine-translated intermediate-task data, but neither consistently outperforms simply performing English intermediate-task training.
연구 동기 및 목표
- 영어 데이터에서의 중간 작업 미세조정이 다국어 모델의 제로샷 다국어 전이 성능을 향상시키는지 조사하기 위해.
- 영어 단일 언어 설정에서의 중간 작업 미세조정의 이점이 다국어, 제로샷 다국어 전이로까지 확장되는지 평가하기 위해.
- 다른 전략(예: 다국어 MLM 계속 학습 또는 기계 번역된 중간 데이터 사용)이 단순한 영어 중간 작업 미세조정보다 우수한 성능을 내는지 평가하기 위해.
- XTREME 벤치마크의 다양한 목표 작업에서 가장 큰 향상을 이끌어내는 중간 작업은 무엇인지 파악하기 위해.
제안 방법
- 목표 작업 미세조정 이전에 사전 학습된 다국어 XLM-R 모델을 하나 이상의 영어 중간 작업으로 미세조정한 후, 최종 목표 작업에 대해 미세조정한다.
- XTREME 벤치마크의 아홉 가지 중간 작업을 사용한다: ANLI+, MNLI, QQP, SQuAD v1.1/v2.0, HellaSwag, CCG, Cosmos QA, CSQA.
- XTREME 벤치마크의 아홉 가지 목표 작업에서 40개 언어에 대해 제로샷 다국어 전이 성능을 평가한다.
- 단일 작업 중간 미세조정과 모든 아홉 개 작업에 대한 다중 작업 중간 미세조정을 비교한다.
- 두 가지 변형을 조사한다: (1) 중간 미세조정 기간 동안 다국어 MLM을 계속 학습하는 것, (2) 독일어, 러시아어, 스폣히리어로 번역된 중간 데이터를 사용하는 것.
- 개발 및 테스트 세트에서의 결과를 보고하며, 언어와 작업 간 평균 성능 향상에 중점을 둔다.
실험 결과
연구 질문
- RQ1영어 작업에서의 중간 작업 미세조정이 다국어 벤치마크에서의 제로샷 다국어 전이 성능을 향상시키는가?
- RQ2구체적으로 어떤 영어 중간 작업이 다국어 전이 성능 향상에서 가장 큰 성과를 내는가?
- RQ3중간 미세조정 기간 동안 다국어 MLM을 계속 학습하는 것이 표준 영어 전용 중간 미세조정보다 성능을 향상시키는가?
- RQ4다른 언어로 번역된 기계 번역 중간 데이터를 사용하는 것이 영어 데이터 전용 학습보다 다국어 전이 성능을 향상시키는가?
- RQ5다중 작업 중간 미세조정이 단일 작업 중간 미세조정에 비해 제로샷 일반화 성능에서 어떻게 다를까?
주요 결과
- MNLI, SQuAD v2.0, HellaSwag에서의 중간 작업 미세조정이 개발 세트에서 각각 7.5점, 8.2점, 7.0점의 가장 큰 향상을 기록했다.
- 아홉 개 작업 전부에 대한 다중 작업 중간 미세조정이 개발 세트에서 최고의 향상률인 8.7점의 성과를 기록했다.
- 이 방법은 전체 XTREME 벤치마크에서 XLM-R Large 대비 평균 5.4점 향상률을 기록했으며, 2020년 6월 기준으로 새로운 최고 성능을 달성했다.
- 영어 중간 작업 미세조정이 중간 미세조정 기간 동안 다국어 MLM을 계속 학습하거나 기계 번역된 중간 데이터를 사용하는 것보다 우수한 성능을 보였다.
- BUCC와 Tatoeba(문장 검색)에서 뚜렷한 향상이 관찰되었으며, 일부 경우에서 최대 30점 이상의 향상이 있었다.
- TyDiQA에서는 여러 중간 작업이 적용된 경우 일관된 향상이 있었지만, XNLI는 중간 작업 미세조정의 영향을 받지 않았다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.