Skip to main content
QUICK REVIEW

[논문 리뷰] Back-Translated Task Adaptive Pretraining: Improving Accuracy and Robustness on Text Classification

Junghoon Lee, Jounghee Kim|arXiv (Cornell University)|2021. 07. 22.
Topic Modeling참고 문헌 36인용 수 6
한 줄 요약

이 논문은 텍스트 분류 성능을 향상시키기 위해 제한된 태스크별 데이터를 백트랜스레이션을 통해 증강함으로써 언어 모델의 일반화 능력을 향상시키는 Back-Translated Task-Adaptive Pretraining (BT-TAPT)를 제안한다. 원본 데이터와 백트랜스레이티드 데이터 양쪽에서 재학습함으로써 BT-TAPT는 저자원 및 노이즈가 있는 데이터셋에서 특히 더 높은 정확도와 강건성을 달성하며, 표준 피니튜닝 및 태스크적응형 전학습보다 뛰어난 성능을 보인다.

ABSTRACT

Language models (LMs) pretrained on a large text corpus and fine-tuned on a downstream text corpus and fine-tuned on a downstream task becomes a de facto training strategy for several natural language processing (NLP) tasks. Recently, an adaptive pretraining method retraining the pretrained language model with task-relevant data has shown significant performance improvements. However, current adaptive pretraining methods suffer from underfitting on the task distribution owing to a relatively small amount of data to re-pretrain the LM. To completely use the concept of adaptive pretraining, we propose a back-translated task-adaptive pretraining (BT-TAPT) method that increases the amount of task-specific data for LM re-pretraining by augmenting the task data using back-translation to generalize the LM to the target task domain. The experimental results show that the proposed BT-TAPT yields improved classification accuracy on both low- and high-resource data and better robustness to noise than the conventional adaptive pretraining method.

연구 동기 및 목표

  • 제한된 레이블된 데이터가 존재할 때 태스크적응형 전학습의 과소적합 문제를 해결하기 위해.
  • 사전학습된 언어 모델의 특정 다운스트림 태스크 도메인으로의 일반화 능력을 향상시키기 위해.
  • 다양한 유형의 노이즈 또는 변형된 입력 텍스트에 대한 모델의 강건성을 향상시키기 위해.
  • 백트랜스레이션을 사전학습 단계에서 데이터 증강 전략으로 활용할 수 있는지 탐색하기 위해.

제안 방법

  • 먼저 원본 태스크 데이터를 대상으로 표준 태스크적응형 전학습(TAPT)을 수행한다.
  • 영어-독일어 기계 번역 모델을 활용해 태스크 데이터의 다의어 어휘를 재작성한 증강 데이터를 생성한다.
  • 핵심 샘플링(top-p)과 빔 서치를 사용하여 다양하면서도 의미가 유지된 다의어 어휘를 생성한다.
  • 증강된 데이터를 사용해 이미 적응형 전학습된 언어 모델을 추가로 재학습한다.
  • 최종 모델은 레이블된 데이터에서 피니튜닝되며, 도메인 특화 및 다양한 다의어 어휘 전학습의 이점을 모두 얻는다.
  • 이 방법은 BERT와 RoBERTa를 사용하여 여섯 개의 텍스트 분류 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1사전학습 단계에서 백트랜스레이션 기반 데이터 증강이 저자원 텍스트 분류 태스크의 성능 향상에 기여하는가?
  • RQ2표준 피니튜닝 또는 TAPT에 비해 BT-TAPT는 다양한 유형의 입력 노이즈에 대해 모델의 강건성을 향상시키는가?
  • RQ3고자원 및 저자원 데이터셋 모두에서 정확도와 일반화 능력 측면에서 BT-TAPT는 표준 전학습 및 TAPT에 비해 어떻게 비교되는가?
  • RQ4백트랜스레이션으로 생성된 다의어 어휘가 태스크적응형 전학습의 도메인 커버리지 확장을 효과적으로 가능하게 하는가?

주요 결과

  • BT-TAPT는 여섯 개의 텍스트 분류 데이터셋 전반에서 표준 전학습 및 TAPT보다 높은 분류 정확도를 달성했다.
  • 단지 100개의 학습 문장만 있는 IMDB 데이터셋에서 BT-TAPT는 뚜렷한 성능 향상을 보이며 저자원 환경에서의 효과성을 입증했다.
  • BT-TAPT는 동의어 교체, 문자 수준의 손상, 불변성 테스트 변형 등 모두 다섯 가지 노이즈 유형에서 정확도 향상을 기록했으며, TAPT는 때로 성능 저하를 보였다.
  • 백트랜스레이션 기반 노이즈(BT 빔 및 BT top-p)에 대해서는 BT-TAPT가 항상 TAPT를 앞서며 정확도 향상에서 뚜렷한 격차를 보였다.
  • 성능 변동성이 감소하여 모델의 안정성과 일반화 능력 향상이 확인되었다.
  • BT-TAPT는 노이즈가 있는 입력 처리에 특히 효과적이었으며, 실세계 적용 환경에서의 강건성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.