Skip to main content
QUICK REVIEW

[논문 리뷰] G-DAUG: Generative Data Augmentation for Commonsense Reasoning

Yiben Yang, Chaitanya Malaviya|arXiv (Cornell University)|2020. 04. 24.
Topic Modeling인용 수 14
한 줄 요약

G-DAUG^C는 사전 훈련된 언어 모델을 사용하여 다양한 고품질의 훈련 예제를 생성하는 생성적 데이터 증강 방법을 제안한다. 이는 공공이성 추론을 위한 저자원 벤치마크에서 성능을 크게 향상시킨다. 이는 백트랜슬레이션 기반 방법을 능가하며, WinoGrande, CODAH, CommonsenseQA에서 새로운 최고 성능을 기록한다. 또한 분포 이탈 및 악성 예측에 대한 강건성도 향상시킨다.

ABSTRACT

Recent advances in commonsense reasoning depend on large-scale human-annotated training data to achieve peak performance. However, manual curation of training examples is expensive and has been shown to introduce annotation artifacts that neural models can readily exploit and overfit on. We investigate G-DAUG^C, a novel generative data augmentation method that aims to achieve more accurate and robust learning in the low-resource setting. Our approach generates synthetic examples using pretrained language models, and selects the most informative and diverse set of examples for data augmentation. In experiments with multiple commonsense reasoning benchmarks, G-DAUG^C consistently outperforms existing data augmentation methods based on back-translation, and establishes a new state-of-the-art on WinoGrande, CODAH, and CommonsenseQA. Further, in addition to improvements in in-distribution accuracy, G-DAUG^C-augmented training also enhances out-of-distribution generalization, showing greater robustness against adversarial or perturbed examples. Our analysis demonstrates that G-DAUG^C produces a diverse set of fluent training examples, and that its selection and training approaches are important for performance. Our findings encourage future research toward generative data augmentation to enhance both in-distribution learning and out-of-distribution generalization.

연구 동기 및 목표

  • 인간이 애너테이션한 공공이성 추론 데이터셋의 높은 비용과 애너테이션 아티팩트 문제를 해결하기 위해.
  • 라벨이 부족한 저자원 환경에서 모델의 일반화 능력을 향상시키기 위해.
  • 다양하고 유창하며 정보가 풍부한 합성 예제를 생성하는 데이터 증강 방법을 개발하기 위해.
  • 공공이성 추론 모델의 내분포 성능과 외분포 강건성 모두를 향상시키기 위해.
  • 다양한 언어 패턴을 가진 합성 데이터를 도입하여 애너테이션 아티팩트에 대한 모델 과적합을 줄이기 위해.

제안 방법

  • 사전 훈련된 언어 모델을 사용하여 합성 훈련 예제를 생성하여 훈련 데이터 분포를 확장한다.
  • 생성된 집합에서 가장 정보가 풍부하고 다양한 예제를 유지하기 위한 선택 기법을 적용한다.
  • 피넷튜닝 중에 고품질 합성 예제를 우선순위로 하는 교육 과정 유사 전략을 활용한다.
  • 생성된 예제의 유창성과 의미적 다양성을 활용하여 모델의 일반화 능력을 향상시킨다.
  • 신뢰도 기반 필터링 단계를 통해 저품질 또는 관련성이 없는 합성 예제를 제외한다.
  • 생성적 증강과 표준 피넷튜닝을 조합하여 최종 벤치마크에서의 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1제한된 라벨 데이터가 있는 공공이성 추론 벤치마크에서 생성적 데이터 증강이 성능 향상에 기여할 수 있는가?
  • RQ2G-DAUG^C는 백트랜슬레이션 기반 방법에 비해 더 다양한 유창한 훈련 예제를 생성하는가?
  • RQ3G-DAUG^C는 외분포 일반화 능력과 악성 예측에 대한 강건성 향상에 어느 정도 기여하는가?
  • RQ4G-DAUG^C의 선택 및 훈련 전략은 성능 향상에 어떤 기여를 하는가?
  • RQ5대규모 언어 모델을 통해 생성된 합성 데이터는 공공이성 데이터셋에서 애너테이션 아티팩트에 대한 과적합을 줄일 수 있는가?

주요 결과

  • G-DAUG^C는 WinoGrande에서 새로운 최고 성능을 기록하며 내분포 정확도가 향상된 것으로 나타났다.
  • CODAH 및 CommonsenseQA에서도 새로운 최고 성능을 기록하여 여러 벤치마크에서 일관된 성능 향상을 보였다.
  • G-DAUG^C로 피넷튜닝된 모델은 기준 모델 대비 악성 및 변형된 입력에 대해 더 강건한 성능을 보였다.
  • 이 방법은 다양한 유창한 합성 예제를 생성하여 더 나은 일반화 능력을 기여한다.
  • 선택 및 훈련 절차가 성능 향상에 핵심적인 역할을 하며, 제거 시 뚜렷한 성능 저하가 발생하는 것으로 애널리시스에서 확인되었다.
  • G-DAUG^C는 생성적 증강을 통해 언어적 다양성을 도입하여 애너테이션 아티팩트에 대한 과적합을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.