Skip to main content
QUICK REVIEW

[논문 리뷰] DAGA: Data Augmentation with a Generation Approach for Low-resource Tagging Tasks

Bosheng Ding, Linlin Liu|arXiv (Cornell University)|2020. 11. 03.
Topic Modeling참고 문헌 44인용 수 6
한 줄 요약

이 논문은 선형화된 레이블 문장을 기반으로 훈련된 언어 모델을 사용하여 고품질의 합성 데이터를 생성하는 데이터 증강 방법인 DAGA를 제안한다. 생성 과정에서 단어-태그 쌍을 함께 모델링함으로써 DAGA는 다양하고 맥락이 풍부한 훈련 예제를 생성하여 모델의 일반화 능력을 향상시키며, 특히 귀한 레이블 데이터가 부족한 경우에도 일관되게 베이스라인을 능가한다. 이는 감독 및 준감독 설정에서 모두 NER, POS 태깅, 감성 분석 작업에서 성능 향상을 이룬다.

ABSTRACT

Data augmentation techniques have been widely used to improve machine learning performance as they enhance the generalization capability of models. In this work, to generate high quality synthetic data for low-resource tagging tasks, we propose a novel augmentation method with language models trained on the linearized labeled sentences. Our method is applicable to both supervised and semi-supervised settings. For the supervised settings, we conduct extensive experiments on named entity recognition (NER), part of speech (POS) tagging and end-to-end target based sentiment analysis (E2E-TBSA) tasks. For the semi-supervised settings, we evaluate our method on the NER task under the conditions of given unlabeled data only and unlabeled data plus a knowledge base. The results show that our method can consistently outperform the baselines, particularly when the given gold training data are less.

연구 동기 및 목표

  • 저자원 환경에서 특히 중요한 시퀀스 태깅 작업의 경우 부족한 애너테이션 훈련 데이터 문제를 해결하기 위해.
  • WordNet이나 대규모 사전 훈련 모델과 같은 외부 자원에 의존하지 않고도 고품질의 합성 데이터를 생성하는 데이터 증강 방법을 개발하기 위해.
  • 언어 모델 생성을 통해 다양하고 맥락이 다른 훈련 예제를 도입하여 모델의 강건성과 일반화 능력을 향상시키기 위해.
  • 비정규화된 데이터와 지식 기반 자료를 생성 과정에 통합함으로써 준감독 학습을 효과적으로 가능하게 하기 위해.
  • 이미 존재하는 데이터를 수정하는 것이 아니라, 처음부터 세밀한 토큰 수준의 태그를 생성하는 NLP 분야의 데이터 증강 신규 패러다임을 구축하기 위해.

제안 방법

  • 각 단어와 해당 태그를 연결하여 선형화된 문장을 구성함으로써 언어 모델링에 적합한 시퀀스를 생성한다 (예: "B-PER Jose").
  • 선형화된 시퀀스에 대해 일중 레이어 순환 언어 모델을 훈련시켜 단어-태그 동시 생성 패턴을 학습한다.
  • 훈련된 언어 모델에서 샘플링을 통해 합성 데이터를 생성하며, 높은 확률의 태그-단어 쌍을 선택하여 레이블 일관성을 유지한다.
  • 비정규화된 문장이나 지식 기반 항목에 조건을 걸어 생성 과정을 조정함으로써 준감독 설정으로의 확장을 실현한다. 이는 보조 데이터의 효과적 활용을 가능하게 한다.
  • 가용한 외부 지식(예: 엔티티 유형, 위치 등)을 조건부 생성에 통합하여 엔티티의 다양성과 현실성 향상을 도모한다.
  • 데이터 오버샘플링과 모델 파인튜닝을 적용하여 특히 귀한 레이블 데이터가 부족한 경우 성능 향상을 도모한다.

실험 결과

연구 질문

  • RQ1선형화된 애너테이션 문장에 기반한 언어 모델이 저자원 시퀀스 태깅 작업에서 성능 향상에 기여하는 합성 데이터를 생성할 수 있는가?
  • RQ2DAGA의 생성 기반 접근 방식은 동의어 교체나 약한 태깅과 같은 기존 데이터 증강 방법과 비교해 강건성과 성능 면에서 어떻게 다른가?
  • RQ3DAGA는 비정규화된 데이터나 지식 기반 자료를 얼마나 효과적으로 활용하여 준감독 설정에서 모델의 일반화 능력을 향상시킬 수 있는가?
  • RQ4생성된 맥락 기반 엔티티의 다양성이 시퀀스 태깅 모델의 성능 향상과 어떤 관련이 있는가?
  • RQ5DAGA의 성능는 귀한 훈련 데이터의 양이 변할수록 어떻게 변화하는가? 특히 저자원 환경에서의 성능 스케일링 능력은 어떠한가?

주요 결과

  • DAGA는 NER, POS 태깅, E2E-TBSA 등 다양한 시퀀스 태깅 작업에서 일관되게 강력한 베이스라인을 능가하며, 특히 귀한 훈련 데이터가 부족한 경우에 두드러진 성능 향상을 보인다.
  • 감독 설정에서 DAGA는 귀한 문장 2,000개만으로도 E2E-TBSA에서 최대 +4.2 F1 포인트, NER에서는 +2.8 F1 포인트의 F1 향상을 달성한다.
  • 지식 기반 자료를 사용할 경우, 2,000개 이상의 귀한 데이터 크기에서 DAGA의 방법(gen kb)이 베이스라인(kb)을 능가하며, 외부 지식의 노이즈에 대해서도 강건함을 입증한다.
  • DAGA는 많은 수의 새로운 맥락 기반 엔티티(CoN)를 생성하며, 새로운 CEs 비율이 귀한 CEs 비율과 정비례하여 F1 향상과 관련이 있음을 확인하여 모델의 일반화 능력 향상을 시사한다.
  • DAGA에서 생성된 합성 데이터는 의미 있는 다양성을 도입하며, 예를 들어 "Sandrine Nixon"이나 "Bank of Alabama"와 같은 새로운 이름-위치 조합을 생성함으로써 기억화 및 과적합을 줄인다.
  • 비정규화된 데이터의 활용은 귀한 데이터나 지식 기반 자료에 존재하지 않는 현실적인 엔티티를 생성하게 하여 원시 텍스트에서 효과적인 정보 추출이 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.