Skip to main content
QUICK REVIEW

[논문 리뷰] GENIUS: Sketch-based Language Model Pre-training via Extreme and Selective Masking for Text Generation and Augmentation

Biyang Guo, Yeyun Gong|arXiv (Cornell University)|2022. 11. 18.
Topic Modeling인용 수 4
한 줄 요약

GENIUS는 극도로 선택적 마스킹을 통해 최소한의 핵심 정보(스케치)에서 전체 텍스트를 복원하도록 사전 훈련된 스케치 기반 텍스트 생성 모델로, 높은 품질과 다양성을 갖춘 생성을 가능하게 한다. 이는 피처에 특화된 스케치를 추출하고 의미적으로 풍부하며 다양한 훈련 샘플을 생성하는 데이터 증강 방법인 GeniusAug를 구동하며, 피드백 조정 없이도 텍스트 분류, NER, MRC 작업 전반에서 성능을 크게 향상시킨다.

ABSTRACT

We introduce GENIUS: a conditional text generation model using sketches as input, which can fill in the missing contexts for a given sketch (key information consisting of textual spans, phrases, or words, concatenated by mask tokens). GENIUS is pre-trained on a large-scale textual corpus with a novel reconstruction from sketch objective using an extreme and selective masking strategy, enabling it to generate diverse and high-quality texts given sketches. Comparison with other competitive conditional language models (CLMs) reveals the superiority of GENIUS's text generation quality. We further show that GENIUS can be used as a strong and ready-to-use data augmentation tool for various natural language processing (NLP) tasks. Most existing textual data augmentation methods are either too conservative, by making small changes to the original text, or too aggressive, by creating entirely new samples. With GENIUS, we propose GeniusAug, which first extracts the target-aware sketches from the original training set and then generates new samples based on the sketches. Empirical experiments on 6 text classification datasets show that GeniusAug significantly improves the models' performance in both in-distribution (ID) and out-of-distribution (OOD) settings. We also demonstrate the effectiveness of GeniusAug on named entity recognition (NER) and machine reading comprehension (MRC) tasks. (Code and models are publicly available at https://github.com/microsoft/SCGLab and https://github.com/beyondguo/genius)

연구 동기 및 목표

  • 마스크 토큰을 사용하여 핵심 어휘나 어간만 유지하고 나머지 텍스트를 마스킹함으로써, 텍스트 생성 모델이 최소한의 스케치 입력(핵심 어휘나 어구)으로도 일관되고 다양한 텍스트를 생성하도록 하는 조건부 언어 모델을 개발하는 것.
  • 기존 텍스트 복원 모델의 한계를 극복하기 위해, 낮은 마스킹 비율로 제한되고 고도로 손상된 입력을 처리할 수 없는 문제를 해결하는 것.
  • 희귀하고 선택적인 마스킹 전략을 사용하여, 희박한 스케치에서 강력한 복원 능력을 갖춘 사전 훈련 목표를 설계하는 것.
  • GENIUS가 다양한 NLP 작업에 적용 가능한 강력하고 즉시 사용 가능한 데이터 증강 도구로 활용될 수 있음을 입증하는 것.
  • 핵심 의미를 유지하면서 다양한 맥락을 생성함으로써 다양성과 품질의 균형을 이루는 데이터 증강 전략을 설계하는 것.

제안 방법

  • 극도로 높은 비율의 토큰을 마스킹하는 극단적 마스킹과 중요하고 정보성 있는 어구를 대상으로 하는 선택적 마스킹을 적용한 새로운 스케치 복원 목표를 사용하여, 대규모 코퍼스에서 GENIUS를 사전 훈련하는 것.
  • 스케치 요소를 표현하기 위해 마스크 토큰을 사용하며, 핵심 어휘나 어구만 유지하고 나머지 텍스트는 마스킹하는 방식을 취하는 것.
  • 이름 엔티티, 감성을 담고 있는 어구 등 중요한 의미 단위를 우선적으로 유지함으로써, 중요도에 따라 우선순위를 정한 선택적 마스킹 전략을 적용하는 것.
  • 사전 훈련된 GENIUS 모델을 활용하여 스케치 입력에 조건부로 일관되고 다양하며 전체 텍스트를 생성하는 것.
  • GeniusAug를 설계: 원본 훈련 데이터에서 작업에 특화된 스케치를 추출하고, 이를 기반으로 GENIUS를 사용해 새로운 훈련 샘플을 생성하는 것.
  • 특정 작업에 맞는 피드백 조정 없이도, 즉시 사용 가능한 데이터 증강을 가능하게 하기 위해 GeniusAug를 최종 NLP 파ip라인에 통합하는 것.

실험 결과

연구 질문

  • RQ1언어 모델이 핵심 어휘나 어구로만 구성된 극도로 마스킹된 입력에서 일관되고 다양하며 전체 텍스트를 효과적으로 복원할 수 있는가?
  • RQ2사전 훈련 단계에서 극단적이고 선택적인 마스킹 전략을 사용할 경우, 기존의 표준 마스킹 전략 대비 일반화 능력과 생성 품질이 향상되는가?
  • RQ3GENIUS를 통한 스케치 기반 생성이 하류 NLP 작업에 대해 강력하고 제어 가능한 데이터 증강 방법으로 기능할 수 있는가?
  • RQ4GeniusAug는 EDA, MLM 기반 등의 보수적 방법과 LAMBADA와 같은 공격적 방법에 비해 다양성, 품질, 하류 성능 측면에서 어떻게 비교되는가?
  • RQ5GeniusAug는 분포 내 및 분포 외 설정 모두에서 모델의 일반화 능력을 어느 정도 향상시킬 수 있는가?

주요 결과

  • GeniusAug는 여섯 개의 텍스트 분류 데이터셋에서 모델 성능을 크게 향상시켰으며, 분포 내 및 분포 외 설정에서 평균 F1 점수 최대 4.2% 향상됨.
  • 특히 자원이 제한된 상황에서 EDA, 역역번역, MLM 기반 방법과 같은 강력한 베이스라인보다 다양성과 하류 정확도 측면에서 뛰어난 성능을 보임.
  • 명시적 개체 인식 및 기계적 독해 이해 작업에서도 최고 수준 또는 경쟁 가능한 성능 기록으로 광범위한 적용 가능성을 입증함.
  • 원본 텍스트와 강한 의미적 유사성을 유지하면서도 의미 있는 구조적 및 어휘적 다양성을 도입하여 고품질의 샘플을 생성함으로써, 보수적 또는 공격적 증강의 단점을 피함.
  • 사전 훈련된 GENIUS 모델은 피드백 조정 없이도 제로샷 데이터 증강을 가능하게 하며, 하류 데이터에서의 추가 피드백 조정을 통해 성능 향상이 추가로 가능함.
  • LAMBADA와 같은 AR 기반 방법보다 GeniusAug는 핵심 의미를 유지하면서 다양한 맥락을 생성함으로써 더 제어 가능함으로써, 낮은 품질이나 관련 없는 샘플의 위험을 줄임.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.