[논문 리뷰] LINDA: Unsupervised Learning to Interpolate in Natural Language Processing
LINDA는 히ュ리스틱이나 수동 자원에 의존하지 않고 자연어 문장 간의 보간을 수행하는 비지도 학습 신경망 방법을 제안한다. 혼합 비율에 기반해 조건부 언어 모델을 훈련시켜 보간 텍스트를 생성함으로써, LINDA는 효과적인 미스업 기반 데이터 증강을 가능하게 하여 도메인 내, 도메인 외, 저자원 환경에서 텍스트 분류의 일반화 성능을 크게 향상시킨다.
Despite the success of mixup in data augmentation, its applicability to natural language processing (NLP) tasks has been limited due to the discrete and variable-length nature of natural languages. Recent studies have thus relied on domain-specific heuristics and manually crafted resources, such as dictionaries, in order to apply mixup in NLP. In this paper, we instead propose an unsupervised learning approach to text interpolation for the purpose of data augmentation, to which we refer as "Learning to INterpolate for Data Augmentation" (LINDA), that does not require any heuristics nor manually crafted resources but learns to interpolate between any pair of natural language sentences over a natural language manifold. After empirically demonstrating the LINDA's interpolation capability, we show that LINDA indeed allows us to seamlessly apply mixup in NLP and leads to better generalization in text classification both in-domain and out-of-domain.
연구 동기 및 목표
- 텍스트의 이산적이고 길이가 변하는 성격으로 인해 NLP에 미스업을 적용하는 데 도전하는 문제를 해결하기 위해.
- 텍스트 보간에 도메인 특화 히ュ리스틱이나 사전에 수동으로 정렬된 자원(예: 사전)에 의존하지 않기 위해.
- 자연어 다양체 위에서 의미적으로 일관되며, 혼합 비율에 의해 제어 가능한 보간 문장을 생성하는 신경망 보간 연산자 학습하기 위해.
- 학습된 보간이 텍스트 분류 작업에서 미스업을 통한 효과적인 데이터 증강을 가능하게 하는지 평가하기 위해.
제안 방법
- 텍스트 보간을 두 개의 입력 문장과 혼합 비율 α ∈ [0,1]에 조건부로 작동하는 조건부 언어 모델의 샘플링으로 정의한다.
- 두 입력 문장이 모두 높은 가능도를 가지도록, 혼합 비율 α에 의해 상대적 가능도가 조절되는 보간 텍스트를 생성하는 시퀀스-투-시퀀스 모델(파인튜닝된 BART)을 훈련한다.
- 잠재 공간에서 보간 출력이 두 입력에 가까워지도록 하되, 다양성은 유지하기 위해 대조 학습 목적 함수를 사용한다.
- 학습된 보간을 미스업 훈련에 즉각 통합하여, f_int^x와 f_int^y를 통해 혼합 입력과 소프트 레이블을 생성한다.
- 교차 엔트로피 손실과 대조 손실의 조합을 사용해 모델을 최적화함으로써 두 원본 문장에 대한 의미적 충실도를 유지한다.
- 다양한 문장 쌍을 통해 보간 패턴을 학습하기 위해 중간 크기의 위키백과 코퍼스에서 모델을 파인튜닝한다.
실험 결과
연구 질문
- RQ1신경망이 임의의 자연어 문장 쌍 간에 의미적으로 일관되며, 혼합 비율에 의해 제어 가능한 방식으로 보간을 학습할 수 있는가?
- RQ2LINDA를 통한 비지도 보간이 미스업에 통합되었을 때 NLP에서 효과적인 데이터 증강을 가능하게 하는가?
- RQ3도메인 내 및 도메인 외 일반화 성능 측면에서 LINDA는 히ュ리스틱 기반 및 모델 기반 데이터 증강 방법보다 어떻게 비교되는가?
- RQ4라벨이 부족한 저자원 환경에서 LINDA는 모델 성능 향상에 기여하는가?
- RQ5혼합 비율 α에 대해 보간 행동이 단조롭고 예측 가능한가?
주요 결과
- LINDA는 다양한 입력 쌍 간에 의미적으로 일관된 보간 문장을 생성하며, 정성적 분석을 통해 혼합 비율에 따른 제어 가능한 보간이 확인되었다.
- 자동화된 지표는 혼합 비율 α와 원본 문장에 대한 유사도 사이에 단조로운 관계를 보여주어 제어 가능성의 확인을 하였다.
- 저자원 설정(클래스당 5개 또는 10개의 예시)에서 LINDA는 TREC-fine(5샷)를 제외한 모든 데이터셋에서 EDA, SSMBA, 및 미스업을 능가했으며, 성능은 표준편차 내에 머물렀다.
- 풀리소스 설정에서는 LINDA가 일곱 개 데이터셋 중 네 개에서 가장 높은 정확도를 기록했고, 나머지 데이터셋에서도 경쟁력을 유지했으며, 비증강 기반 모델보다 일관되게 뛰어난 성능을 보였다.
- NLI 작업(RTE, QNLI, MNLI)에서 LINDA는 RTE에서 5.4% 향상, QNLI에서 0.7%, MNLI에서 0.5% 향상되었고, 다른 방법들은 성능이 저하되었다.
- 도메인 외 일반화에서 LINDA는 아마존, 야후, 영화 등 모든 도메인에서 성능 향상을 보였으며, 일반 기반 모델을 항상 초월했고, EDA 및 미스업은 성능 향상이 없었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.