[논문 리뷰] Improving Robustness by Augmenting Training Sentences with Predicate-Argument Structures
이 논문은 특정 편향에 대응하지 않고도 트랜스포머 모델의 다양한 데이터셋 편향에 대한 강건성을 향상시키기 위해 훈련 문장을 술어-논항 구조로 보강하는 방법을 제안한다. 이 방법은 의미 역할을 강조함으로써 어텐션 메커니즘을 향상시켜, 훈련 데이터에 편향이 없더라도 악성 벤치마크에서 일반화 능력을 향상시킨다.
Existing NLP datasets contain various biases, and models tend to quickly learn those biases, which in turn limits their robustness. Existing approaches to improve robustness against dataset biases mostly focus on changing the training objective so that models learn less from biased examples. Besides, they mostly focus on addressing a specific bias, and while they improve the performance on adversarial evaluation sets of the targeted bias, they may bias the model in other ways, and therefore, hurt the overall robustness. In this paper, we propose to augment the input sentences in the training data with their corresponding predicate-argument structures, which provide a higher-level abstraction over different realizations of the same meaning and help the model to recognize important parts of sentences. We show that without targeting a specific bias, our sentence augmentation improves the robustness of transformer models against multiple biases. In addition, we show that models can still be vulnerable to the lexical overlap bias, even when the training data does not contain this bias, and that the sentence augmentation also improves the robustness in this scenario. We will release our adversarial datasets to evaluate bias in such a scenario as well as our augmentation scripts at https://github.com/UKPLab/data-augmentation-for-robustness.
연구 동기 및 목표
- 특정 편향에만 대응하는 기존의 편향 제거 방법의 한계를 해결하고, 전체적인 강건성에 악영향을 주지 않도록 하는 것.
- 훈련 데이터에 그 편향이 존재하지 않더라도 모델이 여전히 편향에 취약한지 조사하는 것.
- 모델을 수정하거나 테스트 시 인fer를 변경하지 않고도 강건성을 향상시키는 모델 독립형 입력 수준의 보강 기법을 개발하는 것.
- 다양한 모델, 작업, 악성 평가 세트에서 언어학적 보강의 효과를 평가하는 것.
- 다양한 벤치마크와 모델 아키텍처에서 편향 제거 방법을 테스트할 것을 장려함으로써 폭넓은 평가 관행을 촉진하는 것.
제안 방법
- 사전 훈련된 의미 분석기(semantic parser)를 사용하여 훈련 문장에서 술어-논항 구조(PAS)를 추출한다.
- 각 입력 문장을 구조화된 형식(예: "[V: predict] [ARG0: student] [ARG1: result]" )으로 해당 PAS를 삽입하여 보강한다.
- 피팅 테이닝 동안 사전 훈련된 트랜스포머 모델(예: BERT, RoBERTa, XLNet)에 보강된 입력을 제공한다.
- 모델 추론을 위해 원본 입력을 유지하여 테스트 시 오버헤드가 발생하지 않도록 한다.
- 보강된 입력을 통해 어텐션 메커니즘이 표면적 어휘적 신호보다 의미 역할에 초점을 맞추도록 유도한다.
- 다양한 편향 조건에서 HANS, SWAG, MultiNLI와 같은 여러 악성 벤치마크에서 강건성을 평가한다.
실험 결과
연구 질문
- RQ1훈련 데이터에 문장 겹침 편향이 포함되어 있지 않더라도 트랜스포머 모델이 여전히 이 편향에 취약한가?
- RQ2술어-논항 구조로 문장을 보강함으로써 특정 편향에 대응하지 않고도 여러 종류의 편향에 대한 강건성이 향상되는가?
- RQ3편향이 훈련 데이터에 존재하지 않는 상황에서도 제안된 보강 방법이 효과적인가?
- RQ4다른 사전 훈련된 트랜스포머 모델들(예: BERT, RoBERTa, XLNet)에서 이 보강 방법의 성능은 어떻게 되는가?
- RQ5자연어 추론 및 공통지식 추론과 같은 다양한 NLP 작업 간에도 이 방법이 일반화되는가?
주요 결과
- 문장 겹침 편향이 없는 SWAG 데이터로 피팅 테이닝한 모델도, 이 편향이 포함된 악성 세트에서는 랜덤 베이스라인 이하의 성능을 보이며, 훈련 데이터에 편향이 없더라도 여전히 취약함을 확인한다.
- 제안된 문장 보강 기법은 HANS, SWAG, MultiNLI와 같은 여러 악성 벤치마크에서 특정 편향에 대응하지 않고도 강건성을 향상시킨다.
- HANS 벤치마크에서 XLNet과 RoBERTa 모델은 보강 후 문장 겹침 및 문법적 불변성 프로브에서 정확도가 향상되었으며, XLNet은 원본 데이터 대비 60.6%의 정확도를 기록하여 57.6%를 상회한다.
- 기본 모델이 이미 강건한 경우에도(예: MultiNLI에서 RoBERTa) 이 보강 방법은 스트레스 테스트 및 否정 프로브에서 일관된 성능 향상을 보였다.
- BertViz를 통해 시각화한 결과, 보강은 더 집중된 어텐션 패턴을 유도하며, 술어-논항 구조와 관련된 전제-가설 단어에 대해 더 강한 어텐션을 나타낸다.
- 이 방법은 모델 독립적이며, 테스트 시 인퍼런스를 수정할 필요가 없어 실세계 구현에 실용적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.