Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Robustness and Generality of NLP Models Using Disentangled Representations

Jiawei Wu, Xiaoya Li|arXiv (Cornell University)|2020. 09. 21.
Topic Modeling참고 문헌 96인용 수 5
한 줄 요약

이 논문은 입력을 다수의 분리된 표현으로 매핑하고, 이를 앙상블하여 최종 예측을 내는 분리 표현 학습 프레임워크를 제안한다. 변동 정보 복각(VIB) 프레임워크 내에서 L2 정규화 또는 총 상관관계(TC)를 사용함으로써, 표준 작업에서 정확도 손실이 최소화되는 범위에서 모델의 적대적 공격에 대한 방어력과 도메인 간 일반화 능력을 향상시킨다.

ABSTRACT

Supervised neural networks, which first map an input $x$ to a single representation $z$, and then map $z$ to the output label $y$, have achieved remarkable success in a wide range of natural language processing (NLP) tasks. Despite their success, neural models lack for both robustness and generality: small perturbations to inputs can result in absolutely different outputs; the performance of a model trained on one domain drops drastically when tested on another domain. In this paper, we present methods to improve robustness and generality of NLP models from the standpoint of disentangled representation learning. Instead of mapping $x$ to a single representation $z$, the proposed strategy maps $x$ to a set of representations $\{z_1,z_2,...,z_K\}$ while forcing them to be disentangled. These representations are then mapped to different logits $l$s, the ensemble of which is used to make the final prediction $y$. We propose different methods to incorporate this idea into currently widely-used models, including adding an $L$2 regularizer on $z$s or adding Total Correlation (TC) under the framework of variational information bottleneck (VIB). We show that models trained with the proposed criteria provide better robustness and domain adaptation ability in a wide range of supervised learning tasks.

연구 동기 및 목표

  • 엔트레인된 표현으로 인해 감소하는 감독형 NLP 모델의 강인성과 도메인 일반화 능력 문제를 해결하기 위해.
  • 적대적 공격과 도메인 간 분포 이탈에 대한 모델의 내성 강화를 위해.
  • 구조적 표현 학습을 통해 원천 특징, 타겟 특징, 일반 특징을 분리할 수 있도록 하기 위해.
  • 정확도 손실이 크지 않은 간단하면서도 효과적인 엔드 투 엔드 방법을 개발하여 해석 가능성과 성능을 향상시키기 위해.

제안 방법

  • 모델은 입력 x를 단일 z가 아닌 K개의 분리된 표현 {z₁, ..., zK}로 매핑함으로써 특징의 분리성을 촉진한다.
  • 각 표현 zi는 개별적으로 로짓 li로 투영되며, 최종 예측 y는 로짓들의 앙상블에서 유도된다.
  • 표현 간 다양성과 분리성을 유도하기 위해 L2 정규화가 적용된다.
  • 변동 정보 복각(VIB) 프레임워크 내에서 총 상관관계(TC)가 포함되어 표현 간 상호정보량을 최소화한다.
  • 교차 엔트로피 손실과 분리 정규화 항(βL2 또는 γTC)을 결합한 학습 목적이 태스크 정확도와 표현 분리성 간 균형을 이루도록 한다.
  • 일차 도함수 기반 민감도 분석을 사용하여 개별 토큰이 각 분리된 표현에 미치는 영향을 시각화한다.

실험 결과

연구 질문

  • RQ1분리된 표현은 NLP에서 적대적 예외에 대한 모델 강인성을 향상시킬 수 있는가?
  • RQ2분리된 표현은 NLP 작업에서 분포 이탈이 발생할 경우 도메인 간 일반화 능력을 향상시킬 수 있는가?
  • RQ3L2 또는 TC 정규화를 통해 표현 분리를 강제하면 후속 작업에서 성능 향상이 이루어지는가?
  • RQ4하이퍼파rameter 설정(β, γ)이 강인성과 정확도 간의 트레이드오프에 어떻게 영향을 미치는가?
  • RQ5분리된 표현은 더 해석 가능하게 다양한 의미적 측면(예: 감성 극성)을 포착할 수 있는가?

주요 결과

  • VIB+TC 방법은 IMDB(모델: CNN)에서 PWWS 적대적 공격 벤치마크에서 40.2%의 정확도를 기록했으며, 기준 모델(36.1%)을 초월했다. γ=0.15일 때.
  • Regularizer 방법은 β=0.15일 때 PWWS 공격에서 22.7%의 정확도를 기록했고, 기준 모델(18.1%)보다 높은 강인성을 보였다.
  • β=0.15일 때 Regularizer 방법은 IMDB에서 정제된 정확도를 90.1%로 향상시키며 동시에 적대적 방어 성능을 크게 향상시켰다.
  • VIB+TC 방법은 γ=0.15일 때 GA(w/LM) 공격에서 38.8%의 정확도를 기록했고, 기준 모델(34.7%)보다 강력한 방어 능력을 보였다.
  • 시각화 결과 z₁은 긍정적 감성을, z₄는 부정적 감성을 각각 인코딩하는 것으로 확인되어 의미적 요소의 분리가 이루어졌음을 확인했다.
  • β와 γ의 최적 하이퍼파rameter 값은 약 0.1–0.15 범위였으며, 이 범위를 초월하면 성능이 급격히 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.