Skip to main content
QUICK REVIEW

[논문 리뷰] Few-shot Text Classification with Distributional Signatures

Yujia Bao, Menghua Wu|arXiv (Cornell University)|2019. 08. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 44인용 수 88
한 줄 요약

분포적 서명을 사용하여 단어 수준 주의를 생성하는 메타-러닝 모델을 제안하고, 이를 통해 몇 샷 텍스트 및 관계 분류를 효과적으로 수행하며 렉시컬 베이스라인보다 우수한 성능을 보인다.

ABSTRACT

In this paper, we explore meta-learning for few-shot text classification. Meta-learning has shown strong performance in computer vision, where low-level patterns are transferable across learning tasks. However, directly applying this approach to text is challenging--lexical features highly informative for one task may be insignificant for another. Thus, rather than learning solely from words, our model also leverages their distributional signatures, which encode pertinent word occurrence patterns. Our model is trained within a meta-learning framework to map these signatures into attention scores, which are then used to weight the lexical representations of words. We demonstrate that our model consistently outperforms prototypical networks learned on lexical knowledge (Snell et al., 2017) in both few-shot text classification and relation classification by a significant margin across six benchmark datasets (20.0% on average in 1-shot classification).

연구 동기 및 목표

  • 작업 간 전이가 잘 되지 않는 렉시컬 특징만으로도 몇 샷 텍스트 분류를 개선하고 동기를 부여한다.
  • distributional signatures(예: unigram 통계)를 활용해 태스크 간 주의를 전이한다.
  • 적은 수의 라벨 예시에서 빠른 적응을 가능하게 하는 어텐션 생성기와 리지 회귀자를 결합한다.
  • 언어 단어 치환 perturbation에 대한 강건성의 이론적 타당성을 제공한다.
  • 텍스트와 관계 분류를 위한 여섯 개 데이터셋에서 실험적으로 baselines보다 우수한 성능을 입증한다.

제안 방법

  • 일반 단어 중요도와 클래스별 중요도를 포착하기 위해 분포적 서명 s(x)와 t(x)를 정의합니다.
  • s(x)와 t(x)를 연결하고 이를 biLSTM과 융합하여 학습된 벡터와의 내적을 통해 단어 수준 주의도 α_i를 계산합니다.
  • 입력 단어 임베딩마다 주의 가중치 벡터를 이용해 α_i로 가중합된 어텐션 표현 φ(x) = sum_i α_i f_ebd(x_i)를 만듭니다.
  • 서포트 세트에서 φ(x)를 클래스 라벨에 매핑하기 위해 리지 회귀자를 학습하고 해석 가능한 해를 얻습니다. W = Φ_S^T(Φ_SΦ_S^T + λI)^{-1}Y_S.
  • 쿼리 세트에서 Y_Q_hat = a Φ_Q W + b를 이용해 예측치를 보정하고 확률 분포에 softmax를 적용합니다.
  • RIDGE 회귀자 피드백을 사용해 쿼리 세트의 교차 엔트로피 손실을 최적화하며, 어텐션 생성기를 쿼리 세트에서 엔드-투-엔드로 학습합니다.
  • AttGen이 unigram 확률을 보존하는 양-치환 사상에 대해 불변임을 보일 수 있습니다.

실험 결과

연구 질문

  • RQ1분포적 서명을 사용해 NLP 태스크 간 주의를 전이해 강건한 몇 샷 학습이 가능할까?
  • RQ2분포적 서명으로 안내된 어텐션 생성기가 텍스트 및 관계 분류에서 렉시컬 메타러너보다 몇 샷 설정에서 우수한가?
  • RQ3학습된 어텐션이 단어 치환 perturbation에 대해 강건하고 보지 못한 클래스에도 일반화되는가?
  • RQ4제안된 아키텍처가 1샷 및 5샷 조건에서 텍스트와 관계 데이터셋 전반에 걸쳐 다양한 데이터셋에서 어떻게 수행되는가?

주요 결과

  • 제안된 모델은 6개 데이터셋에서 1샷 및 5샷 설정 모두에서 최고 정확도를 달성한다.
  • 평균적으로 모델은 5-way 1-shot 정확도를 최고의 baselines보다 7.5% 증가시키고 5-way 5-shot 정확도도 3.9% 증가시킨다.
  • cnn + proto와 비교할 때 Reuters/다른 데이터셋의 1샷 분류에서 평균적으로 20.0%의 향상을 보인다.
  • s(·)와 t(·) 모두 성능에 기여하며, s(·)가 더 큰 영향을 주고 biLSTM 융합이 결과를 약간 향상시킨다.
  • 모델은 Lexicon-aware 메타러너보다 보지 못한 클래스에 더 잘 일반화하며, Reuters에서의 학습 곡선 및 정성적 주의 시각화로 확인된다.
  • BERT 맥락화는 FewRel 성능을 높이지만 HuffPost에서는 그렇지 않아, 맥락화된 표현의 태스크 의존적 이점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.