Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Meta-learner via Gradient Similarity for Few-shot Text Classification

Tianyi Lei, Honghui Hu|arXiv (Cornell University)|2022. 09. 10.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 적은 샘플 데이터에서의 일반화 성능 향상을 위해 자기지도 학습 기반의 마스크 토큰 예측(Mask Token Prediction, MTP) 작업과 기울기 유사도를 활용해 부정적 기울기를 필터링하는 적응형 메타-학습자(adaptive meta-learner)를 도입한 최적화 기반 메타학습 프레임워크인 적응형 메타-학습자 기반 기울기 유사도(Adaptive Meta-learner via Gradient Similarity, AMGS)를 제안한다. 이 방법은 제한된 지원 데이터에서의 과적합을 줄임으로써 다양한 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Few-shot text classification aims to classify the text under the few-shot scenario. Most of the previous methods adopt optimization-based meta learning to obtain task distribution. However, due to the neglect of matching between the few amount of samples and complicated models, as well as the distinction between useful and useless task features, these methods suffer from the overfitting issue. To address this issue, we propose a novel Adaptive Meta-learner via Gradient Similarity (AMGS) method to improve the model generalization ability to a new task. Specifically, the proposed AMGS alleviates the overfitting based on two aspects: (i) acquiring the potential semantic representation of samples and improving model generalization through the self-supervised auxiliary task in the inner loop, (ii) leveraging the adaptive meta-learner via gradient similarity to add constraints on the gradient obtained by base-learner in the outer loop. Moreover, we make a systematic analysis of the influence of regularization on the entire framework. Experimental results on several benchmarks demonstrate that the proposed AMGS consistently improves few-shot text classification performance compared with the state-of-the-art optimization-based meta-learning approaches.

연구 동기 및 목표

  • 적은 샘플 데이터와 복잡한 모델 간의 불일치로 인한 적은 샘플 텍스트 분류에서의 과적합 문제를 해결하기 위해.
  • 유용한 기울기 신호와 해로운 기울기 신호를 구분하여 메타학습에서 모델의 일반화 성능을 향상시키기 위해.
  • 계산 비용을 증가시키지 않고도 메타학습 중 태스크 분포의 다양성을 향상시키기 위해.
  • 파rameter 업데이트에 유익한 기울기 신호만을 적응적으로 선택하는 기울기 기반 메타-학습자를 개발하기 위해.

제안 방법

  • 내부 루프에서 미리 학습된 텍스트를 활용해 태스크 분포를 풍부화시키기 위해 자기지도 학습 기반의 마스크 토큰 예측(Mask Token Prediction, MTP) 작업을 도입한다.
  • 질의 세트의 손실 기울기와 기본 학습자(기본 모델)의 누적 기울기 간의 기울기 유사도를 측정하여 관련성을 평가한다.
  • 질의 세트의 기울기가 기본 학습자의 업데이트 방향과 양의 방향으로 일치할 경우에만 메타-파라미터를 업데이트하는 적응형 메타-학습자를 적용한다.
  • 코사인 유사도를 사용해 기울기 방향의 일치 정도를 측정함으로써 외부 루프에서 선택적 기울기 필터링을 가능하게 한다.
  • MTP와 기울기 기반 메타학습을 결합하여 표현 학습과 최적화 안정성 향상을 동시에 달성한다.
  • 계산 효율성을 유지하면서 효과적인 기울기 필터링을 가능하게 하기 위해 일阶 근사(first-order approximation)를 사용한다.

실험 결과

연구 질문

  • RQ1자기지도 사전학습이 낮은 데이터 환경에서 적은 샘플 텍스트 분류의 일반화 성능 향상에 기여할 수 있는가?
  • RQ2기울기 유사도를 통한 부정적 기울기 필터링이 메타-학습자의 성능 향상과 과적합 감소에 기여하는가?
  • RQ3MTP와 적응형 기울기 선택의 통합이 다양한 적은 샘플 벤치마크에서 모델의 강건성에 어떤 영향을 미치는가?
  • RQ4MTP가 메타학습 및 메타테스트 단계에서 전체 성능에 기여하는 바는 무엇인가?

주요 결과

  • 1-shot 15-way 설정에서 Banking77 벤치마크에서 AMGS는 63.62%의 정확도를 기록했으며, 다음으로 좋은 방법보다 5.11%p 높은 성능을 달성했다.
  • Clinc150에서 AMGS는 1-shot 15-way 설정에서 84.93%의 정확도를 기록했으며, 질의 세트와 지원 세트의 기울기를 모두 사용한 베이스라인 대비 1.21%p 향상된 성능을 보였다.
  • 메타학습 중 MTP를 제거하면 성능이 약 0.8% 감소하여, MTP가 태스크 분포 확장을 위한 역할을 한다는 점을 확인했다.
  • 메타테스트 중 MTP를 추가하면 정확도가 0.5% 향상되어, 지원 세트에서의 강건성이 향상됨을 시사한다.
  • T-SNE 시각화 결과, 특히 모호하거나 유사한 클래스에서 AMGS는 REPTILE보다 더 잘 분리된 고품질의 문장 표현을 생성하는 것으로 확인되었다.
  • 제거 실험 결과, 기울기 유사도 기반 필터링을 적용한 적응형 메타-학습자가 모든 기울기를 무시무시하게 사용하는 전략보다 일관되게 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.