Skip to main content
QUICK REVIEW

[논문 리뷰] BERT memorisation and pitfalls in low-resource scenarios.

Michael Tänzer, Sebastian Ruder|arXiv (Cornell University)|2021. 04. 16.
Topic Modeling참고 문헌 24인용 수 4
한 줄 요약

이 논문은 저자원 및 노이즈가 있는 환경에서 BERT의 기억 및 일반화 능력을 조사하며, 레이블 노이즈에 대해 강건함을 보이지만, 소수의 샘플과 희귀 엔터티 인식에서 실패함을 발견한다. 이를 해결하기 위해, BERT와 원형 네트워크를 융합한 새로운 BERT 기반 아키텍처를 제안하여 저자원 명명된 엔터티 인식 작업에서 성능을 크게 향상시킨다.

ABSTRACT

State-of-the-art pre-trained models have been shown to memorise facts and perform well with limited amounts of training data. To gain a better understanding of how these models learn, we study their generalisation and memorisation capabilities in noisy and low-resource scenarios. We find that the training of these models is almost unaffected by label noise and that it is possible to reach near-optimal performances even on extremely noisy datasets. Conversely, we also find that they completely fail when tested on low-resource tasks such as few-shot learning and rare entity recognition. To mitigate such limitations, we propose a novel architecture based on BERT and prototypical networks that improves performance in low-resource named entity recognition tasks.

연구 동기 및 목표

  • 사전 훈련된 모델인 BERT가 저자원 및 노이즈가 있는 훈련 환경에서 어떻게 일반화되고 사실을 기억하는지 이해하기 위해.
  • BERT가 소수의 샘플 학습 및 희귀 엔터티 인식 작업에서 나타내는 한계를 조사하기 위해.
  • BERT가 저자원 설정에서 실패하는 문제를 해결하기 위해 BERT와 원형 네트워크를 융합한 새로운 아키텍처를 제안하기 위해.
  • 제한된 또는 희귀한 예시만 존재할 경우 명명된 엔터티 인식 성능을 향상시키기 위해.

제안 방법

  • 제안된 모델은 소수의 샘플 지원 세트에서 클래스 원형을 학습하기 위해 BERT와 원형 네트워크를 통합한다.
  • 지원 샘플에 대한 평균 풀링을 통해 BERT의 문맥적 표현을 사용하여 클래스 원형을 계산한다.
  • 분류를 위해 쿼리 임베딩과 클래스 원형 간의 어텐션 기반 유사도를 계산한다.
  • 훈련 중에 서로 다른 클래스 원형 간의 분리를 장려하기 위해 대trastive 손실을 적용한다.
  • 소수의 샘플 및 희귀 엔터티 예제가 포함된 저자원 명명된 엔터티 인식 데이터셋에서 모델을 엔드 투 엔드로 미세조정한다.
  • BERT 표현에서 유도된 원형 임베딩을 활용하여 효과적인 소수의 샘플 및 제로샷 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1저자원 설정에서 높은 레이블 노이즈가 존재할 경우 BERT의 성능은 어떻게 되는가?
  • RQ2표준 벤치마크에서 뛰어난 성능을 보임에도 불구하고, BERT는 왜 소수의 샘플 및 희귀 엔터티 인식에서 실패하는가?
  • RQ3BERT와 원형 네트워크를 융합하면 저자원 명명된 엔터티 인식에서 일반화 능력이 향상되는가?
  • RQ4제안된 아키텍처가 저자원 환경에서의 기억 문제를 어느 정도 완화하는가?

주요 결과

  • BERT는 레이블 노이즈에 대해 강력한 내성성을 보이며, 극도로 노이즈가 많은 데이터셋에서도 거의 최적의 성능을 달성한다.
  • 이러한 내성성에도 불구하고, BERT는 소수의 샘플 및 희귀 엔터티 인식 작업에서 일반화에 실패함을 확인하여, 저자원 설정에서의 핵심적 한계를 드러낸다.
  • 제안된 BERT-원형 네트워크 아키텍처는 저자원 명명된 엔터티 인식 벤치마크에서 성능을 크게 향상시킨다.
  • 모델은 소수의 샘플 및 희귀 엔터티 인식에서 최신 기술 수준의 성능을 달성하여, 표준 미세조정 BERT보다 향상된 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.