Skip to main content
QUICK REVIEW

[논문 리뷰] Birds have four legs?! NumerSense: Probing Numerical Commonsense Knowledge of Pre-trained Language Models

Bill Yuchen Lin, Seyeon Lee|arXiv (Cornell University)|2020. 05. 02.
Topic Modeling참고 문헌 28인용 수 14
한 줄 요약

이 논문은 '새는 두 개의 다리를 가진다'와 같은 숫자적 공통지식을 포착할 수 있는 능력을 평가하기 위해 사전 훈련된 언어 모델(PTLM)의 성능을 진단하는 프로빙 작업과 데이터셋인 NumerSense를 소개한다. 마스킹된 언어 모델링을 통해 BERT와 RoBERTa가 원거리 감독 미세튜닝을 거친 후에도 54.06%의 정확도로 낮은 성능을 보이며 인간 성능(96.3%)에 크게 못 미치는 것으로 나타나, PTLM의 사실적 수치적 추론 능력에 심각한 격차가 있음을 드러낸다.

ABSTRACT

Recent works show that pre-trained language models (PTLMs), such as BERT, possess certain commonsense and factual knowledge. They suggest that it is promising to use PTLMs as "neural knowledge bases" via predicting masked words. Surprisingly, we find that this may not work for numerical commonsense knowledge (e.g., a bird usually has two legs). In this paper, we investigate whether and to what extent we can induce numerical commonsense knowledge from PTLMs as well as the robustness of this process. To study this, we introduce a novel probing task with a diagnostic dataset, NumerSense, containing 13.6k masked-word-prediction probes (10.5k for fine-tuning and 3.1k for testing). Our analysis reveals that: (1) BERT and its stronger variant RoBERTa perform poorly on the diagnostic dataset prior to any fine-tuning; (2) fine-tuning with distant supervision brings some improvement; (3) the best supervised model still performs poorly as compared to human performance (54.06% vs 96.3% in accuracy).

연구 동기 및 목표

  • 사전 훈련된 언어 모델(PTLM)이 '새는 두 개의 다리를 가진다'와 같은 수치적 공통지식을 포착하고 추론할 수 있는지 조사한다.
  • 기존의 프로빙 작업이 언어적 또는 정성적 공통지식에 집중하지만 정량적 사실을 간과하는 점을 보완한다.
  • 수치적 추론에 영향을 미치는 입력의 미세한 변형(예: 마스킹된 수치 단어 주변에 형용사 삽입)에 대해 PTLM의 견고성 평가.
  • 원거리 감독과 미세튜닝이 수치적 공통지식 작업에서 PTLM의 성능 향상에 얼마나 효과적인지 평가.
  • 향후 연구를 위한 기준이 되는 진단용 데이터셋 제공: PTLM의 수치적 추론 능력 향상과 지식 기반 강화

제안 방법

  • 모델이 문장에서 수치적 공통지식이 필요한 마스킹된 위치에 가장 가능성이 높은 수치 명사(예: '두')를 예측하는 마스킹된 단어 프로빙 작업 설계.
  • Open Mind Common Sense(OMCS) 코퍼스에서 추출한 문장들을 필터링하고 수동 검토하여 13,600개의 프로빙(훈련용 10,500개, 테스트용 3,100개)으로 구성된 NumerSense 데이터셋 구축.
  • ConceptNet에서 유래한 형용사(예: '둥근')를 문장의 명사 주변에 삽입하여 악성 예제를 도입하여 모델의 견고성 테스트.
  • 두 가지 설정에서 모델 평가: zero-shot(미세튜닝 없음) 및 원거리 감독(CommonsenseQA와 같은 관련 공통지식 추론 데이터셋으로 미세튜닝).
  • 후보 수치 명사의 소프트맥스 점수를 사용해 정답에 대한 모델 신뢰도를 순위 매기고, 정확도로 성능 측정.
  • 자연어 질문으로 변환된 프로빙을 바탕으로 인간 평가자와 최신 오픈 도메인 QA 모델과의 성능 비교: '몇 개인가?' 질문에 대한 평가

실험 결과

연구 질문

  • RQ1BERT와 RoBERTa와 같은 사전 훈련된 언어 모델이 마스킹된 언어 모델링을 통해 '새는 두 개의 다리를 가진다'와 같은 수치적 공통지식 사실을 얼마나 잘 복원할 수 있는가?
  • RQ2문장의 사실적 의미에는 영향을 주지 않지만 맥락을 변화시키는 미세한 입력 변형(예: '둥근'과 같은 형용사 삽입)에 대해 이러한 모델은 얼마나 견고한가?
  • RQ3관련 공통지식 추론 데이터셋에서 유래한 원거리 감독이 PTLM의 수치적 공통지식 프로빙 작업 성능 향상에 얼마나 큰 영향을 미치는가?
  • RQ4PTLM의 NumerSense 성능은 인간 성능과 최신 오픈 도메인 QA 모델의 '몇 개인가?' 질문에 대한 성능과 비교해 볼 때 어떻게 되는가?
  • RQ5PTLM의 수치적 공통지식 추론에서 나타나는 주요 실패 원인은 무엇이며, 자가 supervision 훈련을 거친 후에도 낮은 성능을 보이는 이유는 무엇인가?

주요 결과

  • BERT와 RoBERTa가 zero-shot 설정에서 NumerSense 진단 데이터셋에서 54.06%의 정확도를 기록하여 수치적 공통지식에 대한 기초 성능이 열악함을 나타낸다.
  • 관련 공통지식 데이터셋에서 유래한 원거리 감독으로 미세튜닝을 거치면 성능 향상이 이루어지지만, 여전히 인간 성능(96.3% 정확도)과 큰 격차를 보인다.
  • 가장 높은 성능을 보인 감독 학습 모델조차도 인간 성능에 못 미치며, 현재의 PTLM이 정확한 수치적 사실을 신뢰할 수 있게 인코딩하지 못하고 있음을 시사한다.
  • 모델의 견고성이 열악함: '둥근 새는 일반적으로 [MASK]개의 다리를 가진다'와 같은 문장에 '둥근'이라는 형용사를 삽입했을 때 BERT는 '네'에서 '두'로 예측을 바꾸며 불안정함을 보임.
  • 최신 오픈 도메인 QA 모델(자연어 질문에 대해 미세튜닝된)이 같은 '몇 개인가?' 질문에서 15.4%의 정확도를 기록하며, BERT-base(미세튜닝 없음)보다도 낮은 성능을 보여 현재의 QA 시스템 역시 수치적 공통지식에 어려움을 겪고 있음을 시사한다.
  • 본 연구는 중요한 연구 격차를 규명한다: PTLM은 언어적 및 정성적 공통지식은 포착하지만, 공통지식으로 여겨지는 정확한 수치적 사실을 신뢰할 수 있게 인코딩하거나 검색하지 못하고 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.