Skip to main content
QUICK REVIEW

[논문 리뷰] Does BERT Solve Commonsense Task via Commonsense Knowledge

Leyang Cui, Sijie Cheng|arXiv (Cornell University)|2020. 08. 10.
Topic Modeling참고 문헌 30인용 수 19
한 줄 요약

이 논문은 BERT가 공감성QA 작업을 구조화된 공감성 지식을 통해 해결하는지, 아니면 얕은 패턴을 통해 해결하는지 조사한다. 주로 주의 기반 분석을 통해 BERT가 ConceptNet의 구조화된 지식을 포착하고 있으며, 미세조정을 통해 고층에서 이 지식을 더 효과적으로 활용함을 보여주어 BERT 내에서 공감성 추론이 깊이 통합되어 있음을 입증한다.

ABSTRACT

The success of pre-trained contextualized language models such as BERT motivates a line of work that investigates linguistic knowledge inside such models in order to explain the huge improvement in downstream tasks. While previous work shows syntactic, semantic and word sense knowledge in BERT, little work has been done on investigating how BERT solves CommonsenseQA tasks. In particular, it is an interesting research question whether BERT relies on shallow syntactic patterns or deeper commonsense knowledge for disambiguation. We propose two attention-based methods to analyze commonsense knowledge inside BERT, and the contribution of such knowledge for the model prediction. We find that attention heads successfully capture the structured commonsense knowledge encoded in ConceptNet, which helps BERT solve commonsense tasks directly. Fine-tuning further makes BERT learn to use the commonsense knowledge on higher layers.

연구 동기 및 목표

  • BERT가 공감성QA 작업을 깊이 있는 공감성 지식을 통해 해결하는지, 아니면 얕은 문법적 패턴을 통해 해결하는지 판단하는 것.
  • BERT의 주의 헤드가 ConceptNet에서 유래한 구조화된 공감성 지식을 어떻게 인코딩하고 활용하는지 분석하는 것.
  • 미세조정이 BERT의 고층에서 공감성 지식 활용에 어떤 역할을 하는지 조사하는 것.
  • 공감성 지식이 BERT의 공감성 작업 예측 성능에 기여하는 정도를 정량화하는 것.

제안 방법

  • BERT의 주의 헤드 내부에 존재하는 공감성 지식의 유무와 기여도를 분석하기 위해 두 가지 주의 기반 방법을 제안한다.
  • CommonsenseQA 작업에 관련된 구조화된 공감성 지식을 식별하기 위해 ConceptNet을 활용한다.
  • 주의 활성화 패턴을 측정하여 주의 헤드가 ConceptNet의 관련 공감성 사실에 주목하고 있는지 평가한다.
  • 미세조정 전후의 주의 패턴을 비교하여 계층 간 지식 활용 방식의 변화를 평가한다.
  • 주의 기반 탐색을 통해 공감성 지식이 예측 결정에 기여하는 정도를 고립하고 정량화한다.

실험 결과

연구 질문

  • RQ1추론 중 BERT의 주의 헤드는 ConceptNet에 코딩된 구조화된 공감성 지식을 포착하고 활용하는가?
  • RQ2BERT의 공감성QA 성능은 깊이 있는 공감성 지식에 기반하는가, 아니면 표면적인 문법적 패턴에 기반하는가?
  • RQ3미세조정은 BERT의 다양한 계층에서 공감성 지식 활용에 어떤 영향을 미치는가?
  • RQ4공감성 지식은 BERT의 예측 신뢰도와 정확도에 어느 정도 기여하는가?

주요 결과

  • BERT의 주의 헤드는 ConceptNet에 코딩된 구조화된 공감성 지식을 성공적으로 포착하고 활용한다.
  • 모델은 이 지식을 직접적으로 활용하여 공감성 추론 작업을 해결하며, 외부 지식이 깊이 통합되어 있음을 시사한다.
  • 미세조정은 특히 네트워크의 고층에서 BERT의 공감성 지식 활용 능력을 향상시킨다.
  • 주의 패턴을 통해 BERT가 예측 과정에서 관련 공감성 사실에 동적으로 주목하고 있음을 확인하여 지식 기반 추론을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.