Skip to main content
QUICK REVIEW

[논문 리뷰] Does Knowledge Help General NLU? An Empirical Study

Ruochen Xu, Yuwei Fang|arXiv (Cornell University)|2021. 09. 01.
Topic Modeling참고 문헌 35인용 수 7
한 줄 요약

이 논문은 일반적인 자연어 이해(NLU) 작업에서 외부 지식이 성능을 향상시키는지 여부를 경험적으로 조사한다. 4개의 사전 학습된 모델과 10개의 NLU 작업을 대상으로 비침습적인 방법을 사용해 텍스트 기반 기술과 임베딩을 통한 지식 통합을 평가한 결과, 지식 통합으로 인해 평균 F1 점수가 0.46 포인트 향상되었으며, 입력 정보를 유지하고 작업에 관련 없는 특징을 걸러내어 모델의 일반화 능력을 향상시켰다.

ABSTRACT

It is often observed in knowledge-centric tasks (e.g., common sense question and answering, relation classification) that the integration of external knowledge such as entity representation into language models can help provide useful information to boost the performance. However, it is still unclear whether this benefit can extend to general natural language understanding (NLU) tasks. In this work, we empirically investigated the contribution of external knowledge by measuring the end-to-end performance of language models with various knowledge integration methods. We find that the introduction of knowledge can significantly improve the results on certain tasks while having no adverse effects on other tasks. We then employ mutual information to reflect the difference brought by knowledge and a neural interpretation model to reveal how a language model utilizes external knowledge. Our study provides valuable insights and guidance for practitioners to equip NLP models with knowledge.

연구 동기 및 목표

  • 지식 중심 응용 분야를 초월해 외부 지식이 일반적인 NLU 작업의 성능을 향상시키는지 여부를 규명하는 것.
  • 다양한 NLU 작업에서 가장 큰 성과 향상을 이끌어내는 지식 소스와 통합 방법을 특정하는 것.
  • 다양한 지식 통합 기법과 사전 학습된 언어 모델이 NLU 성능 향상에 얼마나 효과적인지 평가하는 것.
  • 종합 정확도를 넘어서 지식이 모델의 결정 과정에 어떻게 영향을 미치는지 해석 가능성 도구와 상호정보량을 활용해 분석하는 것.
  • 일반적인 NLU를 위한 외부 지식을 효과적으로 통합할 수 있는 실용적 통찰을 연구자들에게 제공하는 것.

제안 방법

  • 비침습적인 지식 통합 방법 두 가지를 사용: 지식으로서의 텍스트(KT), 즉 엔티티 설명을 입력 토큰에 통합하는 방식과 지식으로서의 임베딩(KE), 즉 엔티티 임베딩을 컨텍스트 표현에 추가하는 방식.
  • RoBERTa-base, BERT-base, ELECTRA-base, DistilBERT의 4개의 사전 학습된 언어 모델에 두 방법을 적용.
  • 변환기 레이어 전반에서 입력(x)과 출력(y)에 대한 정보 유지 정도를 측정하기 위해 상호정보량(MI) 추정을 수행하며, MI는 재구성 오차와 교차 엔트로피 손실을 통해 근사화.
  • DiffMask라는 신경망 해석 모델을 사용해 각 레이어에서 모델이 중요하게 여기는 입력 토큰을 시각화함으로써 지식 통합으로 인한 의사결정 과정의 변화를 분석.
  • 감성 분류, 자연어 추론, 문장 유사도, 품사 태깅, NER 등 10개의 일반적인 NLU 작업에서 광범위한 실험 수행.
  • 각 변환기 레이어 l에서 입력에 대한 정보 흐름과 추상화 정도 변화를 평가하기 위해 상호정보량 차이 ΔI(c^(l);x)와 ΔI(c^(l);y)를 추정.

실험 결과

연구 질문

  • RQ1외부 지식은 일반적인 NLU 작업 전반에 걸쳐 성능 향상에 기여하는가?
  • RQ2어떤 지식 소스와 어떤 NLU 작업이 지식 통합에서 가장 큰 이점을 얻는가?
  • RQ3동일한 실험 환경에서 어떤 지식 통합 방법이 가장 효과적인가?
  • RQ4어떤 대규모 사전 학습된 언어 모델이 외부 지식으로부터 가장 큰 이점을 얻는가?
  • RQ5종합 정확도를 넘어서 지식의 영향을 감지할 수 있으며, 만약 가능하다면 모델은 이를 어떻게 활용하는가?

주요 결과

  • 지식 통합으로 인해 10개의 NLU 작업과 4개의 모델 전반에서 평균 F1 점수가 0.46 포인트 향상되었으며, CoLA와 RTE와 같은 특정 작업에서 뚜렷한 성과 향상이 관찰되었다.
  • KT-Attn 방법이 가장 높은 상호정보량 향상을 기록했으며, 기존 RoBERTa-base 기준 대비 더 많은 입력 정보를 유지하고 더 많은 작업에 관련 없는 특징을 제거했다.
  • 지식 통합으로 인해 불필요한 정보가 점진적으로 감소하고 출력과 관련된 특징이 더 잘 유지되는 경향이 나타났으며, 이는 레이어 6부터 시작하여 더 깊은 레이어로 이어졌다.
  • 지식은 특정 토큰(예: 동사, 명사, 형용사)에만 적용되지만, 모델의 어텐션은 모든 토큰으로 확장되어 CoLA와 같은 작업에서 일반화 능력 향상에 기여했다.
  • DiffMask 분석 결과, KT-Attn는 예측에 영향을 주지 않는 단어(예: 否정 'not' 또는 복잡한 구문 'Sue to stay')를 올바르게 중요도가 낮다고 식별했으며, 이는 더 나은 추론 능력을 의미한다.
  • 지식 통합 후 특정 품사 태그(예: 대명사 PRON, 전치사 ADP, 수사 NUM)를 중요하게 여기는 트랜스포머 레이어의 평균 수가 증가하여, 지식 통합이 모델 행동에 광범위한 영향을 미친다는 것을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.