Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Language Models as Symbolic Knowledge Graphs

Vishwas Mruthyunjaya, Pouya Pezeshkpour|arXiv (Cornell University)|2023. 08. 25.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 대규모 언어모델(LMs)이 기호적 지식 그래프(KGs)의 위상적 및 의미적 성질을 재현할 수 있는지 재평가하기 위해 대칭성, 계층성, 복합성 등의 특성을 타깃으로 삼는 아홉 가지 새로운 벤치마크를 도입한다. 강력한 사실적 기억력에도 불구하고, GPT-4를 포함한 LMs는 이 벤치마크에서 hit@1이 23.7%에 불과하여, 복잡한 관계 지식을 포괄하는 데에 상당한 한계를 드러내며, 더 작은 모델이 더 큰 모델보다 성능이 뛰어난 경우도 있다.

ABSTRACT

Symbolic knowledge graphs (KGs) play a pivotal role in knowledge-centric applications such as search, question answering and recommendation. As contemporary language models (LMs) trained on extensive textual data have gained prominence, researchers have extensively explored whether the parametric knowledge within these models can match up to that present in knowledge graphs. Various methodologies have indicated that enhancing the size of the model or the volume of training data enhances its capacity to retrieve symbolic knowledge, often with minimal or no human supervision. Despite these advancements, there is a void in comprehensively evaluating whether LMs can encompass the intricate topological and semantic attributes of KGs, attributes crucial for reasoning processes. In this work, we provide an exhaustive evaluation of language models of varying sizes and capabilities. We construct nine qualitative benchmarks that encompass a spectrum of attributes including symmetry, asymmetry, hierarchy, bidirectionality, compositionality, paths, entity-centricity, bias and ambiguity. Additionally, we propose novel evaluation metrics tailored for each of these attributes. Our extensive evaluation of various LMs shows that while these models exhibit considerable potential in recalling factual information, their ability to capture intricate topological and semantic traits of KGs remains significantly constrained. We note that our proposed evaluation metrics are more reliable in evaluating these abilities than the existing metrics. Lastly, some of our benchmarks challenge the common notion that larger LMs (e.g., GPT-4) universally outshine their smaller counterparts (e.g., BERT).

연구 동기 및 목표

  • 언어모델(LMs)이 대칭성, 계층성, 상호 이중성 등과 같은 기호적 지식 그래프(KGs)의 위상적 및 의미적 특성을 재현할 수 있는지 평가하는 것.
  • 기존 평가 프레임워크의 격차를 해결하기 위해, 고립된 삼중항에 집중하고 관계적 및 구조적 성질이 추론에 필수적인 데도 간과하는 문제를 해결하는 것.
  • KG 표현의 복잡성을 더 잘 반영하기 위해, 특성별로 맞춤형으로 설계된 새로운 벤치마크와 평가 지표를 개발하는 것.
  • 더 큰 LMs가 구조적 지식을 포괄하는 데서 더 나은 성능을 보이는 것은 전반적으로 보편적인 가정이 아님을 도전하는 것.
  • 미래의 모델 개발 및 외부 지식 통합을 안내하기 위해, 다양한 관계 패턴을 기반으로 LMs를 종합적으로 평가하는 것.

제안 방법

  • T-REx 데이터셋을 바탕으로, 위상적 특성인 대칭성, 비대칭성, 계층성, 상호 이중성, 복합성, 경로, 실체 중심성, 편향, 모호성 등을 반영하기 위해 위키데이터에서 삼중항을 샘플링하여 아홉 가지 새로운 질적 벤치마크를 구성하였다.
  • 각 벤치마크에 맞춤형으로 설계된 새로운 특성별 평가 지표를 개발하여, 표준 precision@1을 넘어서 관계 이해 수준을 평가하는 데 목적이 있다.
  • paraphrased 프롬프트를 사용하여 BERT, LLaMA, GPT-4 등 다양한 LMs를 모두의 벤치마크에서 평가함으로써 지식 검색의 견고성을 확보하였다.
  • 엔티티의 인기도에 따라 GPT-4의 성능을 분석하여, 정확히 예측된 예시의 분포를 전체 예시 분포와 비교함으로써, 사실적 기억력에 의존하는지, 구조적 이해에 의존하는지 평가하였다.
  • 각 예시에 관련된 다수의 사실이 포함된 제어된 평가 환경을 구축하여, 고립된 삼중항이 아닌 관계 패턴에 기반한 추론을 요구하도록 하였다.
  • 모델 간 성능을 비교하고 실패 패턴을 식별하기 위해 통계 분석을 적용하였으며, 특히 고인기도 엔티티에서의 성능에 초점을 맞추었다.

실험 결과

연구 질문

  • RQ1언어모델은 지식 그래프의 대칭적 및 비대칭적 관계를 정확히 포괄할 수 있으며, 기호적 KG와 비교해 어떤 성능을 보일 수 있는가?
  • RQ2LMs는 KG에서 복잡한 추론에 필수적인 계층적 및 복합적 구조를 어느 정도 표현할 수 있는가?
  • RQ3모델 크기와 KG의 관계적 및 위상적 특성에 대한 성능 향상 간 상관관계가 일관되게 존재하는가?
  • RQ4엔티티의 인기도와 어휘적 모호성은 구조적 지식 작업에서 LM 예측의 신뢰성에 어떤 영향을 미치는가?
  • RQ5기존의 precision 기반 지표보다 새로운 평가 지표가 LMs의 구조적 이해 수준을 더 잘 반영할 수 있는가?

주요 결과

  • GPT-4는 제안된 벤치마크에서 hit@1이 23.7%에 불과하여, 표준 LAMA 벤치마크에서의 50% precision@1보다 유의미하게 낮아, 관계적 구조 포괄 능력이 열악함을 시사한다.
  • BERT 및 LLaMA와 같은 더 작은 LMs가 대칭성 및 복합성과 같은 특정 벤치마크에서 GPT-4를 앞서는 성능을 보이며, 더 큰 모델이 항상 뛰어나다는 가정을 도전한다.
  • 정확히 예측된 예시의 엔티티 인기도 분포가 전체 분포와 유사하게 나타나, GPT-4의 성공이 인기 있는 사실의 암기 때문만은 아님을 시사한다.
  • 매우 높은 인기도를 가진 엔티티를 포함한 예시에서 GPT-4가 어려움을 겪으며, 일정 인기도 이론 이상에서는 성능에 한계가 있음을 보여준다.
  • 제안된 특성별 지표는 표준 precision@1보다 관계적 및 위상적 지식 평가에 더 신뢰성 있고 정보가 풍부한 것으로 확인되었다.
  • 모델은 다양한 특성에 대해 일관되지 않은 행동을 보이며, 단순한 관계에서는 뛰어난 성능을 보이지만, 복잡한 경로 기반 또는 상호 이중성 추론 작업에서는 심각한 실패를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.