[논문 리뷰] Language Models As or For Knowledge Bases
이 논문은 대규모 언어 모델(LMs)이 본질적인 불확실성과 환각 현상으로 인해 구조화된 지식 기반(KB)을 대체할 수는 없지만, 후보 사실을 검증하거나 반증하는 데 있어 '제2의 의견'으로 매우 유용하다고 주장한다. 저자들은 LMs를 사용해 새로운 진술을 탐색함으로써 외부 텍스트 지식을 활용하여 KB의 품질을 향상시키고 지식 기반 유지를 위한 오류를 줄이려 한다.
Pre-trained language models (LMs) have recently gained attention for their potential as an alternative to (or proxy for) explicit knowledge bases (KBs). In this position paper, we examine this hypothesis, identify strengths and limitations of both LMs and KBs, and discuss the complementary nature of the two paradigms. In particular, we offer qualitative arguments that latent LMs are not suitable as a substitute for explicit KBs, but could play a major role for augmenting and curating KBs.
연구 동기 및 목표
- 사전에 훈련된 언어 모델(LMs)이 정확성, 신뢰성, 유지보수성 측면에서 명시적 지식 기반(KBs)의 타당한 대안이 될 수 있는지 평가하는 것.
- LMs가 KB로써의 핵심 제약 조건을 특정화하는 것—예를 들어 환각, 근거 없음, 사실과 상관관계를 구분할 수 없음.
- LMs가 지식 기반 캐리지 과정에서 품질을 향상시키는 데 어떻게 활용될 수 있는지 조사하는 것—특히 중복 엔티티 탐지, 새로운 사실 검증, 일관성 확보 측면에서.
- 지식 표현, 스키마 유연성, 유지보수 오버헤드 측면에서 LMs와 KB의 강점과 약점을 대비하는 것.
- LMs가 단독 지식 저장소로 기능하기보다는 KB 진술에 대해 외부 검증자 역할을 수행하도록 보완적인 역할을 주장하는 것.
제안 방법
- 저자들은 주로 GPT-3를 언어 모델로 사용하여, 예를 들어 '앨런 트러닝은 ___에 태어났다'와 같은 제로샷 프롬프트를 통해 모델의 완성 결과로 주어진 서브젝트-서브젝트-오브제 삼중항을 유도한다.
- 모델이 각 완성에 할당한 신뢰도 점수는 후보 사실의 타당성에 대한 증거로 사용되며, 높은 신뢰도는 잠재적 타당성을 시사한다.
- 이 방법은 자연어 프롬프트로 언어 모델을 탐색하고, 상위 순위 예측 및 관련 확률을 분석함으로써 후보 KB 진술을 평가한다.
- 이 접근법은 LMs를 외부 검증자로 간주한다: 만약 LM이 후보 사실에 대해 낮은 신뢰도를 부여한다면, 해당 사실은 검토 또는 기각 대상으로 표시된다.
- 이 프레임워크는 기존 사실 검증과 후보 생성(새로운 사실 제안을 위해 LMs를 활용)을 모두 지원하지만, 후자는 향후 보완이 필요하다.
- 이 방법은 특히 공통어가 함께 나타나는 경향이 있는 사례—예를 들어 잘못된 배우자나 잘못된 수상 내역—에서 LMs를 사용해 일관성 오류와 환각을 탐지하는 데에 중점을 둔다.
실험 결과
연구 질문
- RQ1언어 모델는 사실 정확성과 일관성 측면에서 구조화된 지식 기반을 신뢰성 있게 대체할 수 있는가?
- RQ2언어 모델이 사실 지식에 대해 질의를 받을 때 얼마나 자주 환각하거나 가짜 양성 결과를 생성하는가?
- RQ3희귀하거나 유일한 값에 대해 언어 모델의 신뢰도 점수는 생성된 사실의 진실성과 얼마나 관련이 있는가?
- RQ4지식 기반 캐리지 과정에서 언어 모델이 후보 사실을 검증하거나 반증하기 위한 독립적 증거 소스로 기능할 수 있는가?
- RQ5지식 근거, 스키마의 유연성, 유지보수 측면에서 언어 모델을 지식 기반으로 사용할 때의 주요 제약 조건은 무엇인가?
주요 결과
- GPT-3는 앨런 트러닝이 런던에서 태어났다는 사실에 대해 높은 신뢰도 점수(83%)를 부여하지만, '사라 레이빙턴'을 그의 배우자로 잘못 기입하며 21%의 신뢰도를 가짐.
- LM은 앨런 트러닝이 노벨상 수상자였다고 잘못 예측(26% 신뢰도)하고, '전쟁'을 수상으로 기입함으로써 공통어가 함께 나타나는 경향에 대한 체계적 편향을 보임.
- '달에 첫 여성은'이라는 프롬프트에 대해 GPT-3는 실제로 달에 착륙한 바 없는 사라 라이드와 에일린 콜린스의 잘못된 이름을 생성함으로써 사실의 부재를 인식하지 못하는 것을 보여줌.
- 트러닝 연구소의 주소를 정확히 파악하지 못해 '딜리스 데인'으로 잘못 출력함으로써 희귀하거나 고유한 사실 값에 대해 성능이 열악함을 나타냄.
- 트러닝 상 수상자 목록을 요청했을 때 GPT-3는 정확한 이름과 잘못된 이름의 혼합물을 출력하며, 73명의 수상자 전원을 확보하기 위해 깊은 순위 매김이 필요하고, 유효성의 명확한 종료 지점이 없음.
- 반면, 위키데이터는 앨런 트러닝이 배우자가 없음을 명시적으로 기재하여 '값 없음' 문장을 사용함—이는 LMs가 잠재적 확률적 성격으로 인해 표현할 수 없는 내용임.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.