[논문 리뷰] Knowledgeable or Educated Guess? Revisiting Language Models as Knowledge Bases
이 논문은 BERT와 같은 사전 훈련된 마스킹 언어 모델(MLM)이 사실 지식 기반으로 신뢰성 있게 기능할 수 있는지 조사한다. 프롬프트 기반, 케이스 기반, 컨텍스트 기반의 세 가지 지식 추출 파라다임을 철저히 분석한 결과, 높은 성능은 진정한 지식 검색이 아니라 프롬프트 편향, 엔티티 유형 안내, 외부 컨텍스트 내의 답변 누출(명시적 또는 암시적) 덕분임을 드러낸다. 본 연구는 MLM이 신뢰할 수 있는 지식 소스로 간주되는 데 이르는 이전 결론들을 도전한다.
Previous literatures show that pre-trained masked language models (MLMs) such as BERT can achieve competitive factual knowledge extraction performance on some datasets, indicating that MLMs can potentially be a reliable knowledge source. In this paper, we conduct a rigorous study to explore the underlying predicting mechanisms of MLMs over different extraction paradigms. By investigating the behaviors of MLMs, we find that previous decent performance mainly owes to the biased prompts which overfit dataset artifacts. Furthermore, incorporating illustrative cases and external contexts improve knowledge prediction mainly due to entity type guidance and golden answer leakage. Our findings shed light on the underlying predicting mechanisms of MLMs, and strongly question the previous conclusion that current MLMs can potentially serve as reliable factual knowledge bases.
연구 동기 및 목표
- 마스킹 언어 모델(MLM)인 BERT와 같은 모델들이 신뢰할 수 있는 사실 지식 기반으로 기능할 수 있는지 철저히 평가하는 것.
- 프롬프트 기반, 케이스 기반, 컨텍스트 기반 추출과 같은 세 가지 주요 지식 추출 파라다임에서 성능을 이끄는 근본적 메커니즘을 조사하는 것.
- 높은 성능가 진정한 지식 액세스 때문인지, 프롬프트 편향, 엔티티 유형 안내, 또는 답변 누출과 같은 아티팩트 때문인지 밝히는 것.
- MLM이 신뢰할 수 있는 사실 지식을 지닌다는 가정을 전제로 한 이전 벤치마크 및 평가의 타당성을 도전하는 것.
제안 방법
- BERT-large 및 RoBERTa-large를 사용하여 프롬프트 기반 추출, 케이스 기반 유사성, 컨텍스트 기반 추론의 세 가지 지식 추출 파라다임을 체계적으로 분석하였다.
- Wikidata 분류 체계를 활용해 관계에 대한 개체 유형을 유도하는 새로운 알고리즘을 제안하여 케이스 기반 파라다임에서 유형 안내의 역할을 평가하였다.
- 황금 답변을 컨텍스트에서 마스킹하여 명시적 및 암시적 답변 누출을 구분하기 위해 통제된 환경에서 성능을 평가하였다.
- 마스킹된 답변이 나머지 컨텍스트에서 재구성 가능한지 여부에 따라 컨텍스트를 그룹화하여 암시적 답변 누출의 영향을 분리하였다.
- LAMA와 같은 표준 벤치마크에서 정확도 및 F1과 같은 정량적 지표를 사용하여 파라다임 및 조건 간 성능을 비교하였다.
- 예측 성능에 기여하는 프롬프트, 예시 케이스, 외부 컨텍스트의 기여를 분리하기 위해 아블레이션 연구를 수행하였다.
실험 결과
연구 질문
- RQ1MLM에서 프롬프트 기반 지식 추출 성능은 내부 사실 지식보다 프롬프트 설계에 얼마나 의존하는가?
- RQ2예시 케이스는 MLM 예측에 어떻게 영향을 주는가? 사실 정확도를 향상시키는가, 아니면 단지 엔티티 유형 인식을 안내하는가?
- RQ3컨텍스트 기반 추론에서 외부 컨텍스트의 진정한 기여는 무엇인가? 답변 누출인가, 아니면 문맥 추론인가?
- RQ4외부 컨텍스트에서 성능 향상은 명시적 답변 존재 때문인가, 아니면 암시적 답변 재구성 때문인가?
- RQ5현재 평가 벤치마크는 진정한 지식 검색을 반영하는가, 아니면 데이터셋 특화 편향 같은 아티팩트를 반영하는가?
주요 결과
- 프롬프트 기반 추출 성능은 프롬프트 형식에 심각하게 편향되어 있으며, 예측이 사실 정확도보다 프롬프트 어휘에 더 강하게 상관관계를 가지며, 일반화 능력이 열악함을 시사한다.
- 예시 케이스는 주로 엔티티 유형 안내를 통해 성능을 향상시키며, 동일한 유형 범주 내에서 정확한 답변 선택을 향상시키기보다는 유형 인식을 돕는 데 주로 기여한다.
- 외부 컨텍스트는 주로 답변 누출 덕분에 성능을 크게 향상시키며, 이는 명시적 언급이든 암시적 재구성 이든 간에 해당한다.
- 황금 답변이 컨텍스트에서 마스킹된 상태에서도, 나머지 컨텍스트가 답변을 재구성할 수 있다면 성능이 높게 유지되며, 이는 암시적 답변 누출의 역할을 확인한다.
- 컨텍스트 기반 추론에서 성능 향상은 문맥에 대한 추론 때문이 아니라, 답변과 관련된 충분한 증거가 존재하기 때문이며, 이는 명시적일 수도 있고 암시적일 수도 있다.
- 전반적인 발견은 MLM이 신뢰할 수 있는 지식 기반으로 기능할 수 있다는 이전 결론의 타당성을 도전하며, 현재 성공의 근본 원인이 강력한 지식 액세스가 아니라 데이터셋 아티팩트임을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.