[논문 리뷰] Can Generative Pre-trained Language Models Serve as Knowledge Bases for Closed-book QA?
이 논문은 BART와 같은 생성형 사전 훈련된 언어 모델이 추적 가능한 지식 소스를 갖춘 새로운 SQuAD 기반 벤치마크를 통해 닫힌 책 질의 응답을 위한 지식 기반으로 기능할 수 있는지 조사한다. 통제된 환경에서 높은 사실 기억 성능를 보이지만, BART는 지식 유지 및 검색 능력이 열 劣하므로 닫힌 책 QA에서 어려움을 겪는다. 다만, 사전 훈련과 미세조정을 분리하고 지식 회상에 대한 프롬프팅을 활용하는 전략은 성능 향상에 유망한 가능성을 보여준다.
Recent work has investigated the interesting question using pre-trained language models (PLMs) as knowledge bases for answering open questions. However, existing work is limited in using small benchmarks with high test-train overlaps. We construct a new dataset of closed-book QA using SQuAD, and investigate the performance of BART. Experiments show that it is challenging for BART to remember training facts in high precision, and also challenging to answer closed-book questions even if relevant knowledge is retained. Some promising directions are found, including decoupling the knowledge memorizing process and the QA finetune process, forcing the model to recall relevant knowledge when question answering.
연구 동기 및 목표
- 외부 검색 없이도 BART와 같은 생성형 사전 훈련된 언어 모델이 닫힌 책 질의 응답을 위한 내부 지식 기반으로 기능할 수 있는지 평가하는 것.
- 이전 연구가 높은 테스트-트레이닝 겹침을 가진 작은 벤치마크에 의존한 점을 해결하기 위해, 추적 가능한 위키피디아 문단을 사용한 SQuAD 기반의 새로운 벤치마크를 구축하는 것.
- 닫힌 책 질의 응답의 두 핵심 과제인 (1) 사실 지식을 정확히 기억하는 것과 (2) 그 지식을 검색하고 활용하는 것의 고립 및 분석.
- QA에 대한 미세조정이 사전 훈련된 언어 모델의 사실 지식 유지에 부정적인 영향을 미치는지, 그리고 대체 훈련 전략이 성능 향상에 기여할 수 있는지 탐구하는 것.
제안 방법
- 각 질문이 해당 위키피디아 문단과 쌍을 이루는 SQuAD를 기반으로 한 새로운 닫힌 책 질의 응답 벤치마크를 구축하여 추적 가능한 지식 평가를 가능하게 하였다.
- 사전 훈련된 언어 모델의 사실 지식 기억 강화를 위해 BART를 관련 문단으로 언어 모델 미세조정(LM-finetuning)하였다.
- 다양한 수의 훈련 문단에서의 성능을 측정하기 위해, 모델이 문단에서 사실적 구간을 재구성할 수 있는 능력을 측정하는 '재생' 작업을 통해 지식 유지 능력을 평가하였다.
- LM-미세조정된 BART 모델에 대해 QA에 대한 미세조정을 수행하여, 훈련 및 테스트 질문이 동일한 지식 기반에 기반하더라도 후행 닫힌 책 질의 응답 성능을 평가하였다.
- 추론 시 지식 검색을 향상시키기 위해, 관련 문단을 테스트 시간 출력에 통합하는 등의 데이터 증강 기법을 탐색하였다.
- 언어 모델 미세조정과 QA 미세조정을 분리하여 사실 지식 유지 능력을 보존하는 데 기여하는 분리된 훈련 전략을 제안하고 평가하였다.
실험 결과
연구 질문
- RQ1BART와 같은 생성형 사전 훈련된 언어 모델이 언어 모델링 목표로 훈련될 때 다양한 문단들로부터 사실 지식을 효과적으로 기억할 수 있는가?
- RQ2BART가 높은 사실 지식 기억 성능를 보임에도 불구하고 닫힌 책 질의 응답 성능이 떨어지면, 이는 지식 검색 또는 활용 실패를 의미하는가?
- RQ3QA에 대한 미세조정이 언어 모델 미세조정 기간 동안 기억된 사실 지식에 얼마나 영향을 미치는가?
- RQ4관련 문단을 테스트 입력에 통합하는 등의 단순한 데이터 증강 기법이 지식 검색을 지원함으로써 닫힌 책 질의 응답 성능을 향상시킬 수 있는가?
- RQ5언어 모델 미세조정과 QA 미세조정 과정을 분리함으로써 사실 지식 유지 능력과 QA 정확도가 향상되는가?
주요 결과
- BART는 테스트-트레이닝 겹침이 높은 다른 데이터셋에서는 높은 성능를 보였지만, SQuAD 기반의 닫힌 책 질의 응답 벤치마크에서는 단지 1.5%의 정확도를 기록하였다.
- 500개의 문단으로 미세조정한 경우 BART는 필요한 사실 지식의 66%를 기억했지만, 5,000개의 문단으로 미세조정한 경우 이 비율은 단지 4%로 떨어져 극심한 카오스틱 포기(catastrophic forgetting)가 발생하는 것으로 나타났다.
- LM-미세조정을 통해 대부분의 사실 지식을 유지하고도, QA 미세조정 이후에도 BART는 대부분의 닫힌 책 질문에 답하지 못해 지식 활용의 근본적인 과제를 보여주었다.
- QA 미세조정은 재생 작업에서 사실 기억 능력을 떨어뜨려, 과제에 특화된 적응과 사실 유지 사이의 상충 관계를 시사한다.
- 관련 문단을 테스트 입력에 통합하면 지식 검색이 향상되어 BART의 성능이 향상되며, 이는 외부 프롬프팅 엔지니어링으로 내부 지식 격차를 보완할 수 있음을 시사한다.
- LM-미세조정과 QA-미세조정 과정을 분리함으로써 과제에 특화된 적응 과정에서 사실 지식 유지 능력이 향상되었으며, 이는 닫힌 책 질의 응답 성능 향상에 유망한 길을 제시한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.