[논문 리뷰] How to Query Language Models?
이 논문은 사전 훈련된 언어 모델(LMs)을 사실 지식을 탐색하기 위해 사용할 때, 입력 컨텍스트에 소수의 예시를 제공하여 애매한 사실 질문을 해소함으로써 지식 탐색 작업에서 성능을 크게 향상시키는 방법을 제안한다. 단지 10개의 예시—예를 들어 'Ronaldo는 포르투갈에서 뛴다. Neuer는 [MASK]에게 뛴다.'—를 추가하기만 해도, BERT-large는 기준 클로즈 질문 대비 T-REx에서 37.8% 상대적 성능 향상을 기록하며, 복수의 프롬프트 변형을 조합한 앙상블(40개)보다도 뛰어난 성능을 내며 단일 순방향 전파로도 슈퍼아웃퍼포먼스를 달성한다.
Large pre-trained language models (LMs) are capable of not only recovering linguistic but also factual and commonsense knowledge. To access the knowledge stored in mask-based LMs, we can use cloze-style questions and let the model fill in the blank. The flexibility advantage over structured knowledge bases comes with the drawback of finding the right query for a certain information need. Inspired by human behavior to disambiguate a question, we propose to query LMs by example. To clarify the ambivalent question "Who does Neuer play for?", a successful strategy is to demonstrate the relation using another subject, e.g., "Ronaldo plays for Portugal. Who does Neuer play for?". We apply this approach of querying by example to the LAMA probe and obtain substantial improvements of up to 37.8% for BERT-large on the T-REx data when providing only 10 demonstrations--even outperforming a baseline that queries the model with up to 40 paraphrases of the question. The examples are provided through the model's context and thus require neither fine-tuning nor an additional forward pass. This suggests that LMs contain more factual and commonsense knowledge than previously assumed--if we query the model in the right way.
연구 동기 및 목표
- 사전 훈련된 언어 모델을 사실 지식을 탐색하기 위해 사용할 때 발생하는 애매하거나 최적화되지 않은 프롬프트 설계 문제를 해결하기 위해.
- 자연어로 된 컨텍스트 예시를 제공함으로써 마스크된 언어 모델에서의 지식 탐색 정확도 향상 여부를 조사하기 위해.
- 파라프레이즈 앙상블 기법과 같은 전통적 방법보다도 피지컬 훈련 없이 또는 다중 순방향 전파 없이도, 예시 기반 프롬프팅이 성능을 뛰어넘을 수 있는지 평가하기 위해.
- T-REx, ConceptNet, BATS와 같은 다양한 지식 탐색 벤치마크에서 이 방법의 효과성을 평가하기 위해.
제안 방법
- 이 방법은 클로즈 스타일의 질문에 동일한 관계를 자연어로 표현한 하나 이상의 소수 예시를 추가하여 컨텍스트를 확장하는 방식이다. 예를 들어, 'Ronaldo는 포르투갈에서 뛴다. Neuer는 [MASK]에게 뛴다.'
- 예시는 모델의 컨텍스트에 직접 삽입되며, 훈련이 필요하거나 추가 순방향 전파가 필요하지 않다.
- 이 방법은 모델이 예시에서 관계 패턴을 인식하고 새로운 질문에 이를 전이할 수 있는 능력을 활용한다.
- 성능 평가는 표준 벤치마크를 통해 이루어지며, LAMA 프로브(T-REx, Google-RE, ConceptNet), BATS는 어휘 유사성 태스크, TBG는 공통 지식 추론 태스크를 대상으로 한다.
- 각 질문에 대해 모델은 마스크된 토큰을 예측하고, 성능은 P@1(상위 1개 정밀도) 및 기준 대비 상대적 향상도로 측정된다.
- 이 방법은 최신 기준 성능인 파라프레이즈 앙상블(Jiang et al., 2020) 및 컨텍스트 확장 탐색 기법(Petroni et al., 2020)과 비교된다.
실험 결과
연구 질문
- RQ1입력 컨텍스트에 소수의 자연어 예시를 제공함으로써 사전 훈련된 언어 모델의 사실 지식 검색 정확도를 상당히 향상시킬 수 있는가?
- RQ240개의 변형된 프롬프트 앙상블과 비교했을 때, 예시 기반 프롬프팅은 사실 지식 탐색에서 어떤 성능을 보이는가?
- RQ3예시 수가 증가함에 따라 성능 향상이 포화 상태에 도달하는가? 그리고 추가 예시가 거의 효과를 주지 않을 정도로 성능 향상이 줄어드는 지점은 언제인가?
- RQ4이 방법은 사실, 공통 지식, 유사성 추론 태스크를 포함한 다양한 지식 탐색 벤치마크에서 얼마나 잘 일반화되는가?
주요 결과
- 단지 10개의 예시만으로도 BERT-large는 T-REx 데이터셋에서 표준 클로즈 프롬프트 기준 대비 P@1 성능을 37.8% 향상시켰다.
- 소수 예시 기반 프롬프팅 방법은 40개의 변형된 프롬프트 앙상블보다도 뛰어난 정확도를 기록했으며, 단일 순방향 전파로도 뛰어난 성능을 달성했다.
- ConceptNet의 공통 지식 관계 태스크에서는 ALBERT-xxlarge가 10개의 예시로 25%의 상대적 성능 향상을 기록했으며, 해법 가능한 유사성 태스크에서 GloVe 기준보다 뛰어난 성능을 보였다.
- 10개 이상의 예시를 제공할 경우 성능 향상 폭이 감소하여 포화점에 도달함을 확인했으며, 이는 추가 예시가 거의 효과를 주지 못함을 의미한다.
- 관계가 화살표 연산자([s] => [o])로 표현되는 매우 애매한 경우에도 이 방법은 효과적이었으며, 단지 몇 개의 예시만으로도 의도된 관계를 명확히 했다.
- 이 방법은 T-REx, BATS, TBG 벤치마크를 통해 사실, 공통 지식, 형태학적 관계 등 다양한 지식 유형에 대해 강력한 일반화 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.