Skip to main content
QUICK REVIEW

[논문 리뷰] Take Care of Your Prompt Bias! Investigating and Mitigating Prompt Bias in Factual Knowledge Extraction

Ziyang Xu, Keqin Peng|arXiv (Cornell University)|2024. 03. 15.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 사전 훈련된 언어 모델(PLMs)에서 사실 지식을 추출할 때 발생하는 프롬프트 편향을 조사하며, 모든 프롬프트가 비가로운 편향을 보임을 입증한다—특히 AutoPrompt나 OptiPrompt와 같은 기울기 기반 프롬프트가 특히 심한 편향을 보인다. 이는 벤치마크 정확도를 과도하게 높이고 검색 성능을 떨어뜨린다. 저자들은 마스크된 입력 쿼리를 통해 프롬프트 전용 편향을 추정하고, 이를 내부 표현에서 빼는 표현 기반 탈편향 방법을 제안한다. 이는 검색 정확도를 크게 향상시켜 최대 10%p의 절대적 향상을 이끌어내며, 과적합으로 인한 성능 과대평가를 수정함으로써 벤치마크 신뢰성을 높인다.

ABSTRACT

Recent research shows that pre-trained language models (PLMs) suffer from "prompt bias" in factual knowledge extraction, i.e., prompts tend to introduce biases toward specific labels. Prompt bias presents a significant challenge in assessing the factual knowledge within PLMs. Therefore, this paper aims to improve the reliability of existing benchmarks by thoroughly investigating and mitigating prompt bias. We show that: 1) all prompts in the experiments exhibit non-negligible bias, with gradient-based prompts like AutoPrompt and OptiPrompt displaying significantly higher levels of bias; 2) prompt bias can amplify benchmark accuracy unreasonably by overfitting the test datasets, especially on imbalanced datasets like LAMA. Based on these findings, we propose a representation-based approach to mitigate the prompt bias during inference time. Specifically, we first estimate the biased representation using prompt-only querying, and then remove it from the model's internal representations to generate the debiased representations, which are used to produce the final debiased outputs. Experiments across various prompts, PLMs, and benchmarks show that our approach can not only correct the overfitted performance caused by prompt bias, but also significantly improve the prompt retrieval capability (up to 10% absolute performance gain). These results indicate that our approach effectively alleviates prompt bias in knowledge evaluation, thereby enhancing the reliability of benchmark assessments. Hopefully, our plug-and-play approach can be a golden standard to strengthen PLMs toward reliable knowledge bases. Code and data are released in https://github.com/FelliYang/PromptBias.

연구 동기 및 목표

  • 사전 훈련된 언어 모델(PLMs)에서 사실 지식 추출 시 프롬프트 편향의 정도와 영향을 조사하기 위해.
  • 프롬프트 편향이 벤치마크 데이터셋에 과적합되며, 정확도를 인위적으로 높이고 평가 결과를 왜곡함을 입증하기 위해.
  • 프롬프트 편향이 모델의 정확한 사실 지식 검색 능력을 떨어뜨려 잘못된 예측을 유도함을 보여주기 위해.
  • 재훈련 없이도 프롬프트 유형에 따라 유도되는 편향을 제거할 수 있는 플러그 앤 플레이형, 추론 시 탈편향 방법을 제안하기 위해.
  • 편향으로 인한 성능 과대평가를 수정하고 진정된 검색 능력을 향상시킴으로써 사실 지식 벤치마크의 신뢰성을 높이기 위해.

제안 방법

  • 주어진 입력의 주어진 부분을 [MASK]로 대체하여 프롬프트 전용 입력을 생성하고, 이를 기반으로 PLM에 쿼리하여 출력 확률에 대한 프롬프트의 영향을 고립시킨다.
  • 프롬프트가 구조적으로 유도하는 편향을 반영하기 위해 [MASK] 입력으로 프롬프트된 상태에서 모델의 히든 스테이트로부터 '편향된 표현'을 구성한다.
  • 벡터 연산을 통해 주어진 입력의 원본 표현에서 추정된 편향된 표현을 빼내, 탈편향된 표현을 생성한다.
  • 탈편향된 표현을 사용하여 최종 예측을 생성함으로써, 프롬프트 전용 편향의 영향을 효과적으로 제거한다.
  • 다양한 프롬프트, PLMs(예: BERT, Llama2), 그리고 벤치마크(예: LAMA)에 대해 이 방법을 적용하여 일반화성과 강건성을 입증한다.
  • 탈편향된 표현을 문장 임베딩으로 사용하여, PromptBERT와 같은 후속 작업과의 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1다양한 프롬프트 유형이 사실 지식 추출에서 비가로운 프롬프트 편향을 얼마나 보이는가?
  • RQ2프롬프트 편향은 LAMA와 같은 불균형 데이터셋에서 벤치마크 평가의 신뢰성에 어떤 영향을 미치는가?
  • RQ3모델의 내부 지식이 정답을 지지하고 있음에도 불구하고, 프롬프트 편향이 PLMs에게 잘못된 사실 예측을 유도할 수 있는가?
  • RQ4재훈련이나 데이터 조작 없이도 표현 기반의 추론 시 탈편향 방법이 프롬프트 편향을 효과적으로 수정할 수 있는가?
  • RQ5탈편향이 과적합으로 인한 성능 과대평가를 제거하고, 실제로 사실 지식 검색 능력을 향상시키는가, 특히 최첨단 프롬프트와 간단한 수동 프롬프트 간의 성능 격차를 줄이는가?

주요 결과

  • AutoPrompt나 OptiPrompt와 같은 고성능 기울기 기반 프롬프트를 포함한 모든 평가된 프롬프트가 비가로운 프롬프트 편향을 보이며, 특히 OptiPrompt는 상당히 높은 수준의 편향을 보였다.
  • BERT-base를 사용해 LAMA 벤치마크를 프로빙할 경우, 테스트 데이터에 과적합됨으로써 절대 정확도가 16.47% 이상 과대평가될 수 있다.
  • 프롬프트 편향은 잘못된 예측을 유도함으로써 모델 성능을 저하시킨다—예를 들어, BERT가 알바니아인의 종교로 '기독교'를 잘못 예측하는 것과 같이.
  • 제안된 표현 기반 탈편향 방법은 프롬프트 편향으로 인한 과대평가된 성능을 성공적으로 수정하여 보다 신뢰할 수 있는 벤치마크 평가를 복원한다.
  • 이 방법은 다양한 모델과 벤치마크에서 최대 10%p의 절대적 성능 향상을 통해 프롬프트의 검색 능력을 향상시킨다.
  • 탈편향 후 최첨단 프롬프트와 간단한 수동 프롬프트 간의 성능 격차가 줄어들며, 이는 이전 성과 향상의 대부분이 과적합 때문이지 뛰어난 지식 검색 능력 때문이 아니라는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.