Skip to main content
QUICK REVIEW

[논문 리뷰] Mitigating Knowledge Conflicts in Language Model-Driven Question Answering

Han Cao, Zhaoyang Zhang|arXiv (Cornell University)|2024. 11. 18.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 언어 모델 기반 질문 응답에서 과도한 기억된 매개수 지식에 의존하는 것을 줄이기 위해 블로킹 및 프리픽스 어댑터를 사용한 프롬프트 튜닝을 제안한다. 이는 환각 현상을 완화하기 위한 것이다. 이 방법들은 잘못된 기억을 성공적으로 대체하여 KMIR 테스트 세트에서 92.9%의 정확도와 NQ에서 64.8%의 정확도를 달성했으며, 성능 저하 없이 입력 컨텍스트에 대한 충실도가 향상됨을 보여준다.

ABSTRACT

In the context of knowledge-driven seq-to-seq generation tasks, such as document-based question answering and document summarization systems, two fundamental knowledge sources play crucial roles: the inherent knowledge embedded within model parameters and the external knowledge obtained through context. Recent studies revealed a significant challenge: when there exists a misalignment between the model's inherent knowledge and the ground truth answers in training data, the system may exhibit problematic behaviors during inference, such as ignoring input context, or generating unfaithful content. Our investigation proposes a strategy to minimize hallucination by building explicit connection between source inputs and generated outputs. We specifically target a common hallucination pattern in question answering, examining how the correspondence between entities and their contexts during model training influences the system's performance at inference time.

연구 동기 및 목표

  • 언어 모델 기반 질문 응답에서 매개수 지식에 과도하게 의존함으로써 발생하는 사실적 환각 현상을 해결하기 위해.
  • 입력 컨텍스트를 忽시하고 기억된 사실에 기반해 답변을 생성하는 엔티티 기반 지식 갈등을 완화하기 위해.
  • 지나치게 부족한 기반 컨텍스트 하에서 모델 행동을 제약하는 학습 기반 설계를 개발하여 입력에 대한 충실도를 향상시키기 위해.
  • 프롬프트 튜닝과 어댑터를 사용하여 기억된 지식을 대체할 수 있는지 평가하기 위해.
  • 입력 컨텍스트와 생성된 출력 간의 명시적 연관성이 환각 현상을 줄이는지 입증하기 위해.

제안 방법

  • 모델 행동을 제어하기 위해 상호직교적인 두 가지 프롬프트 튜닝 방법인 블로킹 어댑터와 프리픽스 튜닝 어댑터를 제안한다.
  • 기존의 기억된 잘못된 답변을 대체하기 위해, 훈련 중에 셔플된, 컨텍스트적으로 올바른 답변을 새로운 목표로 사용한다.
  • 추론 중 입력 컨텍스트에 주의를 기울이도록 유도하기 위해 기울기 기반 디코딩을 적용한다.
  • 어댑터 기반 훈련을 통해 생성된 답변을 입력 컨텍스트와 명시적으로 일치시켜, 매개수 지식에 대한 의존도를 최소화한다.
  • 모델이 올바른, 컨텍스트에 기반한 출력으로 이끌릴 수 있는지 테스트하기 위해, 답변을 대체한 데이터셋으로 모델을 훈련시킨다.
  • 정확히 일치하는 정확도를 원래 및 수정된 예제에 대해 평가하여 입력 변경에 대한 주의를 측정한다.

실험 결과

연구 질문

  • RQ1프롬프트 튜닝 방법이 언어 모델의 기억된 매개수 지식을 대체하여 환각 현상을 줄일 수 있는가?
  • RQ2블로킹 및 프리픽스 어댑터는 질문 응답에서 입력 컨텍스트에 대한 모델의 충실도를 어느 정도 향상시킬 수 있는가?
  • RQ3입력 컨텍스트와 생성된 출력 간의 명시적 연관성이 엔티티 기반 지식 갈등을 줄이는가?
  • RQ4정답이 컨텍스트적으로 정확한 것으로 대체되었을 때 모델의 성능은 어떻게 변화하는가?
  • RQ5모델이 기억된 사실이 아닌 입력 컨텍스트에 기반한 답변을 일관되게 생성하도록 훈련시킬 수 있는가?

주요 결과

  • 블로킹 어댑터는 KMIR 테스트 세트에서 92.9%의 정확도를 기록하여 잘못된 기억된 답변을 효과적으로 대체하는 데 강력한 성능을 보였다.
  • 더 복잡한 NQ 데이터셋에서 프리픽스 튜닝을 사용한 모델는 64.8%의 정확도를 달성하여 복잡성에도 불구하고 컨텍스트에 효과적으로 주의를 기울이는 것으로 나타났다.
  • qualitative 예시를 통해 두 방법 모두 모델의 출력을 기억된 잘못된 답변에서 컨텍스트적으로 올바른 답변으로 성공적으로 변경했다.
  • 정확히 일치 평가를 통해 모델이 대체된 답변을 생성할 수 있음을 확인했으며, 이는 입력 컨텍스트에 대한 주의 향상됨을 보여준다.
  • 결과적으로, 어댑터를 사용한 프롬프트 튜닝이 성능 저하 없이 환각 현상을 효과적으로 완화할 수 있음을 시사한다.
  • 연구는 입력과 출력 간의 명시적 연관성이 매개수 지식에 대한 과도한 의존도를 줄이며 사실적 일관성을 향상시킴을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.