Skip to main content
QUICK REVIEW

[논문 리뷰] RECALL: A Benchmark for LLMs Robustness against External Counterfactual Knowledge

Yi Liu, Lianzhe Huang|arXiv (Cornell University)|2023. 11. 14.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 외부 가짜 대조 지식에 대한 강건성(로버스트니)을 평가하기 위한 벤치마크인 RECALL을 소개한다. 기존 데이터셋에서 사실과 어긋나지만 납득할 수 있는 정보를 맥락에 삽입함으로써, 저자는 현재 LLMs가 정확한 내부 지식을 지니고 있음에도 불구하고 이러한 오해의 정보에 매우 취약하다는 것을 입증하며, 간단한 프롬프트 기반 간섭 조치가 제한적인 향상만을 가져온다는 것을 보여준다.

ABSTRACT

LLMs and AI chatbots have improved people's efficiency in various fields. However, the necessary knowledge for answering the question may be beyond the models' knowledge boundaries. To mitigate this issue, many researchers try to introduce external knowledge, such as knowledge graphs and Internet contents, into LLMs for up-to-date information. However, the external information from the Internet may include counterfactual information that will confuse the model and lead to an incorrect response. Thus there is a pressing need for LLMs to possess the ability to distinguish reliable information from external knowledge. Therefore, to evaluate the ability of LLMs to discern the reliability of external knowledge, we create a benchmark from existing knowledge bases. Our benchmark consists of two tasks, Question Answering and Text Generation, and for each task, we provide models with a context containing counterfactual information. Evaluation results show that existing LLMs are susceptible to interference from unreliable external knowledge with counterfactual information, and simple intervention methods make limited contributions to the alleviation of this issue.

연구 동기 및 목표

  • LLMs가 검색 소스에서 온 대조적 정보와 같은 오해의 외부 지식에 얼마나 잘 저항할 수 있는지 평가하는 데 있어 중요한 격차를 해결하기 위해.
  • 신뢰할 수 없거나 잘못된 외부 맥락에 노출된 상황에서도 정확한 답변을 생성할 수 있는 능력을 체계적으로 테스트할 수 있는 표준화된 벤치마크를 만들기 위해.
  • 기존 방법들—예를 들어 프롬프트 엔지니어링과 검색 필터링—이 대조적 간섭에 대해 모델의 강건성을 효과적으로 향상시킬 수 있는지 조사하기 위해.
  • 미래의 진실성과 신뢰성에 관한 LLM 연구를 위한 과제 기반 메트릭을 포함한 신뢰할 수 있는 평가 프레임워크를 제공하기 위해.

제안 방법

  • GPT-3.5-turbo를 사용하여 기존 지식 기반 샘플(이벤트KG 및 UJ 데이터셋에서 유래)을 수정함으로써 맥락 문단에 대조적 사실을 삽입함으로써 RECALL 벤치마크를 구축함.
  • 오답 유도 또는 잘못된 정보를 포함한 맥락을 가진 두 가지 평가 과제—질의 응답(QA-A 및 QA-NA)과 텍스트 생성—을 설계함.
  • 대조적 조건 하에서 모델 성능을 평가하기 위해 새로운 메트릭 두 가지—정답 정확도 및 진실된 생성 점수—을 도입함.
  • 최신 LLMs(예: ChatGLM2, LLaMA, Qwen)를 벤치마크에 적용하여 외부 오해의 정보에 대한 취약성을 측정함.
  • 두 가지 간섭 전략을 탐색함: (1) 신뢰할 수 없는 맥락을 무시하도록 지시하는 프롬프트 기반 방법, (2) 대조적 내용을 제거하는 검색 필터링.
  • 오해의 맥락이 존재할 때 잘못된 응답을 식별하고 필터링하는 데 사용할 수 있는 모델의 자신감 점수를 분석함.

실험 결과

연구 질문

  • RQ1정확한 내부 지식을 지니고 있음에도 불구하고, LLMs는 외부 대조적 지식에 얼마나 취약한가?
  • RQ2신뢰할 수 없는 맥락을 무시하도록 지시하는 프롬프트 기반 지시가 대조적 간섭에 대한 모델의 강건성을 효과적으로 향상시킬 수 있는가?
  • RQ3검색 필터링 방법은 외부 지식 소스의 잘못된 정보의 영향을 어느 정도 완화할 수 있는가?
  • RQ4모델 자신감 점수는 대조적 맥락에 영향을 받은 응답을 식별하는 데 신뢰할 수 있는 지표가 될 수 있는가?

주요 결과

  • 기존 LLMs는 대조적 정보에 매우 취약하다: 정답이 맥락에 명시되어 있음에도 불구하고, 잘못된 사실에 유도당하면 모델들이 자주 잘못된 응답을 생성한다.
  • 신뢰할 수 없는 맥락을 무시하도록 지시하는 프롬프트 기반 간섭 방법은 QA-NA 과제에서 성능 저하를 초래하여, 이러한 지시가 정확한 정보에 대한 신뢰를 감소시킬 수 있음을 시사한다.
  • 사례 연구에서 ChatGLM2는 잘못된 지시를 받은 후, 명시적으로 언급된 'Pierre Cauchon'에서 맥락에 언급되지 않은 'Jean d’Estivet'로 답변을 잘못 바꾸었으며, 이는 모델의 혼란을 보여준다.
  • 검색 필터링 방법은 강건성 향상에 대해 제한적인 효과를 보였으며, 이는 현재의 필터링 기법이 핵심 문제를 해결하는 데 부족함을 시사한다.
  • 모델 자신감 점수는 대조적 지식에 영향을 받은 응답을 식별하는 데 유용한 신호로 밝혀졌지만, 완벽한 예측자라고는 할 수 없다.
  • 벤치마크인 RECALL은 LLM의 강건성에 심각한 격차를 드러낸다: 외부 지식 소스에서 심지어 미세한 사실 왜곡이 존재하더라도 모델은 진실성을 유지하지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.