Skip to main content
QUICK REVIEW

[논문 리뷰] DyKnow: Dynamically Verifying Time-Sensitive Factual Knowledge in LLMs

Seyed Mahed Mousavi, Simone Alghisi|arXiv (Cornell University)|2024. 04. 10.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 실시간 Wikidata 쿼리를 사용해 LLM 내의 노후화된 시간 민감성 사실 지식을 탐지하는 동적 벤치마크인 DyKnow을 소개한다. 이는 대부분의 모델, 특히 GPT-J와 Llama-2가 과거의 사실을 유지하고 있음을 드러낸다. 지식 편집 기법과 Retrieval-Augmented Generation(RAG)을 평가한 결과, RAG는 정렬 성능에서 편집 기법을 능가하지만 모델 가중치를 수정하지는 않으며, 반면 편집 기법은 확장성에 한계가 있으며 모델에 강하게 의존함을 확인했다.

ABSTRACT

LLMs acquire knowledge from massive data snapshots collected at different timestamps. Their knowledge is then commonly evaluated using static benchmarks. However, factual knowledge is generally subject to time-sensitive changes, and static benchmarks cannot address those cases. We present an approach to dynamically evaluate the knowledge in LLMs and their time-sensitiveness against Wikidata, a publicly available up-to-date knowledge graph. We evaluate the time-sensitive knowledge in twenty-four private and open-source LLMs, as well as the effectiveness of four editing methods in updating the outdated facts. Our results show that 1) outdatedness is a critical problem across state-of-the-art LLMs; 2) LLMs output inconsistent answers when prompted with slight variations of the question prompt; and 3) the performance of the state-of-the-art knowledge editing algorithms is very limited, as they can not reduce the cases of outdatedness and output inconsistency.

연구 동기 및 목표

  • LLM 내에서 노후화된 시간 민감성 사실 지식을 탐지하는 데 있어 핵심적인 격차를 해결하기 위해, 특히 과거의 사실이 언제 기록되었는지에 대한 '무엇'과 '언제'를 규명하는 것.
  • 평가 시점에 최신 정보를 Wikidata에서 실시간으로 검색함으로써 노후화되지 않는 동적 벤치마크를 개발하는 것.
  • 현재 사실 지식과 일치시키기 위해 지식 편집 기법과 RAG를 대체 수단으로 평가하는 것.
  • LLM의 훈련 데이터 수신 시기를 분석함으로써 훈련 데이터의 최신성 수준을 추정하는 것.
  • 공개된 코드, 데이터셋, 평가 스크립트를 통해 커뮤니티가 새로운 도메인으로 벤치마크를 확장할 수 있도록 하는 것.

제안 방법

  • DyKnow는 평가 시점에 고유 식별자와 속성을 사용하여 Wikidata에서 실시간으로 시간 스탬프가 부여된 정답을 추출함으로써 최신 사실 지식을 동적으로 검색한다.
  • 벤치마크는 정치(47개 국가), 스포츠(28명의 운동선수), 조직(23명의 CEO/사무국장) 분야의 시간 민감성 사실을 대상으로 하며, 모델 평가를 위한 어휘화된 프롬프트를 사용한다.
  • 모델의 응답을 실시간 Wikidata 응답과 비교함으로써 노후화된 지식을 식별하며, 정확도 일치 및 도메인 간 조화평균을 통해 성능을 측정한다.
  • 지식 편집 기법—ROME, MEMIT, SERAC, IKE—은 네 개의 선택된 LLM에서 노후화된 사실을 수정하기 위해 적용되며, 동일한 벤치마크에서 성능을 평가한다.
  • Retrieval-Augmented Generation(RAG)은 현재 사실 지식을 검색하고 모델이 업데이트된 응답을 생성하도록 프롬프트하는 방식으로 정렬을 위한 대체 수단으로 사용된다.
  • GPT-2 XL 및 Llama-2 Chat와 같은 모델에서 편집 수를 늘리며 편집 기법의 확장성을 평가하며, 성능 저하 정도를 측정한다.

실험 결과

연구 질문

  • RQ1LLM 내 시간 민감성 사실 지식의 어느 정도가 노후화되어 있으며, 사전 훈련/파인튜닝에 사용된 데이터는 언제 수집되었는가?
  • RQ2최신 지식 편집 기법은 LLM 내에서 실제 세계의 시간 민감성 사실을 수정하는 데 얼마나 효과적인가?
  • RQ3RAG는 LLM의 현재 사실 지식과 일치시키기 위해 지식 편집의 신뢰할 수 있는 대체 수단이 될 수 있는가?
  • RQ4다양한 LLM 아키텍처에서 편집 수가 증가함에 따라 편집 기법의 성능은 어떻게 변화하는가?
  • RQ5현재의 편집 및 검색 기반 정렬 기법은 LLM의 최신 지식 유지에 있어 어떤 한계를 지니는가?

주요 결과

  • GPT-J, Llama-2, Falcon, Bloom은 크리스티아누 로날두의 클럽 역사에 대해 노후화된 응답을 내보냈으며, GPT-J는 2021년에 출시되었음에도 불구하고 '레알 마드리스'라고 잘못 응답했다.
  • GPT-3 및 Vicuna와 같은 모델들은 출시 당시에는 정확했지만 시간이 지남에 따라 노후화되어, 배포 후 지식의 쇠퇴가 발생함을 시사한다.
  • ROME와 SERAC는 편집 수가 증가함에 따라 성능 저하를 보이며, 대규모 지식 업데이트에 대한 확장성에 한계가 있음을 나타낸다.
  • IKE는 GPT-J와 Mistral Instruct에서 높은 성능을 보였으며, 이는 인라인 학습이 특정 모델에 대해 효과적일 수 있음을 시사하지만, 모든 노후화된 사실을 수정하지 못했다.
  • RAG는 Mistral Instruct에서 80% 이상의 정렬 성능을 달성했으며, 일부 모델에서는 편집 기법을 능가했지만, 모델 내부 지식을 수정하지는 않는다.
  • MEMIT은 Llama-2 Chat에서 다양한 편집 횟수에 걸쳐 안정적인 성능을 보였고, 반면 ROME와 SERAC는 편집 수 증가에 따라 성능 저하를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.