Skip to main content
QUICK REVIEW

[논문 리뷰] Knowledge Infused Decoding

Ruibo Liu, Guo‐qing Zheng|arXiv (Cornell University)|2022. 04. 06.
Topic Modeling인용 수 11
한 줄 요약

지식 통합 디코딩(KID)는 강화학습으로 최적화된 로컬 지식 메모리와 동적 구성된 지식 트라이를 통해 자동회귀 언어모델 생성 과정에 외부 지식을 동적으로 통합하는 작업 및 모델에 관계없이 적용 가능한 디코딩 알고리즘이다. 이는 여섯 가지 지식 집약적 자연어 생성(NLG) 작업에서 사실성 일관성과 성능을 크게 향상시키며, 재학습이나 아키텍처 변경 없이도 강력한 베이스라인 및 작업 최적화 모델을 능가한다. 특히 소수 샘플 설정에서 두각을 나타낸다.

ABSTRACT

Pre-trained language models (LMs) have been shown to memorize a substantial amount of knowledge from the pre-training corpora; however, they are still limited in recalling factually correct knowledge given a certain context. Hence, they tend to suffer from counterfactual or hallucinatory generation when used in knowledge-intensive natural language generation (NLG) tasks. Recent remedies to this problem focus on modifying either the pre-training or task fine-tuning objectives to incorporate knowledge, which normally require additional costly training or architecture modification of LMs for practical applications. We present Knowledge Infused Decoding (KID) -- a novel decoding algorithm for generative LMs, which dynamically infuses external knowledge into each step of the LM decoding. Specifically, we maintain a local knowledge memory based on the current context, interacting with a dynamically created external knowledge trie, and continuously update the local memory as a knowledge-aware constraint to guide decoding via reinforcement learning. On six diverse knowledge-intensive NLG tasks, task-agnostic LMs (e.g., GPT-2 and BART) armed with KID outperform many task-optimized state-of-the-art models, and show particularly strong performance in few-shot scenarios over seven related knowledge-infusion techniques. Human evaluation confirms KID's ability to generate more relevant and factual language for the input context when compared with multiple baselines. Finally, KID also alleviates exposure bias and provides stable generation quality when generating longer sequences. Code for KID is available at https://github.com/microsoft/KID.

연구 동기 및 목표

  • 사전 훈련된 언어모델이 지식 집약적 생성 과정에서 발생하는 사실성 오류를 해결하기 위해.
  • RAG와 같은 모델에서 정적 지식 검색의 한계를 극복하여 장기 생성 중 변화하는 맥락에 적응하지 못하는 문제를 해결하기 위해.
  • 모델 미세조정이나 아키텍처 수정 없이도 사실성 일관성을 향상시키는 경량의 추론 시기 솔루션을 개발하기 위해.
  • 장문 생성에서의 노출 편향을 완화하고 소수 샘플 일반화 능력을 향상시키기 위해.
  • 학습 가능한 맥락 인식 지식 메모리를 통해 해석 가능하고 제어 가능한 지식 통합을 가능하게 하기 위해.

제안 방법

  • KID는 검색된 문서에서 관련 엔티티와 사실을 저장하는 유한한 선입선출(FIFO) 리스트인 로컬 지식 메모리를 유지한다.
  • 각 디코딩 단계에서 KID는 검색된 지원 문서들로부터 동적 지식 트라이를 구성하여 관련 지식를 효율적으로 검색한다.
  • 로컬 지식 메모리는 강화학습을 통해 업데이트되어 다음 토큰의 확률 분포를 지식 관련 엔티티 쪽으로 유도함으로써 디코딩을 안내한다.
  • 지식 통합은 오직 추론 시기에만 수행되므로 KID는 재학습이나 아키텍처 변경 없이도 어떤 사전 훈련된 언어모델과도 호환된다.
  • 엔티티 일관성과 관련성을 기반으로 한 보상 신호를 사용하여 지식 인식 디코딩 정책을 최적화한다.
  • KID는 비드 서치나 뉴클레어 샘플링과 같은 표준 디코딩 전략과 통합되어 실시간 지식 제약 조건을 추가로 제공한다.

실험 결과

연구 질문

  • RQ1경량의 추론 시기 디코딩 방법이 재학습이나 아키텍처 변경 없이도 사전 훈련된 언어모델의 사실성 일관성을 크게 향상시킬 수 있는가?
  • RQ2장문 및 다중 턴 생성 과업에서 디코딩 중 동적 지식 통합은 정적 검색 방법보다 어떻게 비교되는가?
  • RQ3KID는 작업 최적화 모델에 비해 소수 샘플 및 저자원 환경에서 얼마나 잘 일반화되는가?
  • RQ4KID는 장문 생성에서 노출 편향을 효과적으로 완화하는가?
  • RQ5강화학습을 통한 지식 인식 디코딩이 개괄적 자연어 생성(NLG) 과업에서 관련성과 사실성 모두를 향상시키는가?

주요 결과

  • KID는 요약 생성, 대화 생성, 개방형 스토리 생성 등 여섯 가지 다양한 지식 집약적 NLG 과업에서 기존의 비드 서치 및 샘플링 방식을 뛰어넘는 성능을 보였다.
  • ELI5 및 WoW 벤치마크에서 인간 평가자들이 KID가 생성한 출력이 RAG 및 기타 베이스라인 대비 사실성과 관련성에서 평균 1.5~2.0점 높게 평가했다.
  • 소수 샘플 설정에서 KID는 일곱 가지 강력한 지식 통합 베이스라인을 능가하여 저자원 환경에서 뛰어난 일반화 능력과 강건성을 입증했다.
  • KID는 노출 편향을 완화하여 장문 생성에서도 일관된 사실성 품질을 유지했으며, RAG 및 유사 모델은 종종 주제에서 벗어나는 경향이 있었다.
  • KID는 GPT-2와 BART만을 사용하여도 평가된 모든 과업에서 최고 성능을 기록했으며, 이는 재학습 없이도 플러그 앤 플레이 방식의 효과적인 보완임을 입증했다.
  • 지식 트라이와 로컬 메모리 구성 요소는 추론 오버헤드를 최소화했으며, KID의 메모리 크기는 관리 가능했고(지식 트라이 기준 10MB 이하), 단계당 추론 비용은 약 O(1)이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.