Skip to main content
QUICK REVIEW

[논문 리뷰] You Truly Understand What I Need: Intellectual and Friendly Dialogue Agents grounding Knowledge and Persona

Jungwoo Lim, Myunghoon Kang|arXiv (Cornell University)|2023. 01. 06.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 다중 인코더 기반 검색 시스템과 검색 증강 생성을 사용하여 외부 지식과 사용자 성격을 동시에 기반으로 하는 대화 에이전트 INFO를 제안한다. 검색된 지식과 성격 정보로 입력 쿼리를 강화함으로써 모델은 더 정보가 풍부하고 참여도가 높으며 환각 현상이 적은 응답을 생성하며, 성격-지식 대화 벤치마크에서 지식 기반 및 생성 작업 모두에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

To build a conversational agent that interacts fluently with humans, previous studies blend knowledge or personal profile into the pre-trained language model. However, the model that considers knowledge and persona at the same time is still limited, leading to hallucination and a passive way of using personas. We propose an effective dialogue agent that grounds external knowledge and persona simultaneously. The agent selects the proper knowledge and persona to use for generating the answers with our candidate scoring implemented with a poly-encoder. Then, our model generates the utterance with lesser hallucination and more engagingness utilizing retrieval augmented generation with knowledge-persona enhanced query. We conduct experiments on the persona-knowledge chat and achieve state-of-the-art performance in grounding and generation tasks on the automatic metrics. Moreover, we validate the answers from the models regarding hallucination and engagingness through human evaluation and qualitative results. We show our retriever's effectiveness in extracting relevant documents compared to the other previous retrievers, along with the comparison of multiple candidate scoring methods. Code is available at https://github.com/dlawjddn803/INFO

연구 동기 및 목표

  • 기존 대화 에이전트가 환각 현상이나 성격 정보를 수동적으로 사용하는 등의 한계를 해결하기 위해 지식과 성격을 동시에 기반으로 하는 것.
  • 환각 현상을 줄이고 개방형 개인화 대화 시스템에서 응답 품질을 향상시키기 위해 성격 정보를 통합하는 것.
  • 토큰 수준의 마진화를 통해 기반 지식과 생성 간 일관성을 유지하는 검색 증강 생성 프레임워크 개발.
  • 지식과 성격 동시 검색에 최적화된 후보 스코링 방법(이중 인코더, 크로스 인코더, 다중 인코더)의 효과를 평가하는 것.
  • 검색된 지식과 성격 정보의 근원을 통해 응답의 해석 가능성과 증거의 신뢰성을 확보하는 것.

제안 방법

  • 대화 맥락에 대한 관련성을 평가하기 위해 후보 지식 및 성격 문단에 대해 다중 인코더 아키텍처를 사용하여 스코어를 계산한다.
  • 생성기의 입력 프롬프트에 검색된 지식과 성격 정보를 통합하여 지식-성격 기반 쿼리를 구성한다.
  • 비모수적 메모리(검색된 문서)와 모수적 생성기(대규모 언어 모델)를 사용한 검색 증강 생성(RAG)을 통해 응답의 일관성을 향상시킨다.
  • 학습 중에 생성된 응답이 검색된 지식과 성격 정보 양쪽과 일치하도록 토큰 수준의 마진화 손실을 적용한다.
  • 다중 성격 선택을 지원하기 위해 성격 수준의 지표를 도입하여 개인적 특성에 대한 세밀한 기반 지식을 구현한다.
  • 이중 인코더, 크로스 인코더, 다중 인코더 등의 다양한 검색 컴포넌트를 비교하여 기반 지능 정확도와 응답 품질에 미치는 영향을 평가한다.
Figure 1: Overview of our method. $U$ is the input comprises dialogue history and knowledge snippet, and $cand$ denotes each candidate from the grounding tasks. The grounding score is obtained through the dot product operation with the representation of input context $U_{dial}$ and candidate $a_{t}$
Figure 1: Overview of our method. $U$ is the input comprises dialogue history and knowledge snippet, and $cand$ denotes each candidate from the grounding tasks. The grounding score is obtained through the dot product operation with the representation of input context $U_{dial}$ and candidate $a_{t}$

실험 결과

연구 질문

  • RQ1대화 에이전트는 외부 지식과 사용자 성격 양쪽을 효과적으로 기반으로 하여 환각 현상을 줄일 수 있는가?
  • RQ2입력 쿼리에 지식과 성격을 통합할 경우 응답의 참여도와 사실적 일관성은 어떻게 영향을 받는가?
  • RQ3후보 스코링 방법 중에서(이중 인코더, 크로스 인코더, 다중 인코더) 어떤 것이 지식과 성격 동시 검색에서 최고의 성능을 내는가?
  • RQ4제안된 검색 증강 생성 프레임워크는 표준 파인튜닝 모델 대비 생성 품질을 얼마나 향상시키는가?
  • RQ5모델은 인간 평가를 통해 사실 기반이고 사회적으로 유능한 응답을 생성할 수 있는가?

주요 결과

  • INFO는 성격-지식 대화 벤치마크에서 지식 기반 및 생성 작업 모두에서 최신 기술 수준의 성능을 달성하여 기존 모델보다 자동 평가 지표에서 뛰어난 성능을 보였다.
  • 인간 평가 결과, BART 및 GPT-2와 같은 베이스라인 모델 대비 INFO는 환각 현상이 현저히 줄어들고 참여도가 높은 응답을 생성함을 확인했다.
  • 후보 스코링에서 다중 인코더가 이중 인코더 및 크로스 인코더보다 우수한 성능을 보였으며, 맥락과 후보 지식/성격 간의 관련성을 더 잘 포착하는 능력을 입증했다.
  • 정성적 분석 결과, INFO는 정확한 지식과 성격 정보를 검색하고 통합하는 데 성공했고, 베이스라인은 환각 현상이 발생하거나 성격 정보를 완전히 忽略했다.
  • 검색된 자료를 활용함으로써 모델의 응답은 해석 가능성이 높아지고 증거의 근원을 추적할 수 있어, 사실적 진술의 근거를 명확히 할 수 있었다.
  • 모델은 성격 정보를 능동적으로 대화에 통합함으로써 반복적이고 일반적인 응답을 줄였으며, '나는 네 자녀를 가지고 있다'와 같은 수동적인 문장은 피했다.
(a) Adequacy
(a) Adequacy

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.