Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Groundedness in Dialogue Systems: The BEGIN Benchmark

Nouha Dziri, Hannah Rashkin|arXiv (Cornell University)|2021. 04. 30.
Topic Modeling참고 문헌 27인용 수 15
한 줄 요약

이 논문은 지식 기반 대화 시스템에서 응답의 근거성(groundedness)을 평가하기 위해 인간이 애너테이션한 대화 턴 8,113개로 구성된 BEGIN 벤치마크를 소개한다. 이는 적대적으로 생성된 데이터를 사용하여 자동 평가 지표를 평가하며, 확장된 자연어 추론 프레임워크를 통해 모델 출력과 배경 정보 간의 일치도를 향상시킨다.

ABSTRACT

Knowledge-grounded dialogue agents are systems designed to conduct a conversation based on externally provided background information, such as a Wikipedia page. Such dialogue agents, especially those based on neural network language models, often produce responses that sound fluent but are not justified by the background information. Progress towards addressing this problem requires developing automatic evaluation metrics that can quantify the extent to which responses are grounded in background information. To facilitate evaluation of such metrics, we introduce the Benchmark for Evaluation of Grounded INteraction (BEGIN). BEGIN consists of 8113 dialogue turns generated by language-model-based dialogue systems, accompanied by humans annotations specifying the relationship between the system's response and the background information. These annotations are based on an extension of the natural language inference paradigm. We use the benchmark to demonstrate the effectiveness of adversarially generated data for improving an evaluation metric based on existing natural language inference datasets.

연구 동기 및 목표

  • 외부 지식에 의존하는 신경망 기반 대화 시스템에서 발생하는 환각 또는 근거 없는 응답 문제를 해결하기 위해.
  • 응답 생성에서 근거성을 측정하는 자동 평가 지표를 평가하기 위한 표준화된 벤치마크를 개발하기 위해.
  • 자연어 추론 데이터셋에서 파생된 적대적으로 생성된 데이터를 통합하여 기존 평가 지표를 향상시키기 위해.
  • 시스템 응답과 지원 배경 정보 간의 관계를 포괄하는 인간 애너테이션 데이터셋을 제공하기 위해.

제안 방법

  • BEGIN 벤치마크는 지능형 대화 모델 기반의 8,113개 대화 턴을 바탕으로 구성되며, 각 턴은 위키피디아 개요와 같은 배경 정보와 짝을 이룬다.
  • 인간 애너테이터들이 확장된 자연어 추론 프레임워크를 사용하여 각 응답과 배경 간의 관계를 엔타일먼트(entailment), 모순(contadiction), 중립(neutral) 관계로 레이블링한다.
  • 벤치마크는 근거성 평가 지표의 강건성을 시험하고 향상시키기 위해 적대적으로 생성된 데이터를 활용한다.
  • 애너테이션된 데이터를 활용하여 평가 지표를 개선하며, 근거 있는 응답과 근거 없는 응답을 구분하는 데 중점을 둔다.
  • 표준 자연어 추론 프레임워크를 확장하여 지식 기반 대화 맥락에서의 미묘한 관계를 포착한다.
  • 다양한 대화 시나리오에서 자동 평가 지표의 체계적 평가를 지원하도록 데이터셋을 설계한다.

실험 결과

연구 질문

  • RQ1자동 평가 지표는 지식 기반 대화 시스템에서 근거 없는 응답을 얼마나 잘 탐지할 수 있는가?
  • RQ2적대적 데이터 생성은 근거성 평가 지표의 성능을 어느 정도 향상시키는가?
  • RQ3인간 애너테이션은 대화 응답의 근거성을 얼마나 신뢰성 있고 일관성 있게 포착하는가?
  • RQ4BEGIN 벤치마크는 대화 시스템에서 근거성을 평가하기 위한 신뢰할 수 있는 기준으로 기능할 수 있는가?
  • RQ5기존 자연어 추론 데이터셋은 근거 기반 대화 평가에 적용했을 때 어떤 한계를 지니는가?

주요 결과

  • BEGIN 벤치마크는 확장된 자연어 추론 체계에 기반한 인간 애너테이션 레이블을 통해 다양한 응답-근거 관계를 성공적으로 포착한다.
  • 적대적으로 생성된 데이터는 평가 지표가 근거 없는 응답을 탐지하는 능력을 크게 향상시킨다.
  • 기존의 표준 NLI 데이터셋으로 훈련된 지표들은 근거 기반 대화에서 성능이 제한적이며, 전용 벤치마크가 필요함을 시사한다.
  • 인간 애너테이션 데이터는 모델 생성 응답에서 체계적인 실패를 드러내며, 특히 모순되거나 관련 없는 내용을 생성하는 경향이 있다.
  • 이전 접근 방식에 비해 BEGIN 벤치마크는 근거성 평가의 신뢰성과 세분성 면에서 향상된 결과를 제공한다.
  • 결과적으로, 평가 지표 훈련에 적대적 예제를 통합하면 근거성 위반에 대한 민감도가 향상됨을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.