Skip to main content
QUICK REVIEW

[논문 리뷰] I like fish, especially dolphins: Addressing Contradictions in Dialogue Modeling

Yixin Nie, Mary Williamson|arXiv (Cornell University)|2020. 12. 24.
Topic Modeling참고 문헌 44인용 수 9
한 줄 요약

이 논문은 대화에서 모순를 탐지하기 위한 새로운 작업인 DECODE 작업과 새로운 데이터셋을 소개하며, 미세튜닝된 RoBERTa 모델을 사용한 구조화된 발화 쌍 생성 방식을 제안한다. 이 방식은 표준 비구조화된 방법보다 우수한 성능을 보이며, 인간 평가와 강한 상관관계를 보이고, 재정렬을 통한 생성형 챗봇 출력에서의 모순을 효과적으로 감소시켜, 분포 외 대화에 있어서도 강건성과 이식 가능성을 향상시킨다.

ABSTRACT

To quantify how well natural language understanding models can capture consistency in a general conversation, we introduce the DialoguE COntradiction DEtection task (DECODE) and a new conversational dataset containing both human-human and human-bot contradictory dialogues. We then compare a structured utterance-based approach of using pre-trained Transformer models for contradiction detection with the typical unstructured approach. Results reveal that: (i) our newly collected dataset is notably more effective at providing supervision for the dialogue contradiction detection task than existing NLI data including those aimed to cover the dialogue domain; (ii) the structured utterance-based approach is more robust and transferable on both analysis and out-of-distribution dialogues than its unstructured counterpart. We also show that our best contradiction detection model correlates well with human judgments and further provide evidence for its usage in both automatically evaluating and improving the consistency of state-of-the-art generative chatbots.

연구 동기 및 목표

  • 열린 도메인 대화 시스템의 일관성 측정을 위한 효과적인 벤치마크가 부족한 문제를 해결하기 위해.
  • 사전 훈련된 NLU 모델이 대화적 맥락에서 모순을 얼마나 잘 탐지할 수 있는지 조사하기 위해.
  • 대화에서 모순 탐지에 있어 구조화된 접근 방식과 비구조화된 접근 방식을 비교하기 위해.
  • 모순 탐지가 생성형 챗봇의 일관성을 자동으로 평가하고 향상시키는 데 사용될 수 있는지 평가하기 위해.
  • 인간 평가와 상관관계가 높은 신뢰할 수 있는 자동 평가 지표를 제공하기 위해.

제안 방법

  • 저자들은 대화 이해에서의 일관성을 수량화하기 위해 대화 모순 탐지(DialoguE COntradiction DEtection, DECODE) 작업을 도입한다.
  • 의도적으로 모순이 포함된 인간이 작성한 대화와, 자가 모순이 레이블링된 인간-봇 대화로 구성된 별도의 OOD(분포 외) 세트를 수집한다.
  • 구조화된 발화 기반 접근 방식은 각 발화를 이전 맥락 발화들과 쌍으로 묶은 후, 사전 훈련된 트랜스포머 NLI 모델(예: RoBERTa)에 입력한다.
  • 비구조화된 접근 방식은 모든 대화 발화를 연결하여 동일한 NLI 모델에 직접 입력한다.
  • 최고의 모델은 DECODE 데이터셋에서 미세튜닝된 후, BlenderBot의 디코딩 중 가설을 재정렬하기 위한 자동 평가 지표로 사용된다.
  • 이 방법은 비트 서치, 탑-k 샘플링, 그리고 모순 탐지 점수 기반 재정렬을 통한 샘플링 및 재정렬을 적용하여 생성 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1새로 수집된 DECODE 데이터셋이 대화 모순 탐지 모델 훈련에 있어 기존 NLI 데이터셋보다 얼마나 효과적인가?
  • RQ2구조화된 발화 쌍 생성 접근 방식이 대화에서 모순을 탐지하는 데 있어 표준 비구조화된 연결 방식보다 우수한가?
  • RQ3최고의 모순 탐지 모델이 인간이 레이블링한 일관성 평가와 얼마나 잘 상관되는가?
  • RQ4모순 탐지기가 최신 생성형 챗봇의 일관성을 자동으로 향상시키는 데 사용될 수 있는가?
  • RQ5구조화된 접근 방식이 분포 외(OOD) 대화 설정으로 이식 가능한가?

주요 결과

  • DECODE 데이터셋은 대화 모순 탐지에 있어 기존 NLI 데이터셋보다 훨씬 높은 감독 품질을 제공한다.
  • 구조화된 발화 기반 접근 방식은 비구조화된 접근 방식보다 더 높은 강건성과 OOD 대화로의 더 좋은 이식 가능성을 보였다.
  • DECODE에서 미세튜닝된 최고의 모순 탐지기(RoBERTa)는 일관성에 대한 인간 평가와 강한 상관관계를 보였다.
  • 디코딩 중 재정렬을 위해 탐지기를 사용함으로써 모순 비율이 감소: 생성된 응답에서 비트 서치 시 22.7%에서 탑-k 샘플링 시 1.1%로 감소.
  • 인간 평가 결과, DECODE 기반 재정렬이 다양한 디코딩 전략에서 모순 비율을 감소시키며, 그 효과를 검증하였다.
  • 이 방법은 도메인 내 미세튜닝 데이터가 부족한 환경에서 NLU 일관성 모듈을 NLG 시스템에 통합하는 데 있어 잠재력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.