[논문 리뷰] Adding Chit-Chat to Enhance Task-Oriented Dialogues
이 논문은 인간과 AI가 협력하는 데이터 수집 방식을 통해 맥락적으로 관련된 경청 대화 응답을 통합함으로써 임무 중심 대화를 향상시키는 Accentor 프레임워크를 제안한다. 이 방법은 사전 훈련된 모델을 통해 다양한 경청 대화 후보를 생성하고, 저품질 후보를 필터링하며, 인간의 주석과 근거를 활용하여 품질을 확보한다. 결과적으로 SGD와 MultiWOZ 2.1에서 23.8K개의 보완된 대화가 생성되었으며, 인간 평가 결과로는 유대감, 흥미로움, 지식, 인간다움 측면에서 뚜렷한 향상이 있었고, 기능 성능은 경쟁 수준을 유지하였다.
Existing dialogue corpora and models are typically designed under two disjoint motives: while task-oriented systems focus on achieving functional goals (e.g., booking hotels), open-domain chatbots aim at making socially engaging conversations. In this work, we propose to integrate both types of systems by Adding Chit-Chat to ENhance Task-ORiented dialogues (ACCENTOR), with the goal of making virtual assistant conversations more engaging and interactive. Specifically, we propose a Human AI collaborative data collection approach for generating diverse chit-chat responses to augment task-oriented dialogues with minimal annotation effort. We then present our new chit-chat-based annotations to 23.8K dialogues from two popular task-oriented datasets (Schema-Guided Dialogue and MultiWOZ 2.1) and demonstrate their advantage over the originals via human evaluation. Lastly, we propose three new models for adding chit-chat to task-oriented dialogues, explicitly trained to predict user goals and to generate contextually relevant chit-chat responses. Automatic and human evaluations show that, compared with the state-of-the-art task-oriented baseline, our models can code-switch between task and chit-chat to be more engaging, interesting, knowledgeable, and humanlike, while maintaining competitive task performance.
연구 동기 및 목표
- 임무 중심 대화 시스템과 개방형 대화 봇 사이의 격차를 해소하기 위해 경청 대화를 통합하여 대화의 참여도를 향상시키는 것.
- 임무 중심 대화를 위한 고품질 경청 대화 응답을 생성하기 위해 인간 주석 작업의 노력 최소화를 위한 인간↔AI 협업 파이프라인 개발.
- 더 인간다운, 참여도 높은 상호작용을 위해 임무 중심 목표와 자연스러운 경청 대화 사이를 동적으로 번갈아 사용할 수 있는 새로운 모델 개발.
- SGD와 MultiWOZ 2.1에서 23.8K개의 대화에 경청 대화 주석을 포함한 새로운 공개 데이터셋 구축.
제안 방법
- 두 단계로 구성된 후보 생성 과정: 먼저 사전 훈련된 생성 모델을 사용해 다양한 경청 대화 응답을 생성하고, 이후 맞춤형 미세조정된 분류기를 사용해 저품질 후보를 필터링.
- 필터링된 후보에 대해 인간이 '좋음' 또는 '나쁨'으로 레이블링하고 근거를 제시함으로써 맥락적 관련성과 품질을 확보.
- 보완된 데이터셋을 기반으로 사용자 목표 추적과 경청 대화 응답 생성을 동시에 학습하는 종합적 지도를 제공하는 세 가지 신경망 모델(종합형 및 두 가지 코드 스위처 아키텍처) 개발.
- 자동 평가 도구인 ACUTE-Eval과 인간 평가를 통해 네 가지 축(유대감, 흥미로움, 지식, 인간다움)에서 평가.
- 한 번의 대화에서 임무 중심 응답과 경청 대화 응답을 동적으로 전환할 수 있도록 하는 통합된 훈련 목표 도입.
- 보완된 데이터셋을 기반으로 사전 훈련된 언어 모델을 미세조정하여 기능 성능과 대화 품질을 동시에 향상.
실험 결과
연구 질문
- RQ1최소한의 인간 주석 작업으로 임무 중심 대화에 효과적이고 효율적으로 경청 대화 응답을 생성할 수 있는가?
- RQ2맥락적으로 관련된 경청 대화를 추가함으로써 인간이 대화의 품질을 유대감, 지식, 인간다움 측면에서 향상된 것으로 인식하는가?
- RQ3기능 성능 저하 없이 모델이 임무 중심 응답과 경청 대화 응답 사이를 동적으로 번갈아 사용할 수 있는가?
- RQ4제안된 인간↔AI 데이터 수집 파이프라인이 전적으로 인간 주석이 필요한 방식이나 순수 자동화 방식에 비해 비용과 품질 측면에서 어떻게 비교되는가?
주요 결과
- 인간 평가 결과, 경청 대화가 보완된 대화가 원본 대화에 비해 네 가지 축(유대감, 흥미로움, 지식, 인간다움)에서 유의미하게 더 선호됨.
- 제안된 모델은 인간 평가 지표에서 최신 기준 모델을 초월했으며, 목표 추적 정확도와 액션 결정 F1 점수는 경쟁 수준을 유지함.
- 인간↔AI 협업 데이터 수집 방법은 인간 레이블링 이전에 저품질 후보를 필터링함으로써 주석 작업의 노력을 줄여 효율성을 높임.
- 새로운 데이터셋인 accentor-SGD와 accentor-MultiWOZ 2.1은 맥락적으로 관련된 경청 대화 추가가 이루어진 23.8K개의 대화를 포함하며, 임무와 경청 대화 구성 요소를 명시적으로 주석 처리한 최초의 데이터셋임.
- 코드 스위처 모델은 대화 맥락과 사용자 목표에 부합하는 맥락적 관련성이 높은 경청 대화 응답을 생성할 수 있음.
- ACUTE-Eval을 통한 자동 평가 결과, 보완된 대화가 더 유대감 있고 인간다운 것으로 평가되었으며, 모든 평가 축에서 통계적으로 유의미한 향상이 있었음.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.