[논문 리뷰] A Trustworthy, Responsible and Interpretable System to Handle Chit Chat in Conversational Bots
이 논문은 계층적 의도 분류, 규칙 기반 패턴 매칭, 그리고 안전 인식 시퀀스 투 시퀀스 생성 시스템을 조합하여 전문 대화형 봇에서의 경청 대화를 처리하기 위한 확장성 있고 해석 가능하며 신뢰할 수 있는 파이프라인을 제안한다. 이 방법은 경청 대화 의도 검출에서 82%의 무게 조정되지 않은 정밀도와 79%의 무게 조정되지 않은 재현율을 달성하여 기존 시스템을 크게 능가하며, 계층적 필터링과 의도 우선순위 지정을 통해 안전하고 관련성 있는 응답을 보장한다.
Most often, chat-bots are built to solve the purpose of a search engine or a human assistant: Their primary goal is to provide information to the user or help them complete a task. However, these chat-bots are incapable of responding to unscripted queries like "Hi, what's up", "What's your favourite food". Human evaluation judgments show that 4 humans come to a consensus on the intent of a given query which is from chat domain only 77% of the time, thus making it evident how non-trivial this task is. In our work, we show why it is difficult to break the chitchat space into clearly defined intents. We propose a system to handle this task in chat-bots, keeping in mind scalability, interpretability, appropriateness, trustworthiness, relevance and coverage. Our work introduces a pipeline for query understanding in chitchat using hierarchical intents as well as a way to use seq-seq auto-generation models in professional bots. We explore an interpretable model for chat domain detection and also show how various components such as adult/offensive classification, grammars/regex patterns, curated personality based responses, generic guided evasive responses and response generation models can be combined in a scalable way to solve this problem.
연구 동기 및 목표
- 전문 대화형 봇에서 스크립트가 없는, 작업과 관련 없는 사용자 쿼리를 다루는 데 어려움을 겪는 문제를 해결하기 위해, 일반적인 '모르겠습니다'라는 응답으로 끝나는 경우를 방지한다.
- 높은 정밀도와 커버리지로 경청 대화 의도를 탐지하면서도 응답의 안전성과 신뢰성을 보장하는 확장성 있고 해석 가능한 시스템을 설계한다.
- 구체적이고 일반적인 의도 수준을 포함하는 계층적 의도 구조를 도입하여 경청 대화 의도 분류의 모호함을 줄이고, 인간의 애너테이션 부담을 최소화한다.
- 시퀀스 투 시퀀스 생성 모델을 전문 환경에서 안전하게 배포하기 위한 신뢰할 수 있는 신호를 제공하여 모욕적이거나 부적절한 응답을 방지한다.
- 자연스럽게 사적인 질문에 응답할 수 있도록 하여 사용자 참여도를 높이면서도, 응답 품질과 적절성에 대한 제어를 유지한다.
제안 방법
- 시스템은 다단계 파이프라인을 사용한다: 먼저 이진 분류기를 통해 쿼리가 경청 대화인지 탐지한 후, 정규 표현식, 흐린 매칭, 신경망 기반 의도 분류기를 사용하여 계층적 의도(구체적 및 일반적)로 분류한다.
- 구체적 의도는 수기로 수집한 쿼리 템플릿과 문법 규칙에 대해 정확한 매칭, 패턴 매칭, 흐린 매칭을 통해 탐지하며, 이로 인해 높은 정밀도(91–98%)를 달성한다.
- 일반적 의도는 453차원의 특징 벡터를 두 층의 완전 연결 신경망에 입력하고, 시그모이드 활성화 함수를 사용하여 예측한다. 이는 각각 1,000건 이상의 쿼리가 포함된 클러스터에서 훈련된다.
- 최종 집계 컴포넌트는 구체적 및 일반적 의도 예측을 통합하며, 위험하거나 충돌하는 예측을 차단하는 규칙을 적용한다 (예: 비판 의도가 높은 신뢰도로 예측된 경우 구체적 의도 예측을 기각한다).
- 안전 신호를 통합하여 위험한 쿼리에 대해 자동 생성을 차단함으로써, 오직 안전하고 적절한 쿼리만 시퀀스 투 시퀀스 모델에 전달되도록 보장한다.
- 파이프라인은 수기로 수집한 응답, 성격 기반 응답, 일반적인 피하기 응답을 조합하여 위험을 최소화하면서도 사용자 참여를 유지한다.
실험 결과
연구 질문
- RQ1의도 간 높은 모호성과 중복으로 인해 전문 대화형 봇에서 경청 대화 쿼리를 신뢰성 있게 탐지하고 분류할 수 있는 방법은 무엇인가?
- RQ2확장성 있고 해석 가능한 경청 대화 의도 탐지에 있어 규칙 기반, 패턴 매칭, 학습된 모델 간의 최적의 균형은 무엇인가?
- RQ3시퀀스 투 시퀀스 생성 모델을 전문 대화형 봇에 안전하게 통합하기 위해 어떤 방법이 필요한가? 특히 모욕적이거나 부적절한 응답의 위험을 줄이기 위해선?
- RQ4계층적 의도 분류(구체적 vs. 일반적)는 경청 이해의 커버리지와 정밀도를 얼마나 향상시킬 수 있는가?
- RQ5규칙 기반의 모듈러한 파이프라인은 실제 세계의 경청 대화 쿼리에서 이해 가능성, 안전성, 성능 면에서 종합 모델보다 뛰어날 수 있는가?
주요 결과
- 시스템은 경청 대화 의도 탐지에서 82%의 무게 조정되지 않은 정밀도와 79%의 무게 조정되지 않은 재현율을 달성하여 기존 시스템(73% 정밀도, 56% 재현율)을 크게 능가한다.
- 정확한 매칭과 패턴 매칭을 통한 구체적 의도 탐지에서 각각 98%와 94%의 정밀도를 기록했으며, 흐린 매칭은 91%의 정밀도를 기록하여 수기로 수집한 쿼리에 대해 매우 높은 신뢰성을 입증한다.
- 일반적 의도 분류기는 78%의 무게 조정되지 않은 정밀도를 기록했으며, 일반적 경청 대화 응답의 본질적인 모호성과 피하기 성향을 감안할 때 이는 수용 가능한 성능이다.
- 전체 시스템은 모든 구성 요소에서 100%의 무게 조정되지 않은 커버리지, 즉 특정 및 일반적 의도 탐지의 조합으로 인해 가중치 커버리지가 100%에 도달한다.
- 안전 인식 집계 레이어는 위험한 응답을 성공적으로 억제한다—예를 들어 사용자가 봇을 비판하고 있을 경우 'command_joke' 매칭을 기각함으로써 응답의 신뢰성을 향상시킨다.
- 안전 신호의 통합을 통해 자동 생성 모델은 오직 안전한 쿼리에 대해서만 사용되며, 전문 환경에서의 부적절한 응답 위험을 줄이는 데 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.