Skip to main content
QUICK REVIEW

[논문 리뷰] A Clarifying Question Selection System from NTES_ALONG in Convai3 Challenge

Wenjie Ou, Yue Lin|arXiv (Cornell University)|2020. 10. 27.
Topic Modeling참고 문헌 6인용 수 6
한 줄 요약

이 논문은 대화형 정보 검색에서 모호한 사용자 쿼리에 대한 명확화 질문 선택 시스템을 제안하며, 응답 이해를 위한 미세튜닝된 ELECTRA, 후보 질문 회수를 위한 향상된 BM25, 그리고 순위 매기기 위한 ELECTRA 기반 모델의 앙상블를 결합한다. 이 시스템은 최고의 성능을 기록하여 ConvAI3 챌린지에서 1등을 차지했으며, 질문 관련도에서 recall@[20,30]가 가장 높고, 다중 턴 문서 관련도 평가에서 최상의 점수를 기록했다.

ABSTRACT

This paper presents the participation of NetEase Game AI Lab team for the ClariQ challenge at Search-oriented Conversational AI (SCAI) EMNLP workshop in 2020. The challenge asks for a complete conversational information retrieval system that can understanding and generating clarification questions. We propose a clarifying question selection system which consists of response understanding, candidate question recalling and clarifying question ranking. We fine-tune a RoBERTa model to understand user's responses and use an enhanced BM25 model to recall the candidate questions. In clarifying question ranking stage, we reconstruct the training dataset and propose two models based on ELECTRA. Finally we ensemble the models by summing up their output probabilities and choose the question with the highest probability as the clarification question. Experiments show that our ensemble ranking model outperforms in the document relevance task and achieves the best recall@[20,30] metrics in question relevance task. And in multi-turn conversation evaluation in stage2, our system achieve the top score of all document relevance metrics.

연구 동기 및 목표

  • 대화형 정보 검색에서 모호한 사용자 쿼리에 대해 강력한 명확화 질문 선택 시스템을 개발하기 위해.
  • 검색 정확도를 향상시키기 위해 언제 그리고 어떻게 명확화 질문을 요청할지 결정하는 과제를 해결하기 위해.
  • 사용자 의도 모델링과 질문 순위 매기기의 엔드 투 엔드 모델링을 통해 선택된 명확화 질문의 관련도를 향상시키기 위해.
  • 특히 질문 관련도와 다중 터닝 대화 평가에서 뛰어난 성능을 달성하기 위해 ClariQ 벤치마크에서 초우수한 성능을 내는 것.

제안 방법

  • P@5 점수를 기반으로 응답이 명확화가 필요한지 여부를 분류하기 위해 대규모 ELECTRA 모델을 미세튜닝하여 사용자 응답 이해를 수행한다.
  • 질문뿐만 아니라 관련된 초기 요청, 답변 및 주제 설명까지 인덱싱하여 BM25 검색 모델을 향상시킨다.
  • 학습을 위한 음성 샘플을 무작위 샘플링과 BM25 기반 음성 샘플링을 모두 활용하여 순위 매기기 일반화 성능을 향상시킨다.
  • 표준 시퀀스 분류 모델과 다중 작업 학습 모델이라는 두 가지 다른 ELECTRA 기반 모델을 훈련시켜 표현 학습을 향상시킨다.
  • 두 순위 매기기 모델의 출력 확률을 합산하고 가장 높은 확률을 가진 질문을 최종 명확화 질문으로 선택하는 방식으로 앙상블한다.
  • 파이프라인 아키텍처를 사용한다: 응답 이해 → 후보 질문 회수 → 명확화 질문 순위 매기기. 각 단계는 별도로 최적화된다.

실험 결과

연구 질문

  • RQ1대화형 정보 검색 환경에서 사용자 응답이 명확화가 필요한지 효과적으로 판단할 수 있는 방법은 무엇인가?
  • RQ2사용자 입력을 바탕으로 대량의 질문 데이터베이스에서 후보 명확화 질문을 회수하는 최적의 방법은 무엇인가?
  • RQ3여러 개의 ELECTRA 기반 모델을 사용한 앙상블 학습이 단일 모델 대비 선택된 명확화 질문의 관련도를 향상시킬 수 있는가?
  • RQ4특히 문서 검색 효과성 측면에서, 다중 터닝 대화 시나리오에서 시스템의 성능은 어떠한가?

주요 결과

  • 앙상블 순위 매기기 모델은 질문 관련도 작업에서 가장 높은 recall@[20,30]를 기록하여 참가자 모델 전부를 압도했다.
  • 문서 관련도 작업에서 앙상블 모델은 개발 및 테스트 세트 양쪽에서 강력한 성능을 기록하여 상위권에 진입했다.
  • 다중 터닝 대화 평가(단계 2)에서 시스템은 MRR, P@1, nDCG@3, nDCG@5를 포함한 모든 문서 관련도 메트릭에서 최고 점수를 기록했다.
  • 시스템은 강력한 일반화 능력을 보였으며, 사용자 의도를 묻거나 이전 답변에 기반해 쿼리를 다듬는 등 명확하고 맥락에 부합하는 명확화 질문을 일관되게 선택했다.
  • 확장된 인덱싱을 적용한 향상된 BM25 모델은 특히 짧고 일반적인 질문에 대해 후보 질문 회수 품질을 향상시켰다.
  • 다중 작업 ELECTRA 모델은 질문 관련도 작업에서 recall@[5,10]가 가장 높아 초기 순위 관련도에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.