Skip to main content
QUICK REVIEW

[논문 리뷰] Customized Nonlinear Bandits for Online Response Selection in Neural Conversation Models

Bing Liu, Tong Yu|arXiv (Cornell University)|2017. 11. 22.
Speech and dialogue systems인용 수 17
한 줄 요약

이 논문은 검색 기반 대화 시스템에서 온라인 응답 선택을 가능하게 하기 위해 이중 방향 LSTM로 인코딩된 텍스트 표현과 다항식 특성 공간에서의 맞춤형 톰슨 샘플링 방법을 사용하는 신경 비선형 밴딧 모델(이하 NNBM)을 제안한다. 이 방법은 레이블이 적은 데이터로도 선형적 맥락 밴딧보다 뛰어난 성능을 보이며, 누적 누적 손실이 낮고 Recall@k가 높다.

ABSTRACT

Dialog response selection is an important step towards natural response generation in conversational agents. Existing work on neural conversational models mainly focuses on offline supervised learning using a large set of context-response pairs. In this paper, we focus on online learning of response selection in retrieval-based dialog systems. We propose a contextual multi-armed bandit model with a nonlinear reward function that uses distributed representation of text for online response selection. A bidirectional LSTM is used to produce the distributed representations of dialog context and responses, which serve as the input to a contextual bandit. In learning the bandit, we propose a customized Thompson sampling method that is applied to a polynomial feature space in approximating the reward. Experimental results on the Ubuntu Dialogue Corpus demonstrate significant performance gains of the proposed method over conventional linear contextual bandits. Moreover, we report encouraging response selection performance of the proposed neural bandit model using the Recall@k metric for a small set of online training samples.

연구 동기 및 목표

  • 제한된 레이블이 있는 데이터에서 온라인 학습을 수행하는 검색 기반 대화 시스템의 과제를 해결하기 위해.
  • 맥락 밴딧에서 비선형 보상 함수를 모델링하여 응답 선택 성능을 향상시키기 위해.
  • 딥 네트워크 표현(이중 방향 LSTM를 통한)을 맥락 밴딧 알고리즘과 통합하여 온라인 학습을 가능하게 하기 위해.
  • 실시간 상호작용에서 사용자 피드백을 통해 효율적이고 개인화된 응답 선택을 가능하게 하기 위해.
  • 신경망과 맥락 밴딧을 결합한 온라인 대화 학습의 실현 가능성과 효과성을 입증하기 위해.

제안 방법

  • 이중 방향 LSTM를 사용하여 대화 맥락과 응답 후보에 대한 분산 표현을 생성한다.
  • 맥락과 응답 간의 복잡한 상호작용을 포착하기 위해 다항식 특성 공간에서 근사된 비선형 보상 함수를 적용한다.
  • 비선형 특성 공간에서 탐색-이용 균형을 확보하기 위해 맞춤형 톰슨 샘플링 알고리즘을 설계한다.
  • 실시간으로 밴딧 모델을 업데이트하기 위해 이진 사용자 피드백(긍정/부정)을 보상으로 사용한다.
  • 사용자 피드백 기반의 점진적 업데이트를 통해 온라인으로 모델을 훈련하며, 확률적 경사 하강법을 사용한다.
  • 다중 응답 선택(k > 1)을 지원하며, 응답 순위의 신뢰도를 동적으로 조정한다.

실험 결과

연구 질문

  • RQ1신경 텍스트 표현을 갖춘 비선형 맥락 밴딧 모델이 온라인 응답 선택에서 선형 밴딧을 능가할 수 있는가?
  • RQ2제안된 맞춤형 톰슨 샘플링 방법이 대화 시스템에서 희박하고 이진 피드백에서 학습하는 데 얼마나 효과적인가?
  • RQ3이중 방향 LSTM에서 유도된 분산 표현이 TF-IDF에 비해 온라인 학습 성능을 얼마나 향상시키는가?
  • RQ4후보 응답 수(k)가 온라인 응답 선택의 학습 효율성과 성능에 어떤 영향을 미치는가?
  • RQ5소수의 온라인 훈련 샘플만으로도 높은 Recall@k를 달성할 수 있는가?

주요 결과

  • 1000라운드 후 RNN-NonLinear-TS 모델은 평균 누적 손실이 0.61을 기록하여 라운드당 정확한 응답을 선택할 확률이 39%임을 나타낸다.
  • RNN-NonLinear-TS는 누적 손실 측면에서 RNN-Linear-TS를 크게 앞서며, 비선형 보상 모델링의 우수성을 입증한다.
  • 단 800개의 온라인 훈련 샘플로도 높은 Recall@k 성능을 달성하여 자원이 부족한 조건에서도 뛰어난 성능을 보였다.
  • 모든 k 값(k=1, 2, 5)에서 RNN-NonLinear-TS는 RNN-Linear-TS를 일관되게 앞서며, k=2일 때 성능 격차가 더욱 커졌다.
  • 이중 방향 LSTM 표현의 사용은 최소한의 계산으로도 TF-IDF에 비해 성능을 크게 향상시켰다.
  • 더 많은 상호작용 라운드를 거치면서 진짜 응답에 대한 모델의 신뢰도가 증가했고, 상위 두 예측 간 격차가 커져 학습 향상이 이루어졌음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.