Skip to main content
QUICK REVIEW

[논문 리뷰] Fantastic Rewards and How to Tame Them: A Case Study on Reward Learning for Task-oriented Dialogue Systems

Yihao Feng, Shentao Yang|arXiv (Cornell University)|2023. 02. 20.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 엔드 투 엔드 작업 지향 대화 시스템에서 보상 함수를 훈련하기 위해 랭킹 기반 학습 기반의 두 가지 목적 함수인 RewardNet과 RewardMLE를 제안한다. 대화 트레이젝터리에서 기반으로 하는 선호도 신호를 학습함으로써, 더 효과적인 오프라인 강화 학습을 가능하게 하여 MultiWOZ 2.0 벤치마크에서 통합 점수 107.11을 달성하며 최신 기술 수준을 확보한다.

ABSTRACT

When learning task-oriented dialogue (ToD) agents, reinforcement learning (RL) techniques can naturally be utilized to train dialogue strategies to achieve user-specific goals. Prior works mainly focus on adopting advanced RL techniques to train the ToD agents, while the design of the reward function is not well studied. This paper aims at answering the question of how to efficiently learn and leverage a reward function for training end-to-end (E2E) ToD agents. Specifically, we introduce two generalized objectives for reward-function learning, inspired by the classical learning-to-rank literature. Further, we utilize the learned reward function to guide the training of the E2E ToD agent. With the proposed techniques, we achieve competitive results on the E2E response-generation task on the Multiwoz 2.0 dataset. Source code and checkpoints are publicly released at https://github.com/Shentao-YANG/Fantastic_Reward_ICLR2023.

연구 동기 및 목표

  • 엔드 투 엔드 작업 지향 대화(ToD) 시스템에서 오프라인 강화 학습의 희박한 보상 신호 문제를 해결하기 위해.
  • 대화 트레이젝터리 간의 선호도 순서를 반영하는 보다 정보적인 보상 함수를 설계하여 정책 최적화를 향상시키기 위해.
  • 학습된 보상 신호를 사용하여 사전 훈련된 언어 모델의 효과적인 파인튜닝을 가능하게 하여 더 나은 대화 생성을 위해.
  • 상대적 선호도 학습을 통해 인간의 행동을 초월한 일반화 및 성능 향상을 위해.
  • 복잡한 대화 환경에서 보상 함수 학습을 위한 안정적이고 확장 가능한 프레임워크를 제공하기 위해.

제안 방법

  • 선호도 신호에 기반해 양호한(고품질) 대화 트레이젝터리를 부정적인 것보다 높게 순위 매기는 대조 학습 목적 함수인 RewardNet을 제안한다.
  • 최대우도추정 기반 방법인 RewardMLE를 도입하여 학습된 보상 함수를 사용해 선호되는 트레이젝터리의 확률을 모델링한다.
  • 보상 함수를 매개변수화하기 위해 BART 기반 아키텍처를 사용하여 보상 모델에서 응답 생성 정책으로의 기울기 흐름을 가능하게 한다.
  • MultiWOZ 2.0 데이터셋에서 고정 길이의 대화 트레이젝터리로 보상 모델을 훈련시키며, 유사한 복잡도의 트레이젝터리를 비교하여 의미 있는 선호도 학습을 보장한다.
  • 학습된 보상 함수를 사용해 Gumbel-Softmax 샘플링을 통해 엔드 투 엔드 ToD 에이전트를 훈련하는 데 오프라인 강화 학습을 지도한다.
  • 훈련 안정성을 높이기 위해 커리큘럼 학습과 기울기 클리핑을 적용한다.
Figure 1: Overview of the proposed method. We denote “Accumulated Reward” for the learned accumulated reward, $J(\cdot;\theta)$ for the accumulated reward of each trajectory, $S(\cdot)$ for the combined score of each trajectory, $\ell_{\mathrm{W}}$ for the weighted regularization, $\ell_{\mathrm{DST
Figure 1: Overview of the proposed method. We denote “Accumulated Reward” for the learned accumulated reward, $J(\cdot;\theta)$ for the accumulated reward of each trajectory, $S(\cdot)$ for the combined score of each trajectory, $\ell_{\mathrm{W}}$ for the weighted regularization, $\ell_{\mathrm{DST

실험 결과

연구 질문

  • RQ1랭킹 기반 학습 목적 함수는 작업 지향 대화 시스템에서 오프라인 강화 학습을 위한 보상 함수 품질을 향상시킬 수 있는가?
  • RQ2하위 대화 정책 성능 측면에서, 희박한 이진 목표 기반 보상에 비해 선호도 기반 보상 함수는 어떻게 비교되는가?
  • RQ3학습된 보상 함수는 표준 벤치마크에서 인간의 시연 성능을 초월하는 엔드 투 엔드 ToD 에이전트를 가능하게 할 수 있는가?
  • RQ4어떤 초모수 설정(예: 트레이젝터리 길이, 보상 함수 형태)이 오프라인 ToD 학습에서 가장 안정적이고 효과적인 훈련을 제공하는가?
  • RQ5제안된 보상 학습 방법은 다양한 랜덤 시드와 모델 아키텍처에 대해 얼마나 강건한가?

주요 결과

  • 제안된 RewardMLE 방법은 MultiWOZ 2.1 벤치마크에서 통합 점수 107.11을 달성하여 이전 방법들인 CASPI(105.40)와 UBAR(105.25)를 능가한다.
  • Gumbel-Softmax 샘플링을 사용한 RewardNet은 통합 점수 106.62를 기록하여 SimpleTOD(92.98)와 같은 강력한 베이스라인을 지속적으로 능가한다.
  • 다섯 개의 랜덤 시드에 대한 중앙값 성능 분석 결과, RewardMLE는 모든 지표에서 CASPI를 일관되게 능가하며, 중앙값 통합 점수는 107.74로 CASPI의 105.04보다 높다.
  • 제거 실험 결과, 선호도 기반 보상 학습 방식이 희박한 보상 신호보다 더 안정적인 훈련과 더 나은 일반화를 이끌어내는 것으로 확인되었다.
  • 응답 생성기의 백본으로 BART-large-cnn를 사용하고 학습된 보상 함수를 결합함으로써, 미리 보지 않은 대화 시나리오에 대해 강력한 제로샷 일반화가 가능해졌다.
  • 최적 설정 하에서 E2E 응답 생성 작업에서 최신 기술 수준의 성과를 달성하였으며, 성공률 83.90%와 BLEU 점수 18.73을 기록했다.
(a) RewardNet
(a) RewardNet

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.