Skip to main content
QUICK REVIEW

[논문 리뷰] Decoupling Strategy and Generation in Negotiation Dialogues

He He, Derek Chen|arXiv (Cornell University)|2018. 08. 29.
Topic Modeling참고 문헌 30인용 수 11
한 줄 요약

이 논문은 거래 대화에서 전략과 생성을 분리하는 모odu lar 프레임워크를 제안한다. 이는 일관된 대화 액트(예: propose(price=50))를 사용하여 제어 가능하고 해석 가능한 전략 학습을 가능하게 하며, 지도 학습, 강화 학습 또는 도메인 지식을 통해 수행할 수 있다. 동시에 검색 기반 생성을 통해 맥락 인식과 다양성을 유지한다. 이 방법은 종래의 엔드 투 엔드 모델보다 더 높은 작업 성공률과 인간다운 행동을 달성하며, 실제 세계의 물품을 포함한 개방형 설정에서 특히 효과적이다.

ABSTRACT

We consider negotiation settings in which two agents use natural language to bargain on goods. Agents need to decide on both high-level strategy (e.g., proposing \$50) and the execution of that strategy (e.g., generating "The bike is brand new. Selling for just \$50."). Recent work on negotiation trains neural models, but their end-to-end nature makes it hard to control their strategy, and reinforcement learning tends to lead to degenerate solutions. In this paper, we propose a modular approach based on coarse di- alogue acts (e.g., propose(price=50)) that decouples strategy and generation. We show that we can flexibly set the strategy using supervised learning, reinforcement learning, or domain-specific knowledge without degeneracy, while our retrieval-based generation can maintain context-awareness and produce diverse utterances. We test our approach on the recently proposed DEALORNODEAL game, and we also collect a richer dataset based on real items on Craigslist. Human evaluation shows that our systems achieve higher task success rate and more human-like negotiation behavior than previous approaches.

연구 동기 및 목표

  • 협상 대화를 위한 엔드 투 엔드 신경망 모델에서의 제어성과 해석 가능성 부족 문제를 해결하기 위해.
  • 강화 학습 기반 대화 시스템에서 흔히 발생하는 반복적이거나 문법적으로 잘못된 발화와 같은 열악한 행동을 극복하기 위해.
  • 재학습 없이도 지도 학습, 강화 학습 또는 도메인 특화 규칙를 통해 전략 학습이 가능한 유연한 전략 학습을 가능하게 하기 위해.
  • 개방형 협상에 적합한 새로운 실질적인 협상 데이터셋(CraigslistBargain)을 실생활 물품을 기반으로 수집하고 공개하기 위해.
  • 인간 평가를 통한 A/B 테스트를 통해 합성 데이터셋(DealOrNoDeal)과 실제 세계 데이터셋(CraigslistBargain)에서 프레임워크의 성능을 평가하기 위해.

제안 방법

  • 프레임워크는 대화 액트(예: inform, propose, inquire)로 발화를 매핑하는 파서를 사용하여, 전체 의미적 내용 없이도 높은 수준의 전략적 의도를 포착한다.
  • 대화 매니저는 파싱된 대화 히스토리 기반의 순서에서 순서로 모델을 사용하여 다음 거래 액트를 생성하며, 지도 학습, 강화 학습 또는 도메인 지식을 최적화하여 학습한다.
  • 검색 기반 생성기는 예측된 대화 액트와 전체 발화 히스토리에 조건부로 자연어 응답을 생성하여 맥락 인식과 다양성을 보장한다.
  • 시스템은 두 데이터셋(DealOrNoDeal: 합성, CraigslistBargain: 실제 세계)에서 학습 및 평가되며, A/B 테스트를 통한 인간 평가를 실시한다.
  • 대화 매니저에 대해 다양한 학습 목표를 사용한다: RL_utility(제안 유지), RL_length(질문, 제안 연기), RL_fairness(중간 가격 목표), SL(지도 학습) + 규칙 기반 후처리.
  • 거친 대화 액트 공간은 하이브리드 제어를 가능하게 하며, 예를 들어 학습된 정책과 수동으로 작성된 규칙를 조합함으로써 전략의 해석 가능성과 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1전략과 생성을 분리하는 모듈러 프레임워크가 엔드 투 엔드 모델 대비 협상 대화에서 제어성과 해석 가능성 향상에 기여하는가?
  • RQ2거친 대화 액트를 전략적 기반으로 사용함으로써 엔드 투 엔드 강화 학습에서 흔히 나타나는 열악한 행동을 방지할 수 있는가?
  • RQ3지도 학습, 강화 학습, 도메인 규칙 등의 다양한 학습 목표가 각기 다른 바람직한 협상 전략(예: 공정성, 끈기, 융통성)을 생성할 수 있는가?
  • RQ4검색 기반 생성기는 거친 대화 액트에 조건부로 맥락 인식을 유지하고 다양한 인간다운 응답을 생성할 수 있는가?
  • RQ5개방형 실세계 협상 설정에서 인간 평가를 통해 시스템의 작업 성공률과 인간다운 행동 성능은 어떻게 평가되는가?

주요 결과

  • RL_length(act) 모델은 CraigslistBargain에서 42.4%의 발화를 질문으로 생성하여 다른 모델보다 유의미하게 높은 질문 사용률을 보이며, 탐색 전략의 효과성을 입증했다.
  • RL_fairness(act) 모델은 광고 가격과 목표 가격의 중간 지점 근처의 가격을 제안함으로써 협상에서의 전략적 공정성을 학습했다.
  • RL_utility(act) 모델은 자신의 제안을 고수하고 타협을 거부하여 합의율이 낮고 인간 평가에서 불만을 유발했으며, 비협조적 정책의 위험성을 드러냈다.
  • SL(act)+rule 모델은 수동으로 작성된 규칙를 통한 타협 기능을 강화하여 두 데이터셋 모두에서 높은 효용성과 인간다운 행동을 달성했으며, 순수한 RL 또는 SL 기반 모델을 능가했다.
  • 거친 대화 액트로 학습된 모델는 단지 지도 학습을 사용하더라도 단어 수준의 모델보다 더 다양한 발화와 더 높은 작업 성공률을 기록했다.
  • 인간 평가 결과, 제안된 모듈러 시스템이 이전의 엔드 투 엔드 접근 방식보다 더 높은 작업 성공률과 더 인간다운 협상 행동을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.