Skip to main content
QUICK REVIEW

[논문 리뷰] A Bandit Approach to Posterior Dialog Orchestration Under a Budget

Sohini Upadhyay, Mayank Agarwal|arXiv (Cornell University)|2019. 06. 22.
Advanced Bandit Algorithms Research참고 문헌 19인용 수 12
한 줄 요약

이 논문은 기능 실행 예산 내에서 후행 대화 오케스트레이션을 위한 새로운 온라인 밴딧 알고리즘인 관찰을 고려한 컨텍스트 주의 밴딧(CABO)을 제안한다. 맥락적 피드백에 기반해 어떤 기능 특징을 노출할지 동적으로 선택함으로써, 시뮬레이션 및 실제 대화 환경 모두에서 사전 지식 기반 방법과 이전 최고 수준의 밴딧 접근 방식을 능가한다. 심지어 특징 접근이 최소한일지라도 성능이 뛰어나다.

ABSTRACT

Building multi-domain AI agents is a challenging task and an open problem in the area of AI. Within the domain of dialog, the ability to orchestrate multiple independently trained dialog agents, or skills, to create a unified system is of particular significance. In this work, we study the task of online posterior dialog orchestration, where we define posterior orchestration as the task of selecting a subset of skills which most appropriately answer a user input using features extracted from both the user input and the individual skills. To account for the various costs associated with extracting skill features, we consider online posterior orchestration under a skill execution budget. We formalize this setting as Context Attentive Bandit with Observations (CABO), a variant of context attentive bandits, and evaluate it on simulated non-conversational and proprietary conversational datasets.

연구 동기 및 목표

  • 기능 특징 추출에 제한된 예산이 존재하는 상황에서 효율적인 후행 대화 오케스트레이션 문제를 해결하기 위해.
  • 라벨이 부여된 학습 데이터가 필요 없이도 온라인, 콜드 스타트 배포가 가능한 대화 오케스트레이션을 가능하게 하기 위해.
  • 실행 비용을 고려하면서도 탐색과 이용의 균형을 이루는 기능 특징 선택 방법을 개발하기 위해.
  • 정적 및 비정적 대화 환경에서 기존의 지도 학습 및 밴딧 기반 접근 방식을 능가하는 성능을 확보하기 위해.
  • 실시간으로 확장 가능한 대화 시스템에 새로운 기능을 원활하게 통합할 수 있도록 지원하기 위해.

제안 방법

  • 예산 내에서 알려지지 않은 기능 특징의 선택을 모델링하는 컨텍스트 기반 밴딧 문제의 변종인 관찰을 고려한 컨텍스트 주의 밴딧(CABO)으로 대화 오케스트레이션 문제를 수식화한다.
  • 두 단계의 의사결정 과정을 도입한다: 첫 번째로, 쿼리와 기존 맥락 특징을 사용해 어떤 기능 특징을 실행할지 선택하고, 두 번째로, 실행 후 특징을 관찰하여 정책을 업데이트한다.
  • 응답 선택을 향상시킬 가능성이 높은 기능 특징을 우선순위로 정하는 맥락 인식 탐색 전략을 사용하며, 암호 선택에 톰슨 샘플링을 적용한다.
  • 보상 함수의 비정적 특성을 모델링하기 위해 GP-UCB 알고리즘을 변형하여 동적 예산 할당을 가능하게 한다.
  • 비용과 성능 간의 탄력적인 트레이드오프를 허용하기 위해 단일 및 누적 특징 노출 방식(S=1 대비 S=U)을 모두 지원한다.
  • 모의 비대화 데이터와 실제 사용자 피드백이 포함된 기업 내 대화 데이터셋(Customer Assistant)을 활용한 하이브리드 평가 환경을 사용한다.

실험 결과

연구 질문

  • RQ1온라인, 예산 인지 밴딧 알고리즘이 후행 대화 오케스트레이션에서 지도 학습 및 이전 밴딧 기반 접근 방식을 능가할 수 있는가?
  • RQ2다양한 예산 수준(즉, 노출된 기능 특징 수)에서 제안된 CABO 알고리즘의 성능는 어떻게 변화하는가?
  • RQ3기능 관련성의 변화가 시간에 따라 발생하는 비정적 환경에서도 알고리즘이 강력한 성능을 유지하는가?
  • RQ4제한된 특징 접근을 가진 후행 방법이 사전에 실행된 특징에만 의존하는 사전 방법을 얼마나 뛰어나게 할 수 있는가?
  • RQ5한 번에 하나의 특징을 노출하는 것(S=1)과 동시에 모든 특징을 노출하는 것(S=U) 중 어떤 선택이 성능 및 적응력에 영향을 미치는가?

주요 결과

  • CABO의 두 변종인 CATSO-1과 CATSO-U는 정적 및 비정적 환경에서 모든 테스트 예산에서 최고 수준의 WTSRC 알고리즘을 능가한다.
  • 단지 2개의 기능 특징 집합이 노출된 경우조차도, 후행 방법(CATSO-1 및 CATSO-U)이 사전 방법인 CTS-query 기반 베이스라인을 크게 능가한다.
  • 정적 환경에서는 CATSO-U(누적 특징 노출)가 U(노출된 특징 수)의 모든 값에서 CATSO-1(동시 노출)를 略적으로 능가한다.
  • 비정적 환경에서는 NCATSO-1(S=1)이 NCATSO-U(S=U)를 略적으로 능가하며, 3개 이상의 특징이 노출될 경우 WTSRC 및 CTS-query를 모두 뛰어넘는다.
  • 시스템은 10만 명 이상의 사용자에게 성공적으로 배포되었으며, 실제 사용자 피드백과 전문가가 라벨링한 데이터를 통해 강력한 평가가 가능했다.
  • 결과적으로 온라인, 예산 인지 후행 오케스트레이션은 실현 가능할 뿐 아니라 사전 방법 및 이전 밴딧 기반 방법보다 뛰어난 성능을 보임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.