Skip to main content
QUICK REVIEW

[논문 리뷰] A Multiworld Testing Decision Service.

Alekh Agarwal, Sarah Bird|arXiv (Cornell University)|2016. 06. 13.
Advanced Bandit Algorithms Research참고 문헌 29인용 수 18
한 줄 요약

이 논문은 실시간, 역사적 조건에 기반한 의사결정을 탐색, 로깅 및 온라인 학습을 통해 가능하게 하는 기계학습 기반의 의사결정 서비스를 제시한다. 이 서비스는 임의의 이산 행동 공간, 보상 지표 및 학습 알고리즘을 지원하며, 뉴스 웹사이트에서 대규모로 배포되어 2016년 1월 이래로 클릭 수에서 25%의 상대적 향상을 달성했다.

ABSTRACT

Applications and systems are constantly faced with decisions to make, often using a policy to pick from a set of actions based on some contextual information. We create a service that uses machine learning to accomplish this goal. The service uses exploration, logging, and online learning to create a counterfactually sound system supporting a full data lifecycle. The system is general: it works for any discrete choices, with respect to any reward metric, and can work with many learning algorithms and feature representations. The service has a simple API, and was designed to be modular and reproducible to ease deployment and debugging, respectively. We demonstrate how these properties enable learning systems that are robust and safe. Our evaluation shows that the Decision Service makes decisions in real time and incorporates new data quickly into learned policies. A large-scale deployment for a personalized news website has been handling all traffic since Jan. 2016, resulting in a 25% relative lift in clicks. By making the Decision Service externally available, we hope to make optimal decision making available to all.

연구 동기 및 목표

  • 기계학습을 사용하여 실시간 데이터 기반 의사결정을 지원하는 일반 목적의 의사결정 서비스를 설계하는 것.
  • 피드백 루프가 존재하는 동적 환경에서 안전하고 견고한 정책 학습에 도전하는 것.
  • 온라인 학습과 로깅을 통해 새로운 데이터를 빠르게 학습된 정책에 통합할 수 있도록 하는 것.
  • 다양한 응용 분야에 걸쳐 배포 가능한 모듈식, 재현 가능하고 API 접근이 가능한 시스템을 제공하는 것.
  • 모든 이산 행동 공간과 보상 지표를 지원하여 다양한 시스템에 광범위하게 적용 가능하도록 하는 것.

제안 방법

  • 시스템은 실시간으로 정책을 평가하고 실제 배포 없이도 정책을 평가하기 위해 다중세계 테스트(MWT)를 사용하여 역사적 결과를 시뮬레이션한다.
  • 정책 학습을 위해 다양한 맥락 데이터와 행동 피드백을 수집하기 위해 탐색 전략을 적용한다.
  • 로깅 메커니즘을 통해 행동과 보상을 기록하여 후행 분석 및 정책 평가를 지원한다.
  • 새로운 데이터가 도착함에 따라 정책을 점진적으로 업데이트하기 위해 온라인 학습 알고리즘을 사용한다.
  • 플러그인 방식의 학습 알고리즘과 특징 표현을 지원하기 위해 모듈식 아키텍처를 구축한다.
  • 간단하고 표준화된 API를 통해 다양한 시스템 간의 간편한 통합과 재현 가능성을 보장한다.

실험 결과

연구 질문

  • RQ1생산 환경에서 실시간으로 역사적 조건에 기반한 정책 학습을 지원할 수 있는 의사결정 서비스는 어떻게 설계할 수 있는가?
  • RQ2온라인 의사결정에서 모듈성, 재현 가능성, 확장성을 보장하기 위해 필요한 아키텍처 및 알고리즘 구성 요소는 무엇인가?
  • RQ3탐색, 로깅, 온라인 학습의 통합은 정책의 견고성과 안전성에 어떻게 기여하는가?
  • RQ4이러한 시스템은 다양한 행동 공간, 보상 지표 및 학습 알고리즘으로 얼마나 광범위하게 일반화될 수 있는가?
  • RQ5기본 결정 전략 대비 실제 배포 환경에서 어떤 성능 향상을 달성할 수 있는가?

주요 결과

  • 의사결정 서비스는 2016년 1월 이래로 대규모 개인화 뉴스 웹사이트의 모든 생산 트래픽을 성공적으로 처리했다.
  • 이전의 의사결정 접근 방식 대비 클릭률이 25% 상승하는 성과를 달성했다.
  • 새로운 데이터에 신속하게 대응하여 정책을 업데이트함으로써 사용자 행동 변화에 유연하게 적응할 수 있었다.
  • 모든 이산 행동 공간과 보상 지표를 지원하여 광범위한 일반화 능력을 입증했다.
  • 모듈식 설계 덕분에 다양한 응용 분야에서 디버깅과 배포가 용이했다.
  • 실제 A/B 테스트 없이도 기록된 데이터를 활용해 정책을 평가함으로써 역사적 조건의 타당성을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.