[논문 리뷰] LADDER: A Human-Level Bidding Agent for Large-Scale Real-Time Online Auctions
LADDER는 DASQN 기반의 딥 강화학습 에이전트로, 실시간 온라인 경매의 원시 텍스트 기반 상태 기술에서 직접 최적의 입찰 전략을 학습하여 인간 수준의 성능을 달성한다. 주요 세일 기간 동안 JD의 광고 수익을 50% 이상 증가시키며 광고주들의 ROI도 향상시켰고, 수작업으로 설계된 벤치마크 정책을 뛰어넘었다.
We present LADDER, the first deep reinforcement learning agent that can successfully learn control policies for large-scale real-world problems directly from raw inputs composed of high-level semantic information. The agent is based on an asynchronous stochastic variant of DQN (Deep Q Network) named DASQN. The inputs of the agent are plain-text descriptions of states of a game of incomplete information, i.e. real-time large scale online auctions, and the rewards are auction profits of very large scale. We apply the agent to an essential portion of JD's online RTB (real-time bidding) advertising business and find that it easily beats the former state-of-the-art bidding policy that had been carefully engineered and calibrated by human experts: during JD.com's June 18th anniversary sale, the agent increased the company's ads revenue from the portion by more than 50%, while the advertisers' ROI (return on investment) also improved significantly.
연구 동기 및 목표
- 손작업으로 만든 특징에 의존하지 않고 대규모 실시간 온라인 경매 환경에서 최적의 입찰 전략을 학습할 수 있는 강화학습 에이전트를 개발하는 것.
- 일반 텍스트 기반 상태 기술과 같은 고수준 의미적 입력에서 직접 학습하여, 복잡하고 정보가 불완전한 환경에서 인간의 의사결정 방식을 모방하는 것.
- 특히 광고주들의 수익 창출 및 ROI 측면에서 전문가가 설계한 입찰 정책을 뛰어넘는 실세계 산업 적용에서의 성능을 확보하는 것.
- 실세계 고위험·대규모 온라인 광고 시스템에서 엔드 투 엔드 딥 강화학습의 실현 가능성을 입증하는 것.
제안 방법
- 에이전트는 대규모 환경에서 훈련을 안정화하고 샘플 효율성을 향상시키기 위해, 딥 Q-네트워크(DQN)의 异상(stochastic) 변종인 DASQN을 사용한다.
- 입찰, 시간, 시장 조건에 대한 의미 정보를 담은 원시 텍스트 기반 경매 상태 기술이 신경망의 직접 입력으로 사용된다.
- 수천만 건의 경매 이벤트에 걸쳐 밀도 있고 확장 가능한, 수익을 나타내는 희박한 고보상 신호를 사용해 에이전트를 훈련시킨다.
- 에이전트는 순차적인 경매 상태를 처리하여 시간적 의존성을 모델링하고 실시간으로 입찰 행동을 동적으로 조정한다.
- 훈련 과정은 전형적인 DQN 기반 방법에서처럼 경험 재생과 타겟 네트워크를 활용하여 학습을 안정화시킨다.
- 시스템은 JD.com의 실세계 RTB(실시간 입찰) 광고 플랫폼에 구현되어 대규모 생산 환경 제약 조건 하에서 운영된다.
실험 결과
연구 질문
- RQ1딥 강화학습 에이전트는 대규모 실시간 경매에서 원시 텍스트 기반 상태 기술에서 직접 효과적인 입찰 전략을 학습할 수 있는가?
- RQ2엔드 투 엔드 딥 강화학습은 실세계 산업 환경에서 수작업으로 설계된 전문가 조정 정책보다 뛰어난 성능을 낼 수 있는가?
- RQ3이러한 에이전트는 실시간 광고 플랫폼에서 수익 창출 및 ROI 향상 측면에서 인간 수준의 성능을 달성할 수 있는가?
- RQ4명시적인 특징 설계 없이 다양한 시장 조건과 경매 동적 변화에 대해 어떻게 일반화되는가?
주요 결과
- LADDER는 이전 최고 수준의 입찰 정책 대비 JD의 6월 18일 기념 세일 기간 동안 광고 수익을 50% 증가시켰다.
- 광고주들의 투자 수익률(ROI)이 크게 향상되어, 에이전트의 효율성과 타겟팅 능력 향상이 확인되었다.
- 수개월에 걸쳐 수작업으로 캘리브레이션된 전문가가 설계한 입찰 전략을 뛰어넘는 성능을 보였다.
- 수작업 특징 또는 도메인 전용 전처리 없이 원시 텍스트 입력에서 성공적으로 학습한 바 있다.
- 고빈도, 정보가 불완전한 환경에서 실세계 대규모 RTB 환경에서 뛰어난 내재성과 확장성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.