Skip to main content
QUICK REVIEW

[논문 리뷰] Reward Constrained Interactive Recommendation with Natural Language Feedback

Ruiyi Zhang, Tong Yu|arXiv (Cornell University)|2020. 05. 04.
Recommender Systems and Techniques참고 문헌 50인용 수 5
한 줄 요약

이 논문은 자연어 피드백을 통해 이전에 표현된 사용자 선호도 위반 여부를 탐지하기 위해 적대적으로 훈련된 판별기로 동적으로 사용자 선호도를 강제하는 텍스트 기반 상호작용 추천을 위한 보상 제약 강화학습 프레임워크를 제안한다. 이 방법은 추천 품질과 수렴 속도를 향상시켜 추천 및 텍스트 생성 과제에서 표준 강화학습 및 단순한 제약 기반 베이스라인에 비해 일관된 성능 향상을 달성한다.

ABSTRACT

Text-based interactive recommendation provides richer user feedback and has demonstrated advantages over traditional interactive recommender systems. However, recommendations can easily violate preferences of users from their past natural-language feedback, since the recommender needs to explore new items for further improvement. To alleviate this issue, we propose a novel constraint-augmented reinforcement learning (RL) framework to efficiently incorporate user preferences over time. Specifically, we leverage a discriminator to detect recommendations violating user historical preference, which is incorporated into the standard RL objective of maximizing expected cumulative future rewards. Our proposed framework is general and is further extended to the task of constrained text generation. Empirical results show that the proposed method yields consistent improvement relative to standard RL methods.

연구 동기 및 목표

  • 탐색 과정에서 사용자 선호도가 자연어 피드백으로 표현되는 추천 시스템이 이러한 선호도를 위반하는 문제를 다루기 위해.
  • 명시적이고 하드코딩된 제약에 의존하지 않고도 사용자 피드백을 동적으로 통합할 수 있는 일반적인 제약 보완 강화학습 프레임워크를 개발하기 위해.
  • 적대적 훈련을 통해 일반화 가능한 제약를 학습하여 상호작용 추천 및 텍스트 생성에서 수렴성과 성능을 향상시키기 위해.
  • 프레임워크를 추천 및 텍스트 생성 과제 모두에 적용하여 탄탄성과 일반화 능력을 입증하기 위해.

제안 방법

  • 과거 자연어 피드백에서 유도된 사용자 선호도를 제약로 하는 제약이 있는 마르코프 결정 과정(CMDP)으로 텍스트 기반 상호작용 추천을 공식화한다.
  • 이전에 표현된 사용자 선호도 위반을 탐지하기 위해 적대적으로 훈련된 판별기 네트워크를 활용하여 동적 제약 비평가로 기능시킨다.
  • 판별기의 출력을 라그랑주 승수 방식을 사용한 엔드 투 엔드 훈련을 위한 페널티 항으로 통합한다.
  • 정책 학습(누적 보상 최대화)과 판별기 훈련(제약 위반 탐지)을 병행하는 이중 최적화 과정을 사용한다.
  • 감정 또는 콘텐츠 속성에 대한 제약를 정의함으로써 틀린 텍스트 생성으로 확장하며, 제약 함수로 사전 훈련된 분류기를 사용한다.
  • 정책 그래เดียน트 방법을 사용한 훈련과 하이퍼파ram터 튜닝을 통해 실제 데이터셋(예: 텍스트 생성용 Yelp, 시각적 추천 데이터셋)에 적용한다.

실험 결과

연구 질문

  • RQ1적대적으로 훈련된 판별기가 자연어 피드백으로 표현된 사용자 선호도 위반을 효과적으로 탐지할 수 있는가?
  • RQ2동적으로 학습된 제약를 통합할 경우, 표준 강화학습 또는 단순한 하드 제약에 비해 상호작용 추천에서 성능과 수렴성을 향상시킬 수 있는가?
  • RQ3제안된 프레임워크는 감정 제어를 포함한 감정 제약 텍스트 생성과 같은 다른 시퀀스 생성 과제로 일반화될 수 있는가?
  • RQ4학습 과정에서 학습된 라그랑주 승수 λ는 어떻게 변화하는가? 그리고 이는 제약 위반 동역학에 대해 무엇을 드러내는가?

주요 결과

  • RCR 프레임워크는 히트 레이트 및 평균 역상호순위와 같은 다양한 추천 메트릭에서 표준 강화학습 및 단순한 제약 기반 베이스라인에 비해 일관된 성능 향상을 달성한다.
  • 첫 40,000개의 훈련 반복 이내에서 RCR는 표준 강화학습보다 수렴 속도가 빠르며, 그림 4의 학습 곡선을 통해 이를 확인할 수 있다.
  • 학습된 라그랑주 승수 λ는 초기 급등 이후 λ = 0.04에서 안정화되며, 제약 위반 빈도에 효과적으로 대응하는 동적 조정이 이루어졌음을 시사한다.
  • Yelp 텍스트 생성 과제에서 RCR는 위반률을 표준 강화학습의 40.36%에서 10.49%로 감소시켰으며, 테스트 BLEU 점수도 향상시켰다(예: BLEU-2는 0.807에서 0.840으로 상승).
  • 표 3의 생성된 텍스트 예시는 RCR가 더 일관되고 긍정적인 감정을 지닌 리뷰를 생성하며 부정적인 감정을 피하는 것을 보여주며, 효과적인 제약 강제가 이루어졌음을 입증한다.
  • 하드코딩된 속성 매칭에 비해 판별기 기반 제약가 더 우수한 일반화 성능을 보였으며, 이는 RCR와 단순 제약 기반 베이스라인 간의 성능 격차가 더 크다는 점에서 뒷받침된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.