[논문 리뷰] Optimizing Long-term Social Welfare in Recommender Systems: A Constrained Matching Approach
이 논문은 콘텐츠 제공자가 최소 참여 기준을 충족함으로써 생존 가능하도록 보장함으로써 추천 시스템에서 장기적 사회 복지를 최적화하기 위해 제약 조건이 있는 매칭 프레임워크를 제안한다. 추천 정책을 최적의 제약 조건이 있는 매칭 문제로 모델링함으로써, 정의되지 않은 공정성 또는 제공자 유틸리티를 최적화하지 않더라도, 단기적 전략보다 훨씬 높은 사용자 복지와 제공자 다양성을 달성한다.
Most recommender systems (RS) research assumes that a user's utility can be maximized independently of the utility of the other agents (e.g., other users, content providers). In realistic settings, this is often not true---the dynamics of an RS ecosystem couple the long-term utility of all agents. In this work, we explore settings in which content providers cannot remain viable unless they receive a certain level of user engagement. We formulate the recommendation problem in this setting as one of equilibrium selection in the induced dynamical system, and show that it can be solved as an optimal constrained matching problem. Our model ensures the system reaches an equilibrium with maximal social welfare supported by a sufficiently diverse set of viable providers. We demonstrate that even in a simple, stylized dynamical RS model, the standard myopic approach to recommendation---always matching a user to the best provider---performs poorly. We develop several scalable techniques to solve the matching problem, and also draw connections to various notions of user regret and fairness, arguing that these outcomes are fairer in a utilitarian sense.
연구 동기 및 목표
- 사용자와 콘텐츠 제공자 간의 장기적 생태계 역학을 간과하는 추천 시스템 연구의 격차를 해소하기 위해.
- 제공자가 활성 상태를 유지하기 위해 최소 참여 수준이 필요하다는 조건에서 사용자 유틸리티와 제공자 생존 가능성 간의 상호작용을 동적 시스템으로 모델링하기 위해.
- 장기적 사회 복지를 극대화하면서 다양한 생존 가능한 제공자를 확보하는 정책 최적화 프레임워크를 개발하기 위해.
- 통합 매칭 전략이 단기적 추천 전략보다 사용자 복지와 제공자 다양성 측면에서 뛰어나다는 것을 입증하기 위해.
제안 방법
- 사회 복지를 극대화하는 균형을 선택하기 위해 추천 문제를 최적의 제약 조건이 있는 매칭 문제로 공식화하기 위해.
- 제공자가 활동을 유지하기 위해 필요한 최소 기준을 도입하여 현실 세계의 인centives를 모델링하기 위해.
- 누적 콘텐츠 노출에서 유래하는 유틸리티를 기반으로 시간에 따라 사용자 쿼리와 제공자 매칭을 시뮬레이션하기 위해 이산 이벤트 동적 시스템을 사용하기 위해.
- 잠재적 임bedding과 유사도 점수를 활용하여 최적의 제약 조건이 있는 매칭 정책을 계산하는 확장 가능한 알고리즘 개발하기 위해.
- 최적화 목표 함수에서 평균 사용자 복지와 최대 사용자 후회 간의 균형을 맞추기 위해 할인 요소를 적용하기 위해.
- 결과 정책과 이윤 중심의 공정성 간의 연관성을 도출하여, 명시적인 공정성 제약 없이도 후회의 정도가 낮고 다양성이 높다는 것을 보여주기 위해.
실험 결과
연구 질문
- RQ1항상 가장 높은 유사도를 가진 제공자를 선택하는 단기 정책은 동적 생태계에서 장기적 사용자 복지와 제공자 다양성에 어떤 영향을 미치는가?
- RQ2제공자 생존 기준을 고려하는 제약 조건이 있는 매칭 접근 방식이 기존의 단기 정책보다 더 높은 전체 사회 복지를 달성할 수 있는가?
- RQ3장기적 사용자 유틸리티를 최적화함으로써 암묵적으로 제공자 다양성이 향상되고 사용자 후회가 감소하는 정도는 어느 정도인가?
- RQ4목표 함수에서 다양한 수준의 할인 처리는 평균 복지와 최대 후회 간의 어떤 트레이드오프를 초래하는가?
- RQ5제안된 정책의 결과가 이윤 중심의 공정성 개념과 어떤 방식으로 일치하는가?
주요 결과
- 할인 요소가 1.0일 때, 제안된 LP-RS 정책은 평균 사용자 복지 63.62(±3.58)를 기록하며 생존 가능한 제공자 수가 34.20명이 되었고, 단기 기준 정책은 복지 48.59점과 생존 가능한 제공자 11.80명에 그쳤다.
- 할인 요소가 0.59일 때, LP-RS 정책은 평균 복지 34.30점과 생존 가능한 제공자 43.00명을 달성했고, 단기 정책은 복지 26.07점과 생존 가능한 제공자 11.80명에 그쳤다.
- LP-RS에서의 최대 후회는 항상 단기 정책보다 낮았으며, γ=1.0일 때 정 pic 37.89에 도달했고, 단기 정책은 36.62에 그쳤다. 이는 개인 사용자 보호 측면에서 더 우수함을 시사한다.
- 목표 함수는 사용자 유틸리티만 최적화하지만, 제약 조건이 있는 매칭 접근 방식은 단기 정책보다 훨씬 높은 수준의 생존 가능한 제공자 수를 암묵적으로 유지함을 보여준다.
- 유사도 기반의 확률적 샘플링은 LP-RS와 단기 정책 모두보다 열 劣한 성능을 보였으며, 랜덤화만으로는 제공자 생존 가능성을 유지할 수 없다는 것을 보여준다.
- 복지-후회 트레이드오프 곡선은 LP-RS가 높은 사회 복지를 유지하면서도 최대 후회를 상대적으로 낮게 유지함을 보여주며, 특히 수익 감소 함수를 가진 경우에 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.