Skip to main content
QUICK REVIEW

[논문 리뷰] Influence Function based Data Poisoning Attacks to Top-N Recommender Systems

Minghong Fang, Neil Zhenqiang Gong|arXiv (Cornell University)|2020. 02. 19.
Stochastic Gradient Optimization Techniques참고 문헌 35인용 수 6
한 줄 요약

이 논문은 영향 함수 기반의 데이터 풀링 공격을 제안하여, 전략적으로 설계된 평점을 가진 가짜 사용자를 주입하여 행렬 분해 기반의 상위 N 추천 시스템을 조작한다. 영향력 있는 정상 사용자를 식별하고 기울기 기반 방법을 사용해 평점을 최적화함으로써, 유력한 사용자 0.5%만으로도 150배 높은 대상 아이템 노출을 달성하며, 이는 이전 방법들을 능가하고 탐지 메커니즘에도 효과를 유지한다.

ABSTRACT

Recommender system is an essential component of web services to engage users. Popular recommender systems model user preferences and item properties using a large amount of crowdsourced user-item interaction data, e.g., rating scores; then top-$N$ items that match the best with a user's preference are recommended to the user. In this work, we show that an attacker can launch a data poisoning attack to a recommender system to make recommendations as the attacker desires via injecting fake users with carefully crafted user-item interaction data. Specifically, an attacker can trick a recommender system to recommend a target item to as many normal users as possible. We focus on matrix factorization based recommender systems because they have been widely deployed in industry. Given the number of fake users the attacker can inject, we formulate the crafting of rating scores for the fake users as an optimization problem. However, this optimization problem is challenging to solve as it is a non-convex integer programming problem. To address the challenge, we develop several techniques to approximately solve the optimization problem. For instance, we leverage influence function to select a subset of normal users who are influential to the recommendations and solve our formulated optimization problem based on these influential users. Our results show that our attacks are effective and outperform existing methods.

연구 동기 및 목표

  • 행렬 분해 기반 상위 N 추천 시스템에 대한 효과적인 데이터 풀링 공격 설계의 격차를 메우기 위해.
  • 최적의 가짜 사용자 평점 선택 문제를 비볼록 정수계획문제로 수식화하기 위해.
  • 도전적인 최적화 문제를 해결하기 위한 효율적인 근사 기법 개발하기 위해.
  • 영향 함수를 활용해 영향력 있는 핵심 사용자를 식별함으로써 공격의 은폐성과 효과성 향상시키기 위해.
  • 가짜 사용자 탐지 메커니즘에 대한 공격의 강건성 평가하기 위해.

제안 방법

  • 정상 사용자가 대상 아이템을 자신의 상위 N 추천 목록에 받는 수를 최대화하는 최적화 문제로 공격를 수식화하기 위해.
  • 정수 평점의 연속적 근사화를 적용하고, 영향을 받는 사용자 수를 근사하기 위해 미분 가능한 손실 함수를 사용하기 위해.
  • 영향 함수 이론을 적용하여 대상 아이템의 추천에 가장 큰 영향을 미치는 정상 사용자 집합을 식별하기 위해.
  • 영향력 있는 사용자 선택의 하위모듈라 성질을 활용하여, 탐욕 알고리즘을 통해 (1−1/e) 근사 비율을 확보하기 위해.
  • 유용한 사용자 집합을 기반으로 가짜 사용자에 대한 최적의 평점 점수를 계산하기 위해 기울기 기반 최적화 알고리즘 개발하기 위해.
  • 모든 정상 사용자를 영향력에 따라 가중치를 적용함으로써, 부분집합 선택을 초월해 공격 효과를 향상시키기 위해.

실험 결과

연구 질문

  • RQ1영향 함수 기반의 영향력 있는 사용자 선택은 행렬 분해 기반 상위 N 추천 시스템에서 데이터 풀링 공격의 효과성을 향상시킬 수 있는가?
  • RQ2기존의 데이터 풀링 방법과 비교해 본다면, 제안된 공격는 대상 아이템의 노출도와 은폐성 측면에서 어떻게 다른가?
  • RQ3추천 시스템에 가짜 사용자 탐지 메커니즘이 포함되어 있을 경우, 공격는 어느 정도 효과를 유지하는가?
  • RQ4영향 함수 프레임워크는 부분집합 선택을 넘어서 모든 정상 사용자를 영향력에 따라 가중치를 적용하는 데 일반화될 수 있으며, 이는 공격 성능을 추가로 향상시키는가?
  • RQ5동일한 영향 함수 접근법을 그래프 기반 상위 N 추천 시스템에 적용해 공격를 향상시킬 수 있는가?

주요 결과

  • Yelp 데이터셋에서, 제안된 공격는 단지 0.5%의 가짜 사용자만 주입함으로써 대상 아이템의 노출을 150배 높였다.
  • Yelp에서 공격 크기가 5%일 때, 공격는 히트 비율 0.6924를 달성하여 기준선 방법들을 크게 능가했다.
  • 이중 분류기로 학습된 가짜 사용자 탐지 모델에 대해서도 영향 함수 기반 공격가 효과를 유지하여 강력한 은폐 특성을 보였다.
  • 모든 정상 사용자를 영향력에 따라 가중치를 적용함으로써 부분집합 선택을 초월해 공격 성능을 향상시켰으며, Yelp에서 공격 크기가 5%일 때 히트 비율 0.6924를 달성했다.
  • 해당 방법은 그래프 기반 추천 시스템으로도 효과적으로 일반화되었으며, 이전 연구 대비 공격 성공률을 향상시켰다.
  • 영향 함수 기반 접근법은 영향력 있는 사용자 선택에 대해 (1−1/e) 근사 비율을 달성하여 이론적 성능 보장을 보장했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.