Skip to main content
QUICK REVIEW

[논문 리뷰] Targeted Advertising Based on Browsing History

Yong Zhang, Hongming Zhou|arXiv (Cornell University)|2017. 11. 13.
Advanced Text Analysis Techniques참고 문헌 32인용 수 4
한 줄 요약

이 논문은 개인정보보호법에 따라 직접적인 개인식별정보(PII)가 제공되지 않거나 제한되는 상황에서, 사용자의 브라우징 이력—특히 암호화된 사용자 ID와 방문한 도메인 URL—만을 사용하여 온라인 사용자의 인구통계적 특성(예: 성별 및 연령)을 예측하기 위한 기계학습 프레임워크를 제안한다. 단어 임bedding과 TF-IDF 가중치를 결합하여 조밀한 비지도 학습 웹사이트 특성 벡터를 생성하고, 이를 사용자 수준의 표현으로 집계한 후 지지벡터기반 분류기(SVM)를 적용함으로써, 기존의 베이스라인 방법들보다 유의미하게 높은 예측 정확도를 달성한다. 특히 전통적인 방법들인 카테고리 기반 레이블링 및 LSI 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Audience interest, demography, purchase behavior and other possible classifications are ex- tremely important factors to be carefully studied in a targeting campaign. This information can help advertisers and publishers deliver advertisements to the right audience group. How- ever, it is not easy to collect such information, especially for the online audience with whom we have limited interaction and minimum deterministic knowledge. In this paper, we pro- pose a predictive framework that can estimate online audience demographic attributes based on their browsing histories. Under the proposed framework, first, we retrieve the content of the websites visited by audience, and represent the content as website feature vectors; second, we aggregate the vectors of websites that audience have visited and arrive at feature vectors representing the users; finally, the support vector machine is exploited to predict the audience demographic attributes. The key to achieving good prediction performance is preparing representative features of the audience. Word Embedding, a widely used tech- nique in natural language processing tasks, together with term frequency-inverse document frequency weighting scheme is used in the proposed method. This new representation ap- proach is unsupervised and very easy to implement. The experimental results demonstrate that the new audience feature representation method is more powerful than existing baseline methods, leading to a great improvement in prediction accuracy.

연구 동기 및 목표

  • 개인정보가 직접 제공되지 않거나 개인정보 보호법에 의해 제한되는 상황에서 타겟 광고에서 사용자 인구통계적 특성을 예측하는 데 도전하는 것.
  • 사용자 식별정보(PII)가 필요 없이 브라우징 이력—특히 암호화된 사용자 ID와 도메인 수준의 URL—에만 기반한 확장 가능하고 개인정보 보호에 적합한 방법을 개발하는 것.
  • 웹사이트 콘텐츠에서 더 잘 반영되고 정보가 풍부한 사용자 특성 벡터를 생성함으로써 인구통계 예측 정확도를 향상시키는 것.
  • 웹사이트 및 사용자 수준의 특성 표현 기법을 평가하고 비교하여, 인구통계 분류에 가장 효과적인 조합을 규명하는 것.

제안 방법

  • 사용자가 방문한 웹사이트의 텍스트 콘텐츠를 수집하기 위해 웹 크롤러를 사용하며, 개인식별정보(PII)를 회피함으로써 개인정보 보호 기준을 준수한다.
  • 단어 임베딩(예: Word2Vec)과 하위선형 스케일링된 TF-IDF 가중치를 조합하여, 정보성 있는 어휘를 강조하는 조밀한 웹사이트 특성 벡터로 변환한다.
  • 로그 평균 집계 방법을 사용하여 웹사이트 특성 벡터를 집계함으로써 사용자 수준의 특성 벡터를 구성하며, 이는 사용자의 집합적 브라우징 프로파일을 효과적으로 반영한다.
  • 지지벡터기반 분류기(SVM)를 사용자 집계 특성 벡터에 적용하여 성별 및 연령 등의 인구통계적 특성을 예측한다.
  • 실제 데이터셋(Demo100 및 Demo20)을 사용하여 프레임워크를 평가하고, 크롤링 규칙 및 특성 표현 방식의 변형에 대한 분석 실험을 실시한다.
  • 동일한 실험 조건에서 카테고리 기반, LSI, RNN, 표준 TF-IDF 방법과의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1소셜 미디어나 패널 데이터에 의존하지 않고, 브라우징 이력에서 유도된 웹사이트 콘텐츠를 효과적으로 활용하여 사용자 인구통계를 예측할 수 있는가?
  • RQ2TF-IDF 가중치와의 통합을 통해 단어 임베딩이 기존 방법에 비해 웹사이트 콘텐츠 표현을 얼마나 향상시키는가?
  • RQ3서로 연관된 브라우징 행동을 모델링할 때, 집계-분류 프레임워크가 회귀-집계 프레임워크보다 성능이 뛰어난가?
  • RQ4개인정보 보호를 유지하면서도 인구통계 예측 정확도를 극대화하기 위한 최적의 웹 크롤링 전략은 무엇인가?
  • RQ5웹사이트 콘텐츠의 특성상, RNN과 같은 딥러닝 모델의 성능이 간단하고 효율적인 모델보다 열 劣한가?

주요 결과

  • 제안된 방법—TF-IDF 가중치를 적용한 단어 임베딩을 사용하여 Demo100 데이터셋에서 연령 예측 정확도 83.95%, 성별 예측 정확도 74.42%를 달성하였으며, 모든 기준선 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 웹사이트 특성 벡터의 로그 평균 집계 방법이 단순 평균 또는 합산보다 더 효과적이었으며, 이는 사용자 프로파일을 더 잘 표현할 수 있음을 시사한다.
  • 집계-분류 프레임워크가 회귀-집계 프레임워크보다 더 높은 정확도를 달성하여, 웹사이트 방문이 상호 독립적이라는 가정이 잘못되었고, 상호 연관된 브라우징 행동을 명시적으로 모델링해야 함을 입증한다.
  • RNN 기반 모델은 장기 시퀀스와 분할된 콘텐츠로 인해 단순한 모델보다 성능이 열 劣하였으며, 이는 이 맥락에서 딥러닝의 한계를 드러낸다.
  • TF-IDF_word2vec 표현 방법은 표준 TF-IDF 대비 특성의 희소성과 차원 수를 감소시켜 일반화 능력을 향상시키고 분류 정확도를 높였다.
  • 이 방법은 계산적으로 효율적이며 비지도 학습 기반으로, 인간의 레이블링 데이터가 필요 없어 실생활 개인정보 보호 광고 시스템에 확장 가능하고 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.