Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Keywords Extraction with Contextual Bandits for Advertising on Parked Domains

Shuai Yuan, Wang Jun|arXiv (Cornell University)|2013. 07. 12.
Advanced Text Analysis Techniques참고 문헌 27인용 수 4
한 줄 요약

이 논문은 웹페이지 콘텐츠가 없을 경우 사용자 의도를 인ferred할 수 있도록 링크된 도메인을 위한 적응형 关련 키워드 추출 시스템을 제안한다. 이는 문맥적 밴디트와 BM25F 어휘 가중치를 사용하여, 인터넷 사용자 피드백을 통해 반복적으로 학습함으로써 성능을 향상시킨다. 이 방법은 BM25F, KEA, 그리고 상용 서비스를 모두 능가하며, 6회 반복 후 유사도 측면에서 13.6% 향상된 성과를 기록한다.

ABSTRACT

Domain name registrars and URL shortener service providers place advertisements on the parked domains (Internet domain names which are not in service) in order to generate profits. As the web contents have been removed, it is critical to make sure the displayed ads are directly related to the intents of the visitors who have been directed to the parked domains. Because of the missing contents in these domains, it is non-trivial to generate the keywords to describe the previous contents and therefore the users intents. In this paper we discuss the adaptive keywords extraction problem and introduce an algorithm based on the BM25F term weighting and linear multi-armed bandits. We built a prototype over a production domain registration system and evaluated it using crowdsourcing in multiple iterations. The prototype is compared with other popular methods and is shown to be more effective.

연구 동기 및 목표

  • 웹페이지 콘텐츠가 없는 링크된 도메인에서 사용자 의도를 추론하는 문제에 대응한다.
  • 사용자 피드백을 통해 반복적으로 학습하는 적응형 키워드 추출 시스템을 개발한다.
  • 사전 레이블링 데이터나 고정된 히ュ리스틱에 의존하는 정적 키워드 추출 방법의 한계를 극복한다.
  • 키워드 추천의 관련성과 일관성을 측정하기 위해 인터넷 사용자 평가를 활용해 시스템을 평가한다.
  • 맥락적 밴디트가 동적 키워드 관련성에 대한 특징 가중치를 학습하는 데 효과적인가를 입증한다.

제안 방법

  • 명사구 및 품사 태그와 같은 언어적 특징을 기반으로 후보 키워드를 점수 매기기 위해 BM25F 어휘 가중치를 적용한다.
  • 각 키워드를 암으로, 특징 벡터를 맥락 정보로 간주하여, 키워드 관련성 예측 문제를 맥락적 다중 손잡이 밴디트 문제로 모델링한다.
  • 특징 벡터와 기대 보상(관련성) 간의 관계를 선형 일반화 모델(GLM)로 표현한다.
  • 시간이 지남에 따라 키워드를 선택할 때 탐색과 이용의 균형을 이루기 위해 상한 신뢰도(UCB) 알고리즘을 적용한다.
  • oDesk.com 을 통해 인터넷 사용자 피드백을 수집하며, 1~5점의 관련성 척도를 사용하고, 임bedded trap을 통해 위조 평가를 탐지한다.
  • 피드백을 기반으로 특징 가중치를 반복적으로 업데이트하며, 평가 시에는 평가자 간 일致성 측정을 위해 Fleiss’ Kappa 및 Cohen’s Kappa를 사용한다.

실험 결과

연구 질문

  • RQ1웹페이지 콘텐츠가 전혀 없는 링크된 도메인에서 맥락적 밴디트 기반 시스템이 사용자 의도를 효과적으로 추론할 수 있는가?
  • RQ2제안된 적응형 키워드 추출 시스템의 성능은 BM25F 및 KEA와 같은 정적 방법보다 어떻게 비교되는가?
  • RQ3인터넷 사용자 피드백을 통해 시간이 지남에 따라 키워드 추출의 관련성은 어느 정도 향상되는가?
  • RQ4어느 특징(예: 제목, 콘텐츠, 메타 태그)이 학습된 모델에서 키워드 관련성에 가장 크게 기여하는가?
  • RQ5인터넷 사용자 평가 환경에서 키워드 관련성 평가의 안정성과 일관성은 어느 정도인가?

주요 결과

  • 제안된 razorclaw 시스템은 첫 번째 반복에서 KEA보다 8.29% 높은 성능을 기록했으며, 마지막 반복에서는 13.6% 향상된 성과를 보였다.
  • BM25F와 KEA는 일관된 성능을 보였지만, 상용 서비스(Yahoo! 및 Google)는 영어 전용 제약으로 인해 성능이 열 劣했다.
  • 콘텐츠 특징이 학습된 모델에서 가장 영향력 있는 요소였으며, 이어 품사 특징, 제목 특징이 뒤를 이었다. 메타 태그는 신뢰할 수 없다는 결론이 내려졌다.
  • 시스템은 적응형 학습 능력을 보였으며, 2회차와 4회차의 탐색 단계에서 일시적인 성능 저하가 있었지만 이를 회복했다.
  • 평가자 간 일치도가 높았으며, 평균 Fleiss’ Kappa 및 Cohen’s Kappa 값은 신뢰할 수 있는 인간 평가를 뒷받침했다.
  • 특징 가중치의 시간에 따른 변화는 모델가 피드백에 기반해 가장 관련성 있는 특징을 동적으로 우선순위화하도록 조정된다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.