Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Keywords Extraction with Contextual Bandits for Advertising on Parked Domains

Shuai Yuan, Wang Jun|arXiv (Cornell University)|Jul 12, 2013
Advanced Text Analysis Techniques参考文献 27被引用数 4
ひとこと要約

本論文では、文脈的バンディットとBM25F語句重み付けを用いて、Webページのコンテンツが存在しない状態でもユーザーの意図を推定できる、適応的キーワード抽出システムを提案する。クラウドソーシングを用いたユーザーのフィードバックから段階的に学習することで、BM25F、KEA、および商用サービスを上回り、6回の反復の間に関連性が13.6%向上した。

ABSTRACT

Domain name registrars and URL shortener service providers place advertisements on the parked domains (Internet domain names which are not in service) in order to generate profits. As the web contents have been removed, it is critical to make sure the displayed ads are directly related to the intents of the visitors who have been directed to the parked domains. Because of the missing contents in these domains, it is non-trivial to generate the keywords to describe the previous contents and therefore the users intents. In this paper we discuss the adaptive keywords extraction problem and introduce an algorithm based on the BM25F term weighting and linear multi-armed bandits. We built a prototype over a production domain registration system and evaluated it using crowdsourcing in multiple iterations. The prototype is compared with other popular methods and is shown to be more effective.

研究の動機と目的

  • Webページのコンテンツが存在しないパークドドメインにおいて、ユーザーの意図を推定する課題に取り組む。
  • ユーザーのフィードバックから学習する適応的キーワード抽出システムを構築し、時間の経過とともに関連性を向上させる。
  • 事前にラベル付けされたデータや固定のヒューリスティクスに依存する静的キーワード抽出手法の限界を克服する。
  • クラウドソーシングを用いてキーワード推薦の関連性と一貫性を測定するための評価を実施する。
  • 文脈的バンディットが動的キーワード関連性のための特徴量の重みを学習する有効性を示す。

提案手法

  • 名詞句や品詞タグなどの言語的特徴に基づいて、候補キーワードをBM25F語句重み付けでスコア化する。
  • キーワードの関連性予測を、各キーワードをアームとし、特徴ベクトルを文脈的情報として扱う文脈的多腕バンディット問題としてモデル化する。
  • 特徴ベクトルと期待報酬(関連性)の関係を線形一般化モデル(GLM)で表現する。
  • 上界信頼区間(UCB)アルゴリズムを用いて、時間経過に伴う探索と活用のバランスをとる。
  • oDesk.comを介してクラウドソーシングで人間のフィードバックを収集し、1〜5段階の関連性スケールを用いる。不正を検出するためのトラップを埋め込む。
  • フィードバックを用いて特徴量の重みを段階的に更新し、FleissのKappaおよびCohenのKappaを用いてアノテーター間の一貫性を測定する。

実験結果

リサーチクエスチョン

  • RQ1文脈的バンディットベースのシステムは、Webページのコンテンツが存在しないパークドドメインにおいて、ユーザーの意図を効果的に推定できるか?
  • RQ2提案された適応的キーワード抽出システムの性能は、BM25F や KEA といった静的手法と比べてどの程度優れているか?
  • RQ3クラウドソーシングによるフィードバックは、時間の経過とともにキーワード抽出の関連性をどの程度向上させられるか?
  • RQ4タイトル、コンテンツ、メタタグなどの特徴量のうち、学習済みモデルにおいてキーワード関連性に最も寄与しているのはどれか?
  • RQ5クラウドソーシング評価環境において、キーワード関連性の人的判断はどの程度安定的かつ一貫性があるか?

主な発見

  • 提案されたrazorclawシステムは、最初の反復でKEAを8.29%上回り、最終的な反復で13.6%の関連性向上を達成した。
  • BM25FとKEAは一貫した性能を示したが、商用サービス(Yahoo! および Google)は英語のみを対象としていたため、性能が低かった。
  • コンテンツ特徴量が学習済みモデルで最も影響力が大きく、次に品詞タグ、タイトルの順であった。メタタグは信頼性が低いことが判明した。
  • システムは適応的学習を示し、反復2回目および4回目の探索フェーズにおける一時的な性能低下からも回復した。
  • アノテーター間の一貫性は高く、平均的なFleissのKappaおよびCohenのKappa値から、人的判断が信頼できることが示された。
  • 特徴量の重みの時間的変化から、モデルがフィードバックに基づき、最も関連性の高い特徴量を動的に優先するように調整していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。