[論文レビュー] Document Embeddings vs. Keyphrases vs. Terms: An Online Evaluation in Digital Library Recommender Systems
本稿は、実世界のオンラインユーザー行動を用いて、デジタル図書館システムにおける語群ベース、ドキュメント埋め込み、キーフレーズベースの推薦手法を評価する。19か月にわたるMr. DLibを介した配備において、Jabrefではキーフレーズが語群や埋め込みを上回り(CTR 0.03%)、Sowiportでは語群が最良(CTR 0.1%)であった。各システムにおいて、最良と最悪の手法の間で性能差が400%以上に達した。
Many recommendation algorithms are available to digital library recommender system operators. The effectiveness of algorithms is largely unreported by way of online evaluation. We compare a standard term-based recommendation approach to two promising approaches for related-article recommendation in digital libraries: document embeddings, and keyphrases. We evaluate the consistency of their performance across multiple scenarios. Through our recommender-as-a-service Mr. DLib, we delivered 33.5M recommendations to users of Sowiport and Jabref over the course of 19 months, from March 2017 to October 2018. The effectiveness of the algorithms differs significantly between Sowiport and Jabref (Wilcoxon rank-sum test; p < 0.05). There is a ~400% difference in effectiveness between the best and worst algorithm in both scenarios separately. The best performing algorithm in Sowiport (terms) is the worst performing in Jabref. The best performing algorithm in Jabref (keyphrases) is 70% worse in Sowiport, than Sowiport`s best algorithm (click-through rate; 0.1% terms, 0.03% keyphrases).
研究の動機と目的
- 実世界における語群ベース、ドキュメント埋め込み、キーフレーズベースの推薦手法がデジタル図書館環境でどれほど効果的であるかを評価すること。
- 異なるデジタル図書館プラットフォーム間で、推薦アルゴリズムの性能差が一貫しているかどうかを評価すること。
- 生産環境におけるオンラインクリックスルーレートを通じて、アルゴリズム選択がユーザー参加度に与える影響を調査すること。
- 実世界のデジタル図書館推薦システムにおいて、現代の表現学習技術(埋め込み、キーフレーズ)と従来の語群ベース手法の相対的有効性に関する実証的証拠を提供すること。
提案手法
- 19か月間(2017年3月〜2018年10月)にわたり、SowiportおよびJabrefのユーザーに推薦を提供する生産環境向けのレコメンド・アズ・ア・サービス(Mr. DLib)を展開した。
- TF-IDF語群、ニューラルネットワークからの密度型ドキュメント埋め込み、メタデータおよび本文から抽出したキーフレーズの3つの異なる表現手法を用いて推薦を生成した。
- 生産システムを通じてログ記録されたリアルタイムのクリックスルーレート(CTR)を用いて、ユーザー参加度を測定した。
- 2つのデジタル図書館プラットフォーム間でのアルゴリズム性能を比較するために、統計的分析(ウィルコクソン・ランク・スムの検定)を適用した。
- オффラインベンチマークの制限を避けるために、実ユーザー環境下でのオンライン評価を実施し、アルゴリズムの有効性を評価した。
- Sowiport(社会科学)とJabref(コンピュータサイエンスおよび学術ソフトウェア)という2つの異なるドメインにおける性能の一貫性を評価した。
実験結果
リサーチクエスチョン
- RQ1語群ベース、ドキュメント埋め込みベース、キーフレーズベースの推薦アルゴリズムは、デジタル図書館におけるオンラインユーザー参加度において、どのように比較されるか?
- RQ2異なるデジタル図書館プラットフォーム間で、推薦アルゴリズムの性能順位が一貫しているか?
- RQ3実世界の設定において、最良と最悪の推薦手法との間の性能差の大きさはどの程度か?
- RQ4キーフレーズやドキュメント埋め込みは、生産環境のデジタル図書館推薦システムにおいて、従来の語群ベース手法を上回ることができるか?
- RQ5SowiportとJabrefの両プラットフォーム間で、異なる推薦戦略のクリックスルーレートはどのように異なるか?
主な発見
- 推薦アルゴリズムの性能はSowiportとJabrefの間で顕著に異なり、どの手法も普遍的に最良とは言えないことがわかった。
- Sowiportでは語群ベース手法が最高のクリックスルーレート(0.1%)を記録したが、Jabrefではキーフレーズベース手法が最良であった(CTR 0.03%)。
- あるシステムで最良のアルゴリズムが、別のシステムでは最悪の結果を示したため、ドメイン依存性が強いことが明らかになった。
- SowiportおよびJabrefの両システムにおいて、最良と最悪のアルゴリズムの性能差は約400%に達した。
- キーフレーズベース手法は、Sowiportでは最良手法(0.1% CTR)と比較して70%低いクリックスルーレート(0.03%)を記録した。
- 統計的分析により、アルゴリズム間の性能差が有意であった(p < 0.05、ウィルコクソン・ランク・スムの検定)ことが確認され、結果の信頼性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。