Skip to main content
QUICK REVIEW

[논문 리뷰] Document Embeddings vs. Keyphrases vs. Terms: An Online Evaluation in Digital Library Recommender Systems

Andrew Collins, Joeran Beel|arXiv (Cornell University)|2019. 05. 27.
Advanced Text Analysis Techniques참고 문헌 4인용 수 4
한 줄 요약

이 논문은 실제 온라인 사용자 상호작용을 통해 디지털 라이브러리 시스템에서 용어 기반, 문서 임베딩, 핵심어 기반 추천 방법을 평가한다. 19개월간 Mr. DLib를 통해 구현된 운영 환경에서 핵심어 기반 방법이 Jabref에서는 용어와 임베딩보다 우수했으며(0.03% 클릭률), Sowiport에서는 용어 기반 방법이 가장 우수했으며(0.1%), 각 시스템에서 최상위와 최하위 방법 간 성능 차이가 400% 이상이었다.

ABSTRACT

Many recommendation algorithms are available to digital library recommender system operators. The effectiveness of algorithms is largely unreported by way of online evaluation. We compare a standard term-based recommendation approach to two promising approaches for related-article recommendation in digital libraries: document embeddings, and keyphrases. We evaluate the consistency of their performance across multiple scenarios. Through our recommender-as-a-service Mr. DLib, we delivered 33.5M recommendations to users of Sowiport and Jabref over the course of 19 months, from March 2017 to October 2018. The effectiveness of the algorithms differs significantly between Sowiport and Jabref (Wilcoxon rank-sum test; p < 0.05). There is a ~400% difference in effectiveness between the best and worst algorithm in both scenarios separately. The best performing algorithm in Sowiport (terms) is the worst performing in Jabref. The best performing algorithm in Jabref (keyphrases) is 70% worse in Sowiport, than Sowiport`s best algorithm (click-through rate; 0.1% terms, 0.03% keyphrases).

연구 동기 및 목표

  • 디지털 라이브러리 환경에서 용어 기반, 문서 임베딩 기반, 핵심어 기반 추천 방법의 실세계적 효과성을 평가하기 위해.
  • 다양한 디지털 라이브러리 플랫폼 간 추천 알고리즘 간 성능 차이가 일관된지 평가하기 위해.
  • 실제 운영 시스템에서의 클릭률을 통해 알고리즘 선택이 사용자 참여도에 미치는 영향을 조사하기 위해.
  • 실세계 디지털 라이브러리 추천 시스템에서 현대적 표현 학습 기법(임베딩, 핵심어)과 전통적 용어 기반 방법 간 상대적 효과성을 실증적으로 제시하기 위해.

제안 방법

  • 19개월간(2017년 3월 – 2018년 10월) Sowiport와 Jabref 사용자에게 추천 서비스를 제공하기 위해 운영 수준의 추천기 as-a-service(Mr. DLib)를 구현하였다.
  • TF-IDF 용어, 신경망에서 유도된 밀도형 문서 임베딩, 메타데이터 및 텍스트에서 추출한 핵심어 등 세 가지 다른 표현 방법을 사용해 추천을 생성하였다.
  • 실시간으로 운영 시스템을 통해 로깅된 클릭률(CTR)을 통해 사용자 참여도를 측정하였다.
  • 두 디지털 라이브러리 플랫폼 간 알고리즘 성능 비교를 위해 통계 분석(Wilcoxon 순위합 검정)을 적용하였다.
  • 오프라인 벤치마크의 한계를 피하기 위해 실사용 조건에서의 성능 평가를 위해 온라인 평가를 적용하였다.
  • Sowiport(사회과학 분야)와 Jabref(컴퓨터 과학 및 학술 소프트웨어 분야)라는 두 개의 서로 다른 도메인에서 성능 일관성을 평가하였다.

실험 결과

연구 질문

  • RQ1용어 기반, 문서 임베딩 기반, 핵심어 기반 추천 알고리즘이 디지털 라이브러리에서 온라인 사용자 참여도 측면에서 어떻게 비교될 수 있는가?
  • RQ2다른 디지털 라이브러리 플랫폼 간에 추천 알고리즘의 성능 순위가 일관된가?
  • RQ3실세계 환경에서 최상위와 최하위 추천 방법 간 성능 차이는 어느 정도인가?
  • RQ4핵심어 또는 문서 임베딩이 실운영 환경의 디지털 라이브러리 추천 시스템에서 전통적 용어 기반 방법보다 뛰어날 수 있는가?
  • RQ5Sowiport와 Jabref 플랫폼 간에 다양한 추천 전략의 클릭률은 어떻게 달라지는가?

주요 결과

  • Sowiport와 Jabref 간 추천 알고리즘 성능에 큰 차이가 있었으며, 어떤 방법도 항상 최고는 아니었다.
  • Sowiport에서는 용어 기반 방법이 가장 높은 클릭률(0.1%)을 기록했고, Jabref에서는 핵심어 기반 방법이 가장 뛰어났다(0.03% CTR).
  • 한 시스템에서 최고 성능을 보인 알고리즘이 다른 시스템에선 최악의 성능을 보였으며, 이는 도메인 의존성이 높음을 시사한다.
  • Sowiport와 Jabref 양쪽 모두에서 최상위와 최하위 알고리즘 간 성능 격차는 약 400%였다.
  • 핵심어 기반 방법은 Sowiport에서 최고 성능 방법(0.1%) 대비 70% 낮은 클릭률(0.03%)을 기록했다.
  • 통계 분석을 통해 알고리즘 간 유의미한 성능 차이가 확인되었으며(p < 0.05, Wilcoxon 순위합 검정), 결과의 신뢰성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.