Skip to main content
QUICK REVIEW

[논문 리뷰] Simplified Relative Citation Ratio for Static Paper Ranking: UFMG/LATIN at WSDM Cup 2016

Sabir Ribas, Alberto Ueda|arXiv (Cornell University)|2016. 03. 04.
Advanced Graph Neural Networks참고 문헌 9인용 수 7
한 줄 요약

이 논문은 공저자 인용 네트워크를 활용하여 초파라미터 조정 없이 학술 논문을 순위 매기는 데 사용할 수 있는 Relative Citation Ratio (RCR)의 단순화된 버전인 S-RCR를 소개한다. 120만 개의 논문을 포함하는 Microsoft Academic Graph에서 이 단일 특징만을 사용하여, 저자들은 WSDM 컵 2016에서 3등을 기록하였으며, 이는 잘 설계된 단일 특징이 더 낮은 계산 비용과 더 높은 해석 가능성으로 복잡한 모델보다도 뛰어난 성능을 낼 수 있음을 보여준다.

ABSTRACT

Static rankings of papers play a key role in the academic search setting. Many features are commonly used in the literature to produce such rankings, some examples are citation-based metrics, distinct applications of PageRank, among others. More recently, learning to rank techniques have been successfully applied to combine sets of features producing effective results. In this work, we propose the metric S-RCR, which is a simplified version of a metric called Relative Citation Ratio --- both based on the idea of a co-citation network. When compared to the classical version, our simplification S-RCR leads to improved efficiency with a reasonable effectiveness. We use S-RCR to rank over 120 million papers in the Microsoft Academic Graph dataset. By using this single feature, which has no parameters and does not need to be tuned, our team was able to reach the 3rd position in the first phase of the WSDM Cup 2016.

연구 동기 및 목표

  • 대규모 학술 그래프에서 정적 논문 순위 매기기 위한 효율적이고 초파라미터가 없는 지표를 개발하는 것.
  • 기존의 인용 기반 및 그래프 기반 방법과 비교해 계산 복잡도를 줄이면서 순위 매기기 효과성을 향상시키는 것.
  • 단일 특징이 복잡한 러닝-투-랭크 모델보다 학술 순위 매기기 작업에서 뛰어난 성능을 낼 수 있는지 평가하는 것.
  • 조정 가능한 파라미터나 광범위한 특징 공학에 의존하지 않고 Microsoft Academic Graph에서 논문 순위를 매기는 과제를 해결하는 것.

제안 방법

  • 공저자 인용 네트워크 구조에 기반한 Relative Citation Ratio (RCR)의 단순화된 변형인 S-RCR를 제안한다.
  • 논문의 분야 내 상대적 영향력을 반영하는 정규화된 인용 점수를 계산하기 위해 공저자 인용 관계를 사용한다.
  • Microsoft Academic Graph에 이 지표를 적용하여 약 5,000만 개의 인용 연결 논문을 처리한다.
  • C++를 사용해 그래프 처리를 수행하고, Python을 사용해 데이터 처리를 수행하며, Pandas와 Jupyter를 활용해 효율성을 높였다.
  • 모델 학습이나 초파라미터 조정이 필요 없도록 단일 비조정 가능한 특징을 사용해 순위를 매긴다.
  • 전문 연구자들이 수행한 쌍별 인간 평가 결과를 사용해 순위를 평가하며, 공개 및 비공개 테스트 세트에서 점수를 보고한다.

실험 결과

연구 질문

  • RQ1단순화되고 초파라미터가 없는 인용 지표가 기존의 인용 수와 PageRank보다 정적 논문 순위 매기기에서 뛰어나게 작용할 수 있는가?
  • RQ2학술 순위 매기기 작업에서 복잡한 러닝-투-랭크 모델과 비교해 단일 특징이 얼마나 효과적인가?
  • RQ3S-RCR 지표는 계산 효율성을 크게 향상시키면서도 높은 성능을 유지하는가?
  • RQ4RCR의 단순화가 대규모 학술 그래프에서 순위 품질을 얼마나 잘 유지하는가?

주요 결과

  • S-RCR 지표는 WSDM 컵 2016의 첫 번째 단계에서 공개 랜드보드 점수 0.697을 기록하여 총 3위를 차지했다.
  • 비공개 테스트 세트에서 S-RCR는 0.671점을 기록하여 참가한 32개 팀 중 3위를 기록했다.
  • 24코어 머신에서 최종 순위 파일을 생성하는 데 단 1시간 50분이 소요되어 높은 계산 효율성을 입증했다.
  • 공개 랜드보드에서 S-RCR는 인용 수(0.675)와 PageRank(0.687)보다 각각 3.3%와 1.8% 높은 성능을 보였다.
  • 비공개 세트에서 0.697에서 0.671로의 점수 하락은 미미했으며, 다른 팀들에 비해 과적합이 거의 발생하지 않았음을 시사했다.
  • 결과적으로 효과적인 순위 매기기는 단일 해석 가능하고 조정 불가능한 특징만으로도 달성될 수 있으며, 이는 복잡한 모델의 필요성을 의심스럽게 만든다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.