Skip to main content
QUICK REVIEW

[논문 리뷰] Early Indicators of Scientific Impact: Predicting Citations with Altmetrics

Akhil Pandey Akella, Hamed Alhoori|arXiv (Cornell University)|2020. 12. 25.
scientometrics and bibliometrics research참고 문헌 92인용 수 4
한 줄 요약

이 논문은 Mendeley 독자 수, 트위터 언급, 위키백과 참조와 같은 앨트메트릭스를 사용하여 학술적 인용 영향을 조기에 예측하는 방법을 제안한다. 학술 출판물 데이터셋을 바탕으로 신경망과 앙상블 모델을 적용한 결과, Mendeley 독자 수가 단기 및 장기적 인용 수 모두에서 가장 강력한 예측 변수로 나타났으며, 전통적인 지표에 비해 조기에 영향력을 평가하는 데서 모델 성능이 뚜렷이 뛰어났다.

ABSTRACT

Identifying important scholarly literature at an early stage is vital to the academic research community and other stakeholders such as technology companies and government bodies. Due to the sheer amount of research published and the growth of ever-changing interdisciplinary areas, researchers need an efficient way to identify important scholarly work. The number of citations a given research publication has accrued has been used for this purpose, but these take time to occur and longer to accumulate. In this article, we use altmetrics to predict the short-term and long-term citations that a scholarly publication could receive. We build various classification and regression models and evaluate their performance, finding neural networks and ensemble models to perform best for these tasks. We also find that Mendeley readership is the most important factor in predicting the early citations, followed by other factors such as the academic status of the readers (e.g., student, postdoc, professor), followers on Twitter, online post length, author count, and the number of mentions on Twitter, Wikipedia, and across different countries.

연구 동기 및 목표

  • 기존 인용 데이터가 축적되기 이전에 향후 인용 수를 예측할 수 있는 초기 지표를 특정화하기 위해.
  • Mendeley 독자 수, 트위터 언급, 위키백과 참조와 같은 다양한 앨트메트릭스가 단기 및 장기적 인용을 예측하는 데 얼마나 효과적인지 평가하기 위해.
  • 신경망 및 앙상블 방법을 포함한 다양한 기계학습 모델이 초기 앨트메트릭 데이터를 사용해 인용 영향을 예측하는 데서 성능을 비교하기 위해.
  • 독자 학술 상태(예: 학부생, 박사후과정, 정교수) 및 게시글 길이와 같은 다양한 앨트메트릭 요소의 상대적 중요도가 학술적 영향 예측에 얼마나 기여하는지 파악하기 위해.
  • 연구자, 기관, 자금 지원 기관이 연구 영향을 출판 생애주기의 조기에 더 데이터 기반으로 평가할 수 있도록 프레임워크를 제공하기 위해.

제안 방법

  • 저자들은 앨트메트릭스 데이터와 시간에 따른 인용 수가 함께 제공된 학술 출판물 데이터셋을 수집한다.
  • Mendeley 독자 수, 트위터 언급 수, 위키백과 언급 수, 저자 수, 게시글 길이, 독자 학술 상태(예: 학부생, 박사후과정, 정교수) 등의 특징을 추출한다.
  • 회귀 및 분류 작업을 위한 피드포워드 신경망과 앙상블 모델(예: 랜덤 포레스트, 기울기 부스팅)을 포함한 여러 기계학습 모델을 훈련하고 평가한다.
  • 모델은 출판 후 첫 3~6개월 이내의 초기 앨트메트릭스 데이터를 기반으로 향후 인용 수를 예측하도록 훈련한다.
  • 퍼머터이션 기반 방법을 사용해 특징 중요도를 평가하여 인용 영향 예측에 가장 영향을 미치는 예측 변수를 특정한다.
  • 단기 및 장기적 인용 예측 작업 전반에서 표준 회귀 지표(R², RMSE 등)와 분류 지표(AUC 등)를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1출판 후 몇 달 이내에 수집된 앨트메트릭스가 향후 인용 수를 신뢰성 있게 예측할 수 있는가?
  • RQ2Mendeley 독자 수, 트위터 참여도, 위키백과 언급과 같은 특정 앨트메트릭스 요소 중에서 장기적 인용 영향을 가장 잘 예측하는 것은 무엇인가?
  • RQ3특히 신경망과 앙상블 방법을 포함한 다양한 기계학습 모델이 초기 앨트메트릭스 데이터를 사용해 인용 영향을 예측하는 데서 어떻게 성능을 비교하는가?
  • RQ4독자의 학술 상태(예: 학부생 대비 정교수)가 앨트메트릭스의 예측 능력에 유의미하게 영향을 미치는가?
  • RQ5초기 앨트메트릭스 지표는 얼마나 많은 시간을 단축시켜 연구 출판물의 과학적 영향 평가에 필요한 시간을 줄일 수 있는가?

주요 결과

  • Mendeley 독자 수는 단기 및 장기적 인용 영향 예측에서 가장 중요한 예측 변수로 나타났으며, 다른 앨트메트릭스 지표보다 뚜렷이 뛰어난 성능를 보였다.
  • 신경망과 앙상블 모델(예: 기울기 부스팅)이 가장 높은 예측 성능를 기록했으며, 장기적 인용 예측에서 R² 값이 0.65를 초과했다.
  • 트위터 팔로워 수와 언급 수는 예측 능력은 낮았지만, 특히 초기 단계의 예측에서 의미 있는 기여를 했다.
  • 독자의 학술 상태(예: 박사후과정 대비 정교수)는 Mendeley 독자 수의 예측 능력에 유의미하게 영향을 미쳤으며, 높은 학술 지위를 가진 독자가 향후 영향을 더 잘 예측하는 지표로 작용했다.
  • 온라인 게시글 길이와 논문을 언급한 국가 수 역시 통계적으로 유의미한 예측 변수로 확인되었지만, 영향력은 낮았다.
  • 본 연구는 출판 후 6개월 이내에 수집된 앨트메트릭스가 인용 영향을 신뢰성 있게 예측할 수 있음을 입증했으며, 기존 5~10년의 인용 데이터 축적 기간을 줄이는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.