Skip to main content
QUICK REVIEW

[논문 리뷰] Assigning credit to scientific datasets using article citation networks

Tong Zeng, Longfeng Wu|arXiv (Cornell University)|2020. 01. 16.
Scientific Computing and Data Management참고 문헌 55인용 수 4
한 줄 요약

이 논문은 과학적 데이터셋에 대한 신뢰도를 부여하기 위해 출판물과 데이터셋 간의 인용 흐름을 다르게 모델링하는 네트워크 플로우 알고리즘인 DataRank를 제안한다. 실제 사용 사례(예: GenBank 웹 방문 수 및 Figshare 다운로드 수)를 예측하는 데 기존 방법들을 능가하며, 데이터셋은 고유한 인용 역학을 가지며 명시적 데이터셋 인용이 없더라도 의미 있는 순위를 매길 수 있음을 입증한다.

ABSTRACT

A citation is a well-established mechanism for connecting scientific artifacts. Citation networks are used by citation analysis for a variety of reasons, prominently to give credit to scientists' work. However, because of current citation practices, scientists tend to cite only publications, leaving out other types of artifacts such as datasets. Datasets then do not get appropriate credit even though they are increasingly reused and experimented with. We develop a network flow measure, called DataRank, aimed at solving this gap. DataRank assigns a relative value to each node in the network based on how citations flow through the graph, differentiating publication and dataset flow rates. We evaluate the quality of DataRank by estimating its accuracy at predicting the usage of real datasets: web visits to GenBank and downloads of Figshare datasets. We show that DataRank is better at predicting this usage compared to alternatives while offering additional interpretable outcomes. We discuss improvements to citation behavior and algorithms to properly track and assign credit to datasets.

연구 동기 및 목표

  • 과학적 데이터셋이 재현성과 재사용에 핵심적인 역할을 하므로 그에 대한 체계적인 신뢰도 부여가 부족한 문제를 해결하기 위해.
  • 인용 행동을 변경하지 않고도 출판물 인용 네트워크에서 데이터셋의 영향력을 유추할 수 있는 방법을 개발하기 위해.
  • 출판물과 데이터셋의 인용 네트워크 내에서의 노후화 속도의 차이를 모델링하여 영향력 추정을 향상시키기 위해.
  • GenBank 및 Figshare의 실제 데이터를 사용하여 데이터를 검증하고, 실제 사용 지표와의 예측 정확도를 측정하기 위해.
  • 과학 분야에서 공정한 평가 및 정책 수립을 지원할 수 있는 확장 가능하고 해석 가능한 데이터셋 순위 매기기 프레임워크를 제공하기 위해.

제안 방법

  • 이 방법은 네트워크 플로우 알고리즘(Walker 등, 2007)을 확장하여 출판물과 데이터셋이라는 두 가지 다른 노드 유형을 도입한다.
  • 출판물과 데이터셋에 대해 서로 다른 감쇠율을 적용하여, 각각의 고유한 노후화 패턴을 반영하는 인용 흐름을 모델링한다.
  • 랜덤 워커가 인용 네트워크를 이동하며, 인용이 네트워크를 통해 어떻게 전파되는지에 따라 데이터셋에 더 높은 점수를 할당한다.
  • 알고리즘은 각 데이터셋의 상대적 점수인 DataRank를 계산하여, 인용 흐름에 기반한 추론된 영향력을 반영한다.
  • 이 방법은 명시적 데이터셋 인용이 필요로 하지 않으며, 대신 출판물 인용 패tern을 기반으로 사용량을 유추한다.
  • GenBank 및 Figshare의 메타데이터를 사용하여 검증하였으며, DataRank 점수를 실제 웹 방문 수와 다운로드 수와 비교하였다.

실험 결과

연구 질문

  • RQ1출판물 인용 네트워크만을 사용하여 네트워크 플로우 알고리즘이 데이터셋에 대해 효과적으로 신뢰도를 부여할 수 있는가?
  • RQ2데이터셋의 인용 역학은 노후화 및 흐름 전파 측면에서 출판물과 어떻게 다를까?
  • RQ3DataRank는 웹 방문 수나 다운로드 수와 같은 실제 세계의 데이터셋 사용을 어느 정도 정확하게 예측할 수 있는가?
  • RQ4DataRank는 데이터셋에 대한 기존의 기반 인용 순위 매기기 방법에 비해 예측 정확도에서 얼마나 뛰어나게 되는가?
  • RQ5이 방법은 인용 행동을 변경하지 않더라도 공정한 과학적 영향 평가를 지원할 수 있는가?

주요 결과

  • DataRank는 GenBank 시퀀스의 웹 방문 수와 Figshare 데이터셋의 다운로드 수를 측정하여 실제 데이터셋 사용을 예측하는 데 기존 방법들을 능가한다.
  • 알고리즘이 출판물과 비교해 데이터셋의 고유한 인용 역학, 특히 노후화 속도 측면에서 성공적으로 포착하였다.
  • 단지 693개의 GenBank 기록과 355개의 Figshare 데이터셋만 네트워크에 포함되어 있어도 DataRank는 의미 있는 예측 성능을 달성하였다.
  • 이 방법은 데이터셋의 상대적 영향력을 반영하는 해석 가능한 점수를 제공하여, 데이터 기반 과학에서의 영향 평가 기초를 마련한다.
  • 명시적 인용이 필요 없이 데이터셋 순위를 매길 수 있으므로, 디지털 과학적 대상에 대한 신뢰도 부여에 실용적인 도구가 된다.
  • 연구는 인용 관행이 불완전하더라도 네트워크 기반 추론을 통해 데이터셋의 영향력을 체계적으로 평가할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.