[논문 리뷰] The Rise of Open Science: Tracking the Evolution and Perceived Value of Data and Methods Link-Sharing Practices
이 연구는 신경 텍스트 분류 모델을 사용하여 arXiv의 컴퓨터 과학, 물리학, 수학 분야의 110만 편의 논문에서 데이터 및 방법 링크 공유의 진화와 인식된 가치를 분석한다. 링크 유형을 식별하기 위해 사용한다. 연구는 시간이 지남에 따라 링크 공유의 확산이 증가하고 있으며, 특히 GitHub에서 링크 재사용이 증가하고 있으며, 활성화된 데이터/방법 링크를 공유한 논문이 더 높은 인용 수를 기록하는 것으로 나타나, 개방 과학 관행에 대한 기관적 및 학술적 가치가 높아지고 있음을 보여준다.
In recent years, funding agencies and journals increasingly advocate for open science practices (e.g. data and method sharing) to improve the transparency, access, and reproducibility of science. However, quantifying these practices at scale has proven difficult. In this work, we leverage a large-scale dataset of 1.1M papers from arXiv that are representative of the fields of physics, math, and computer science to analyze the adoption of data and method link-sharing practices over time and their impact on article reception. To identify links to data and methods, we train a neural text classification model to automatically classify URL types based on contextual mentions in papers. We find evidence that the practice of link-sharing to methods and data is spreading as more papers include such URLs over time. Reproducibility efforts may also be spreading because the same links are being increasingly reused across papers (especially in computer science); and these links are increasingly concentrated within fewer web domains (e.g. Github) over time. Lastly, articles that share data and method links receive increased recognition in terms of citation count, with a stronger effect when the shared links are active (rather than defunct). Together, these findings demonstrate the increased spread and perceived value of data and method sharing practices in open science.
연구 동기 및 목표
- 컴퓨터 과학, 물리학, 수학 분야의 과학 논문에서 데이터 및 방법 링크 공유 관행의 진화를 추적하기 위해.
- 시간에 따라 데이터 및 방법 링크의 도입률과 재사용 패턴을 정량화하기 위해.
- 인용 영향도와의 상관관계를 분석하여 링크 공유의 인식된 가치를 평가하기 위해.
- 웹 도메인(예: GitHub)이 링크 공유 활동을 집중시키는 데 수행하는 역할을 규명하기 위해.
제안 방법
- 문맥적 언급(예: 'data', 'code', 'method')을 바탕으로 논문 내 URL을 자동으로 분류하기 위해 신경 텍스트 분류 모델을 훈련시켰다.
- 컴퓨터 과학, 물리학, 수학 분야에서 arXiv에서 확보한 110만 편의 논문 대규모 데이터셋에 모델을 적용하였다.
- 링크 공유 빈도, 논문 간 재사용, 도메인 집중도(예: GitHub, Zenodo)의 시간적 추세를 추적하였다.
- 공유된 데이터/방법 링크가 포함된 논문의 인용 영향도를 측정하고, 활성 링크와 기능하지 않는 링크를 비교하였다.
- 인용 수 등 논문 수용도와 링크 공유 관행 간의 상관관계를 분석하기 위해 통계적 분석을 사용하였다.
실험 결과
연구 질문
- RQ1arXiv의 과학 논문에서 데이터 및 방법 링크 공유 비율은 시간이 지남에 따라 어떻게 변화해 왔는가?
- RQ2공유된 데이터 및 방법 링크는 다른 논문들 사이에서 얼마나 자주 재사용되며, 이 재사용은 시간이 지남에 따라 어떻게 변화해 왔는가?
- RQ3데이터 및 방법을 공유하는 데 가장 자주 사용되는 웹 도메인은 무엇이며, 이러한 집중도는 어떻게 변화해 왔는가?
- RQ4링크 공유와 인용 영향도 사이의 관계는 어떠한가, 특히 활성 링크와 기능하지 않는 링크를 비교했을 때 어떻게 되는가?
- RQ5컴퓨터 과학, 물리학, 수학 분야 간 링크 공유 관행은 어떻게 다름이 있는가?
주요 결과
- 데이터 및 방법 링크를 공유하는 논문의 비율은 시간이 지남에 따라 크게 증가했으며, 특히 컴퓨터 과학 분야에서 두드러졌다.
- 공유된 링크는 점점 더 다양한 논문들 사이에서 재사용되고 있어, 재현 가능한 연구 관행의 확산이 가속화되고 있음을 시사한다.
- 링크 공유 활동이 점점 더 적은 웹 도메인에 집중되고 있으며, GitHub가 방법 및 데이터 공유의 주요 플랫폼으로 떠올랐다.
- 활동 중인 데이터 및 방법 링크를 공유한 논문은 기능하지 않거나 링크가 없는 논문보다 유의미하게 더 높은 인용 수를 기록한다.
- 활성 링크일수록 인용에 미치는 긍정적 영향이 더 크며, 이는 링크의 품질과 지속성의 중요성이 학술적 가치 인식에 결정적이라는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.