[논문 리뷰] Linking Publications to Funding at Project Level: A curated dataset of publications reported by FP7 projects
이 논문은 유럽연합의 제7차 프레임워크 프로그램(FP7)에 따라 245,000건의 고유한 학술 논문을 그 자금 지원 프로젝트와 연결한 정제된 고품질 데이터셋을 제시한다. 다양한 보고 채널에서 수집한 데이터를 통합하고, 공식 기관의 자료와 대조하여 기록을 검증하며, DOIs를 부여함으로써 93%의 기록 검증률과 90%의 DOI 부여 비율을 달성하여, 최초로 프로젝트 수준에서의 FP7 자금 지원 학술 출판물에 대한 종합적인 데이터셋을 구축함으로써 문헌학적 평가가 가능하게 한다.
Datasets explicitly linking publications to funding at project level are the basis of evaluative bibliometric analysis of funding programmes. Analysis of the impact of the EU funding programmes has been often frustrated by the lack of data on publications to which the funding has contributed. Here we present a dataset of scholarly publications reported by the projects funded by the European Union under the 7th Framework Programme. The dataset was created by first consolidating data from different reporting channels and validating the records by systematically matching them to external authoritative sources and assigning them external identifiers. The initial dataset had 305k records linked to one or more projects out of which 69% had a digital object identify (doi). Through the data quality assurance, we validate 93% of the initial records (283k) and assign a doi to 90% of them of them (245k). The resulting dataset has 245k unique dois (linked to one or more projects). It is, to our knowledge, the first comprehensive and curated dataset of scholarly outputs of the Framework Programme as reported by the grant holders. The dataset could only be created thanks to significant improvements and investments made in the reporting systems used by EU funded projects. The dataset is available EU open data portal: https://data.europa.eu/data/datasets/cordisfp7projects
연구 동기 및 목표
- 7번째 프레임워크 프로그램(FP7)에서 학술 출판물과 EU 자금 지원 출처를 연결하는 신뢰할 수 있고 프로젝트 수준의 데이터가 부족한 문제를 해결하기 위해.
- FP7 보조금 수혜자가 보고한 학술 출판물에 대한 종합적이고 고정확도의 데이터셋을 구축하기 위해.
- 외부 공식 기관과의 대조를 통해 기록의 품질을 향상시키고 지속 가능한 식별자(DOIs)를 부여함으로써 데이터 품질을 향상시키기 위해.
- 유럽연합 자금 지원 연구 프로그램의 영향력을 강력하게 평가하기 위한 문헌학적 평가를 가능하게 하기 위해.
제안 방법
- 305,000건의 기록을 포함하는 초기 통합 데이터셋을 만들기 위해 여러 FP7 프로젝트 보고 채널에서 원시 학술 데이터를 집계하였다.
- 메타데이터를 검증하고 보완하기 위해 외부 공식 기관(예: Crossref, PubMed)과의 일치를 체계적으로 수행하였다.
- 자동화 및 수동 검증 기법을 사용하여 가능한 한 기록에 DOI를 할당하였다.
- 기록 품질 확보 절차를 적용하여 初기 305,000건의 기록 중 93%를 검증(283,000건 검증됨).
- 검증된 기록 중 90%에 대해 DOI를 할당함(245,000건의 고유한 DOI).
- 최종 정제된 데이터셋을 공개 접근 및 재사용을 위해 유럽연합 오픈 데이터 포털에 게시하였다.
실험 결과
연구 질문
- RQ1외부 식별자를 사용하여 FP7 프로젝트에서 보고된 논문을 그 자금 지원 프로젝트와 정확하게 연결할 수 있는 정도는 어느 정도인가?
- RQ2다양한 보고 채널 통합과 외부 검증이 연구 자금 지원 데이터셋의 품질 향상에 얼마나 효과적인가?
- RQ3FP7 논문의 어느 비율이 DOI를 할당받을 수 있으며, 이는 추적 가능성과 문헌학적 분석에 어떤 영향을 미치는가?
- RQ4대규모로 정제된 프로젝트 수준의 출판물-자금 지원 연결 데이터셋을 체계적으로 구축하고 공개 이용 가능하게 만들 수 있는가?
주요 결과
- 최종 데이터셋에는 하나 이상의 FP7 프로젝트와 연결된 245,000건의 고유한 DOIs가 포함되어 있으며, 검증된 기록 중 90%의 DOI 할당 비율을 기록하였다.
- 초기 305,000건의 기록 중 93%가 공식 외부 기관과의 대조를 통해 성공적으로 검증되었다.
- 이 데이터셋은 프로젝트 수준에서의 FP7 프로젝트 학술 출판물에 대한 종합적이고 정제된, 공개 가능한 최초의 데이터셋이다.
- 높은 데이터 품질과 광범위한 DOI 커버리지로 인해, EU 연구 자금 지원 영향력에 대한 문헌학적 분석 가능성이 크게 향상되었다.
- EU 자금 지원 프로젝트에서 사용하는 보고 시스템의 상당한 개선 덕분에 이 데이터셋의 제작이 가능해졌다.
- 이 데이터셋은 유럽연합 오픈 데이터 포털을 통해 공개되어 있어 재현 가능하고 투명한 연구 평가를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.