[논문 리뷰] A large dataset of software mentions in the biomedical literature
이 논문은 240만 페퍼에서 추출한 112만 개의 고유한 소프트웨어 언급을 포함하는 대규모 CZ 소프트웨어 언급 데이터셋을 소개한다. 이는 최적화된 SciBERT NER 모델을 사용하여 추출되었으며, 저자들은 DBSCAN 기반 클러스터링 방법을 적용하여 언급을 97,600개의 고유한 소프트웨어 엔티티로 분리하고, 185,000개를 저장소에 연결하여 소프트웨어의 영향력 분석을 가능하게 한다. 이는 과학적 소프트웨어의 영향력 분석을 가능하게 한다.
We describe the CZ Software Mentions dataset, a new dataset of software mentions in biomedical papers. Plain-text software mentions are extracted with a trained SciBERT model from several sources: the NIH PubMed Central collection and from papers provided by various publishers to the Chan Zuckerberg Initiative. The dataset provides sources, context and metadata, and, for a number of mentions, the disambiguated software entities and links. We extract 1.12 million unique string software mentions from 2.4 million papers in the NIH PMC-OA Commercial subset, 481k unique mentions from the NIH PMC-OA Non-Commercial subset (both gathered in October 2021) and 934k unique mentions from 3 million papers in the Publishers' collection. There is variation in how software is mentioned in papers and extracted by the NER algorithm. We propose a clustering-based disambiguation algorithm to map plain-text software mentions into distinct software entities and apply it on the NIH PubMed Central Commercial collection. Through this methodology, we disambiguate 1.12 million unique strings extracted by the NER model into 97600 unique software entities, covering 78% of all software-paper links. We link 185000 of the mentions to a repository, covering about 55% of all software-paper links. We describe in detail the process of building the datasets, disambiguating and linking the software mentions, as well as opportunities and challenges that come with a dataset of this size. We make all data and code publicly available as a new resource to help assess the impact of software (in particular scientific open source projects) on science.
연구 동기 및 목표
- 생물의학 문헌에서 소프트웨어가 자주 부족하게 인용되고 평가받지 못하는 문제를 해결하기 위해 과학적 소프트웨어를 식별하고 공인하는 데 목적이 있다.
- 과학적 소프트웨어의 영향력 평가를 지원하기 위해 대규모로 공개 가능한 소프트웨어 언급 데이터셋을 구축하기 위해 목적이 있다.
- 다양한 소프트웨어 이름 문자열을 고유한 소프트웨어 엔티티로 매핑하는 분리 처리 파이프라인을 개발하고 적용하기 위해 목적이 있다.
- 소프트웨어 언급을 외부 저장소(예: GitHub, PyPI)에 연결하여 추적 가능성과 재현 가능성을 향상시키기 위해 목적이 있다.
- 소프트웨어 사용 추세, 분야별 채택, 과학 분야의 영향력 지표 등 새로운 연구를 가능하게 하기 위해 목적이 있다.
제안 방법
- 명시적 엔티티 인식(NER)을 위한 최적화된 SciBERT 모델을 사용하여 생물의학 논문의 전문 텍스트에서 소프트웨어 언급을 추출한다.
- 키워드 기반 동의어 생성, SciCrunch API 쿼리, 문자열 유사도 메트릭(예: Jaccard, Levenshtein)을 조합한 다단계 분리 처리 파이프라인을 적용한다.
- 유사도 행렬에 DBSCAN 클러스터링을 적용하여 의미적으로 유사한 소프트웨어 언급을 고유한 소프트웨어 엔티티로 그룹화한다.
- PyPI, CRAN, Bioconductor, SciCrunch, GitHub API를 사용한 정확한 매칭 검색을 통해 언급을 외부 저장소에 연결한다.
- 표준화된 지침을 사용한 전문 생물학적 코디네이터를 활용하여 데이터셋을 정제하고, 상호 평가 일致도 지표를 통해 검증한다.
- 메타데이터를 정규화하고 일관된 스키마를 사용하여 최종 데이터셋을 구조화하여 공개한다.
실험 결과
연구 질문
- RQ1생물의학 문헌에서 소프트웨어 언급 패턴의 범위와 변동성은 어떠한가?
- RQ2문자열 유사도 및 클러스터링 기법이 소프트웨어 언급을 고유한 소프트웨어 엔티티로 얼마나 효과적으로 분리할 수 있는가?
- RQ3소프트웨어 언급이 GitHub나 PyPI와 같은 공신력 있는 저장소에 얼마나 잘 연결될 수 있는가?
- RQ4단일세포 생물학이나 영상 분석과 같은 생물의학 분야 하위 분야에서 소프트웨어 채택의 추세는 어떠한가?
- RQ5이 데이터셋이 소프트웨어 전용 Eigenfactors와 같은 새로운 영향력 지표 개발을 지원할 수 있는가?
주요 결과
- 데이터셋은 NIH PMC-OA 상업용 서브셋에서 112만 개의 고유한 소프트웨어 언급(240만 페퍼), 비상업용 서브셋에서 481,000개, 출판사 제공 컬렉션에서 934,000개를 포함한다.
- DBSCAN 클러스터링을 사용하여 112만 개의 언급이 97,600개의 고유한 소프트웨어 엔티티로 분리되었으며, 이는 모든 소프트웨어-논문 링크의 78%를 커버한다.
- 185,000개의 언급이 외부 저장소에 성공적으로 연결되었으며, 이는 모든 소프트웨어-논문 링크의 약 55%를 커버한다.
- 전문가 평가 결과, 분리 처리 파이프라인은 높은 정밀도를 기록했으며, 정제된 샘플에서 강한 상호 평가 일치도를 보였다.
- 이 데이터셋은 단일세포 기법과 영상 소프트웨어의 분야 내 침투 추적과 같은 새로운 사용 사례를 가능하게 한다.
- 저자들은 텍스트 마이닝과 클러스터링을 활용하여 대규모로 재현 가능한 소프트웨어 영향력 분석 자원을 구축할 수 있음을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.