Skip to main content
QUICK REVIEW

[논문 리뷰] Coverage of Author Identifiers in Web of Science and Scopus

Thomas Krämer, Fakhri Momeni|arXiv (Cornell University)|2017. 03. 03.
Biomedical Text Mining and Ontologies참고 문헌 13인용 수 8
한 줄 요약

이 연구는 1996~2014년 동안 웹 오브 사이언스와 스푸스가 공통으로 포함한 603만 건의 출판물에서 연구자 식별자—ResearcherID, ORCID, Scopus 저자 식별자—의 커버리지와 분포를 분석한다. 연구 결과, 과학, 기술, 의학(STM) 분야에서 식별자 커버리지가 가장 높으며, 수동 등록 방식으로 인해 ResearcherID가 ORCID보다 더 널리 배정되었고, 스푸스의 자동화된 시스템은 번역 문제로 인해 아시아 이름을 선호하는 편향을 보여, 정규화 정확도를 떨어뜨린다.

ABSTRACT

As digital collections of scientific literature are widespread and used frequently in knowledge-intense working environments, it has become a challenge to identify author names correctly. The treatment of homonyms is crucial for the reliable resolution of author names. Apart from varying handling of first, middle and last names, vendors as well as the digital library community created tools to address the problem of author name disambiguation. This technical report focuses on two widespread collections of scientific literature, Web of Science (WoS) and Scopus, and the coverage with author identification information such as Researcher ID, ORCID and Scopus Author Identifier in the period 1996 - 2014. The goal of this study is to describe the significant differences of the two collections with respect to overall distribution of author identifiers and its use across different subject domains. We found that the STM disciplines show the best coverage of author identifiers in our dataset of 6,032,000 publications which are both covered by WoS and Scopus. In our dataset we found 184,823 distinct ResearcherIDs and 70,043 distinct ORCIDs. In the appendix of this report we list a complete overview of all WoS subject areas and the amount of author identifiers in these subject areas.

연구 동기 및 목표

  • 웹 오브 사이언스와 스푸스 내 연구자 식별자(ResearcherID, ORCID, Scopus 저자 식별자)의 커버리지와 분포를 평가하기 위해.
  • 다양한 과학적 주제 분야 간 식별자 도입 격차를 규명하기 위해.
  • 이름의 동음이의성과 번역 문제의 영향을 고려하여 인용 데이터베이스에서 자동화된 저자 정규화의 정확도에 영향을 미치는 정도를 평가하기 위해.
  • 수동으로 할당된(ResearcherID, ORCID)과 자동으로 할당된(Scopus 저자 식별자) 식별자의 신뢰성과 정확도를 비교하기 위해.
  • 식별자 커버리지 격차가 문헌정보학적 연구와 학술 네트워크 분석에 미치는 영향을 검토하기 위해.

제안 방법

  • DOI에 더해 최소 두 개 이상의 메타데이터 필드(예: 제목, 볼륨, 호, ISSN, 초항, 초항 페이지)를 기반으로 엄격한 매칭 기준을 적용하여 웹 오브 사이언스와 스푸스에 모두 존재하는 6,032,000건의 출판물로 구성된 데이터셋을 구축하였다.
  • 매칭된 출판물 세트 전반에 걸쳐 세 가지 저자 식별자—ResearcherID, ORCID, Scopus 저자 식별자—의 존재 여부를 맵핑하고 분석하였다.
  • 프라이저 칼라흐의 중복 검출 인fra를 활용하여 두 데이터베이스의 메타데이터를 표준화하고 정렬하였다.
  • 고정밀도의 출판물 쌍 매칭을 확보하기 위해 최소 317점의 가중치 기반 매칭 전략을 적용하였다.
  • WoS 분류 체계를 활용해 주제 분야 분석을 수행하여 다양한 학문 분야 간 식별자 보급률을 비교하였다.
  • 각 식별자 시스템 내 출판물 수 기준 상위 저자들을 분석하여 자동 할당 과정에서의 잠재적 편향을 탐지하였다.

실험 결과

연구 질문

  • RQ1ResearcherID, ORCID, Scopus 저자 식별자의 커버리지 비율이 웹 오브 사이언스와 스푸스에서 어떻게 비교되는가?
  • RQ2어느 과학 주제 분야에서 연구자 식별자의 커버리지가 가장 높고, 가장 낮은가?
  • RQ3이름 번역 문제로 인한 편향이 스푸스에서 자동으로 할당된 저자 식별자의 정확도에 어느 정도 영향을 미치는가?
  • RQ4ResearcherID와 ORCID의 수동 등록 방식이 스푸스의 자동화된 시스템과 비교할 때 신뢰성과 완전성 측면에서 어떻게 다를까?
  • RQ5식별자 커버리지 격차가 문헌정보학적 분석과 저자 정규화에 어떤 영향을 미치는가?

주요 결과

  • STM(과학, 기술, 의학) 분야가 웹 오브 사이언스 주제 분야 중에서 연구자 식별자 커버리지가 가장 높았다.
  • ResearcherID는 식별자가 할당된 출판물의 70.5%에 할당되었고, ORCID는 29.5%에 그쳤다. 이는 수동 등록 시스템의 보급이 더 높다는 것을 시사한다.
  • Scopus 저자 식별자는 100건 이상의 출판물이 있는 8,219명의 저자에게 할당되었지만, 상위 10명의 가장 저명한 저자들은 모두 아시아 이름이었고, 일반적인 서양식 표기로 번역된 경우였다. 이는 체계적인 편향이 있음을 시사한다.
  • 상위 10개 Scopus 저자 식별자는 모두 아시아 이름(예: 위 왕, 양 왕)이었으며, 이는 번역 패턴이 특정 이름 형식을 선호하고 정규화 정확도를 저하시킨다는 것을 의미한다.
  • 각 식별자 시스템의 상위 10명의 저자들이 소속된 기관의 평균 수는 스푸스에서 가장 높았으며(151.4개), 이는 잠재적 오할당에도 불구하고 더 넓은 기관 소속 연결망을 형성하고 있음을 나타낸다.
  • ORCID는 개방형, API 통합형, 비독점적 설계를 지녔음에도 불구하고, 연구 당시 ResearcherID에 비해 보급률이 낮았지만, 사용자 기반은 지속적으로 증가하고 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.