Skip to main content
QUICK REVIEW

[논문 리뷰] "Seed+Expand": A validated methodology for creating high quality publication oeuvres of individual researchers

Linda Reijnhoudt, Rodrigo Costas|arXiv (Cornell University)|2013. 01. 22.
Data Quality and Management참고 문헌 16인용 수 8
한 줄 요약

이 논문은 네덜란드의 국립연구정보체계(NARCIS)와 논문 데이터베이스(웹오브사이언스)의 데이터를 조합하여 개인 연구자의 고품질로 해석이 가능한 논문 목록(oeuvres)을 구성하기 위한 'Seed+Expand' 방법론을 제안하고 검증한다. 다섯 가지 시드 식별 전략과 세 가지 확장 기법을 사용하여, 네덜란드 정교수 1980–2011년 기준 황금 표준 데이터셋과 비교할 때 최대 정밀도(98.5%)와 재현율(95.6%)을 달성한다.

ABSTRACT

The study of science at the individual micro-level frequently requires the disambiguation of author names. The creation of author's publication oeuvres involves matching the list of unique author names to names used in publication databases. Despite recent progress in the development of unique author identifiers, e.g., ORCID, VIVO, or DAI, author disambiguation remains a key problem when it comes to large-scale bibliometric analysis using data from multiple databases. This study introduces and validates a new methodology called seed+expand for semi-automatic bibliographic data collection for a given set of individual authors. Specifically, we identify the oeuvre of a set of Dutch full professors during the period 1980-2011. In particular, we combine author records from the National Research Information System (NARCIS) with publication records from the Web of Science. Starting with an initial list of 8,378 names, we identify "seed publications" for each author using five different approaches. Subsequently, we "expand" the set of publication in three different approaches. The different approaches are compared and resulting oeuvres are evaluated on precision and recall using a "gold standard" dataset of authors for which verified publications in the period 2001-2010 are available.

연구 동기 및 목표

  • 다양한 출처의 데이터 통합 시 발생하는 저자 이름의 해석 불확실성 문제를 해결하는 데 초점을 맞춘 지속적인 도전 과제를 다루기.
  • 연구자 개인의 완전하고 정확한 논문 기록(oeuvres)을 구성하기 위한 확장 가능하고 반자동화된 방법론을 개발하기.
  • 네덜란드 정교수 2001–2010년 기준 확인된 논문 데이터셋을 기반으로 한 황금 표준 데이터를 활용해 방법론을 검증하기.
  • 정밀도와 재현율을 고려할 때 최적의 조합을 도출하기 위해 다양한 시드 식별 및 확장 전략을 비교하기.
  • 기관 및 대규모 문헌학적 분석 연구에서 연구자 성과 평가에 활용 가능한 재현 가능한 프레임워크 제공하기.

제안 방법

  • 네덜란드의 국립연구정보체계(NARCIS)에서 8,378명의 고유한 저자 이름을 수집한다.
  • 다섯 가지 별도의 접근 방식을 사용해 각 저자에 대한 '시드 논문'을 식별한다: 이름 기반 매칭, 소속 기반 매칭, 논문 제목 기반 매칭, 공동저자 기반 매칭, ORCID 기반 매칭.
  • 추가 논문을 확보하기 위해 세 가지 '확장' 전략을 적용한다: 공동저자 기반 반복 확장, 공통 소속 기반 확장, 논문 제목 및 저널 메타데이터 기반 확장.
  • 수집된 논문 기록의 풍부화 및 검증을 위해 웹오브사이언스 데이터베이스의 데이터를 통합한다.
  • 모든 방법론적 변형의 정밀도와 재현율을 평가하기 위해 100명의 네덜란드 정교수(2001–2010)에 대한 황금 표준 데이터셋을 활용한다.
  • 다양한 시드 및 확장 조합의 성능을 비교하기 위해 통계적 평가를 수행하고 최적의 구성 요소를 선별한다.

실험 결과

연구 질문

  • RQ1개별 연구자의 초기 논문 검색에서 가장 높은 정밀도와 재현율을 달성하는 시드 식별 전략은 무엇인가요?
  • RQ2가짜 양성(false positive)을 최소화하면서 연구자의 논문 목록을 가장 효과적으로 확장하는 전략은 무엇인가요?
  • RQ3다양한 시드 및 확장 전략 조합의 병합 성능는 완전하고 정확한 논문 기록을 구성하는 데 어떻게 작용합니까?
  • RQ4실제 기관 환경에서 기존의 해석 불확실성 해결 기법과 비교해 'Seed+Expand' 방법론의 성능은 어떠한가요?
  • RQ5이 방법론은 다양한 학문 분야와 시간대에 걸쳐 일반화될 수 있는가요?

주요 결과

  • 황금 표준 데이터셋과 비교할 때 '시드+확장' 방법론은 최대 정밀도 98.5%와 최대 재현율 95.6%를 달성했다.
  • ORCID 기반 시드 식별 방식이 다른 방법보다 뛰어나 최고의 정밀도(96.7%)와 높은 재현율(92.4%)을 기록했다.
  • 공동저자 기반 확장 전략은 가장 높은 재현율(95.6%)을 기록했지만, 소속 기반 확장 전략보다 약간 낮은 정밀도(93.2%)를 보였다.
  • ORCID 기반 시드 식별과 공동저자 기반 확장 전략의 조합이 정밀도와 재현율을 균형 있게 확보하며 가장 우수한 종합 성능을 보였다.
  • 특히 이름의 해석 불확실성이 높은 경우에, 단순한 이름 매칭 방식에 비해 가짜 양성과 가짜 음성의 수를 크게 줄였다.
  • 검증 과정을 통해 이 방법론이 기관 차원에서 연구자 논문 목록을 구축하는 데 있어 견고하고 확장 가능한 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.