[논문 리뷰] Evaluation of the citation matching algorithms of CWTS and iFQ in comparison to Web of Science
이 연구는 수동으로 확인된 코퍼스를 사용하여 Web of Science(WoS) 대비 CWTS 및 iFQ의 인용 매칭 알고리즘을 평가하며, 각 시스템이 인용 참고문헌의 부정확성을 얼마나 효과적으로 수정하는지 평가한다. CWTS의 알고리즘이 가장 뛰어나며(F1: 96.41%), 이어 iFQ가 뒤따르지만, WoS는 참고문헌에 오류가 있을 경우 뚜렷한 결함을 보이며, 이는 문헌정보학적 연구에서 견고한 매칭의 중요성을 강조한다.
The results of bibliometric studies provided by bibliometric research groups, e.g. the Centre for Science and Technology Studies (CWTS) and the Institute for Research Information and Quality Assurance (iFQ), are often used in the process of research assessment. Their databases use Web of Science (WoS) citation data, which they match according to their own matching algorithms - in the case of CWTS for standard usage in their studies and in the case of iFQ on an experimental basis. Since the problem of non-matched citations in WoS persists because of inaccuracies in the references or inaccuracies introduced in the data extraction process, it is important to ascertain how well these inaccuracies are rectified in these citation matching algorithms. This paper evaluates the algorithms of CWTS and iFQ in comparison to WoS in a quantitative and a qualitative analysis. The analysis builds upon the methodology and the manually verified corpus of a previous study. The algorithm of CWTS performs best, closely followed by that of iFQ. The WoS algorithm still performs quite well (F1 score: 96.41 percent), but shows deficits in matching references containing inaccuracies. An additional problem is posed by incorrectly provided cited reference information in source articles by WoS.
연구 동기 및 목표
- Web of Science(WoS)의 인용 참고문헌에 존재하는 오류를 수정하는 데 사용되는 CWTS 및 iFQ의 인용 매칭 알고리즘 성능을 평가하기 위해.
- 원본 참고문헌에 오류가 포함되어 있을 경우 Web of Science의 자체 인용 매칭 프로세스에 존재하는 체계적 약점을 규명하기 위해.
- 수동으로 확인된 참고문헌 코퍼스를 사용하여, 정밀도, 재현율 및 F1 점수 측면에서 CWTS 및 iFQ 알고리즘이 WoS보다 얼마나 효과적인지 비교하기 위해.
- 각 시스템이 데이터 추출 또는 참고문헌 입력 과정에서 발생한 실제 세계의 인용 오류를 얼마나 잘 처리하는지 평가하기 위해.
- 연구 평가 맥락에서 이러한 시스템에서 유도된 문헌정보학적 데이터의 신뢰성에 대한 실증적 증거를 제공하기 위해.
제안 방법
- 평가의 기준이 되는 참값으로 사용하기 위해 이전 연구에서 확보한 수동으로 확인된 인용 쌍 코퍼스를 활용하였다.
- 동일한 참고문헌 세트에 대해 CWTS, iFQ 및 Web of Science의 인용 매칭 알고리즘을 적용하여 매칭 결과를 비교하였다.
- 각 시스템의 성능에 대해 표준 정보 검색 지표인 정밀도, 재현율 및 F1 점수를 계산하였다.
- F1 점수를 사용한 정량적 분석과 함께, 매칭 오류 및 패턴에 대한 정성적 평가를 수행하였다.
- 특히 저자, 제목, DOI 등 누락되거나 잘못된 경우가 있는 인용 참고문헌을 포함한 케이스에 집중하여 오류 수정 능력을 평가하였다.
- 결과의 일관성과 비교 가능성을 확보하기 위해 이전 연구와 동일한 평가 프레임워크를 사용하였다.
실험 결과
연구 질문
- RQ1수동으로 확인된 인용 코퍼스에서 CWTS 및 iFQ의 인용 매칭 알고리즘이 Web of Science 대비 F1 점수 측면에서 어떻게 비교되는가?
- RQ2CWTS 및 iFQ는 Web of Science의 참고문헌 데이터에 존재하는 인용 오류를 어느 정도 수정할 수 있는가?
- RQ3각 시스템의 알고리즘이 가장 자주 잘못 분류되거나 누락되는 인용 오류 유형은 무엇인가?
- RQ4Web of Science의 자체 매칭 알고리즘이 오류가 있거나 불완전한 인용 참고문헌 정보를 마주했을 때 신뢰성 있게 작동하는가?
- RQ5CWTS 및 iFQ는 복잡하거나 모호한 인용 형식을 처리하는 데 있어 성능 특성에서 어떻게 다름을 보이는가?
주요 결과
- CWTS 인용 매칭 알고리즘이 가장 높은 F1 점수 96.41%를 기록하여 iFQ 및 WoS를 모두 앞섰다.
- iFQ 알고리즘이 CWTS에 매우 가까운 성능을 보이며, 인용 오류 수정 능력이 뛰어나다는 것을 확인하였다.
- Web of Science의 자체 알고리즘은 높은 F1 점수 96.41%를 기록했지만, 인용 참고문헌에 오류가 있을 경우 뚜렷한 결함을 보였다.
- Web of Science의 핵심적 한계는 원본 논문에서 유래한 오류나 데이터 추출 과정에서 발생한 오류를 효과적으로 수정하지 못한다는 점이었다.
- 이 연구는 인용 매칭 알고리즘이 특히 원천 데이터에 오류가 있을 경우 문헌정보학적 정확성에 매우 중요하다는 점을 확인하였다.
- 결과는 연구 평가 맥락에서 오류가 있는 인용 데이터를 다루는 데 있어 CWTS 및 iFQ가 Web of Science보다 더 견고한 솔루션을 제공한다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.