[논문 리뷰] Text data mining and data quality management for research information systems in the context of open data and open science
이 논문은 개방 과학 및 개방 데이터 환경에서 연구 정보 시스템(RIS)의 성능을 향상시키기 위해 텍스트 데이터 마이닝과 데이터 품질 관리 프레임워크를 통합하는 것을 제안한다. 비정형 텍스트에서 NLP 기법을 적용해 실체와 키워드를 추출하고, 의미론적 기술을 활용해 이질적인 데이터 소스를 조율함으로써 메타데이터 품질을 향상시키고, 더 나은 데이터 통합을 가능하게 하며, 과학 기관 및 도서관에서의 검색 및 탐색을 더 효과적으로 지원한다.
In the implementation and use of research information systems (RIS) in scientific institutions, text data mining and semantic technologies are a key technology for the meaningful use of large amounts of data. It is not the collection of data that is difficult, but the further processing and integration of the data in RIS. Data is usually not uniformly formatted and structured, such as texts and tables that cannot be linked. These include various source systems with their different data formats such as project and publication databases, CERIF and RCD data model, etc. Internal and external data sources continue to develop. On the one hand, they must be constantly synchronized and the results of the data links checked. On the other hand, the texts must be processed in natural language and certain information extracted. Using text data mining, the quality of the metadata is analyzed and this identifies the entities and general keywords. So that the user is supported in the search for interesting research information. The information age makes it easier to store huge amounts of data and increase the number of documents on the internet, in institutions' intranets, in newswires and blogs is overwhelming. Search engines should help to specifically open up these sources of information and make them usable for administrative and research purposes. Against this backdrop, the aim of this paper is to provide an overview of text data mining techniques and the management of successful data quality for RIS in the context of open data and open science in scientific institutions and libraries, as well as to provide ideas for their application. In particular, solutions for the RIS will be presented.
연구 동기 및 목표
- 다양한 기관 시스템 간에 이질적이고 비정형적이며 형식이 불완전한 연구 데이터를 통합하는 데 도전하는 문제를 해결한다.
- 텍스트 데이터 마이닝을 통해 비정형 텍스트에서 의미 있는 실체와 키워드를 추출하여 연구 정보 시스템(RIS)의 데이터 품질을 향상시킨다.
- 다양한 데이터 소스 간의 상호운용성과 연구 결과의 가시성을 향상시켜 개방 과학 및 개방 데이터 이니셔티브를 지원한다.
- 프로젝트 및 출판 데이터베이스를 포함한 내부 및 외부 데이터 소스를 동기화하고 검증하기 위한 실용적 해결책을 제공한다.
- 자연어 텍스트에서 추출한 의미론적 정보로 메타데이터를 강화함으로써 사용자 검색 기능을 향상시킨다.
제안 방법
- 연구 문서의 비정형 텍스트에서 실체(예: 연구자, 기관, 프로젝트)와 키워드를 추출하기 위해 자연어 처리(NLP) 기법을 적용한다.
- CERIF, RCD 및 기관 데이터베이스와 같은 이질적인 소스에서의 데이터를 통합된 데이터 모델에 매핑하고 정렬하기 위해 의미론적 기술을 사용한다.
- 추출된 메타데이터에 대한 데이터 품질 검사를 구현하여 시스템 간 일관성, 완전성 및 정확성을 확보한다.
- 텍스트 마이닝 파이프라인을 RIS에 통합하여 새로운 출판물과 프로젝트 보고서의 메타데이터를 지속적으로 처리하고 강화한다.
- 표준화된 데이터 모델과 온톨로지를 활용해 기관 정보 시스템 간 상호운용성을 확보하고 데이터 중복을 줄인다.
- 내부 및 외부 데이터 소스 간의 동기화 메커니즘을 구축하여 최신 상태이자 일관된 메타데이터 기록을 유지한다.
실험 결과
연구 질문
- RQ1연구 출판물과 프로젝트 보고서의 비정형 텍스트를 어떻게 효과적으로 처리하여 고품질의 실천 가능한 메타데이터를 추출할 수 있는가?
- RQ2다양한 데이터 소스를 단일 연구 정보 시스템에 통합할 때 데이터 품질과 일관성을 확보할 수 있는 기법은 무엇인가?
- RQ3텍스트 데이터 마이닝은 개방 과학 및 개방 데이터 환경에서 연구 결과의 탐색 및 연결을 어떻게 지원할 수 있는가?
- RQ4의미론적 기술은 CERIF 및 RCD와 같은 다양한 RIS 데이터 모델 간의 데이터 조율에 어떤 역할을 하는가?
- RQ5동적인 연구 정보 시스템에서 내부 및 외부 데이터 소스의 지속적인 동기화와 검증은 어떻게 달성할 수 있는가?
주요 결과
- 텍스트 마이닝은 비정형 텍스트에서 실체와 키워드를 추출함으로써 메타데이터 품질을 크게 향상시켜 더 나은 인덱싱과 검색 기능을 가능하게 한다.
- 의미론적 기술은 프로젝트 및 출판 데이터베이스를 포함한 다양한 소스의 데이터를 공통의 데이터 모델에 맞추어 통합함으로써 효과적인 통합을 가능하게 한다.
- 제안된 프레임워크는 내부 및 외부 데이터 소스 간의 동기화를 지원하여 데이터 불일치와 중복을 감소시킨다.
- NLP 기법의 활용은 자연어 텍스트에서 추출한 의미론적 정보로 메타데이터를 강화함으로써 연구 정보의 가시성을 향상시킨다.
- 이 방법론은 특히 개방 과학을 지원하고자 하는 과학 기관 및 도서관에서의 실제 RIS 구현 사례에서 실용적인 적용 가능성을 입증한다.
- 데이터 품질 관리와 텍스트 마이닝의 통합은 더 신뢰할 수 있고 재사용 가능한 연구 정보 시스템을 만들어낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.