[논문 리뷰] Improving the data quality in the research information systems
이 논문은 중복, 누락 값, 포맷 일관성 문제와 같은 일반적인 데이터 문제를 식별하고 해결하여 연구 정보 시스템의 데이터 품질을 향상시키는 프레임워크를 제안한다. 자동화된 데이터 프로파일링 및 정제 기법을 사용함으로써 데이터 정확성과 일관성이 향상되어 보다 신뢰할 수 있는 연구 보고 및 기관의 의사결정을 가능하게 한다.
In order to introduce an integrated research information system, this will provide scientific institutions with the necessary information on research activities and research results in assured quality. Since data collection, duplication, missing values, incorrect formatting, inconsistencies, etc. can arise in the collection of research data in different research information systems, which can have a wide range of negative effects on data quality, the subject of data quality should be treated with better results. This paper examines the data quality problems in research information systems and presents the new techniques that enable organizations to improve their quality of research information.
연구 동기 및 목표
- 기관 보고 및 의사결정을 방해하는 연구 정보 시스템 내 낮은 데이터 품질 문제의 증가하는 도전 과제를 해결하기 위해.
- 중복, 누락 값, 잘못된 포맷, 다양한 연구 데이터 소스 간의 일관성 문제와 같은 일반적인 데이터 품질 문제를 식별하기 위해.
- 연구 정보 시스템 내 데이터 품질 문제를 탐지하고 수정하기 위한 체계적인 접근법을 개발하기 위해.
- 과학 기관이 연구 평가 및 자금 배분을 위해 고도로 신뢰할 수 있는 데이터를 유지할 수 있도록 지원하기 위해.
- 다양한 연구 데이터 소스를 통합하여 단일화되고 신뢰할 수 있는 연구 정보 시스템을 구축하기 위해 지원하기 위해.
제안 방법
- 연구 데이터에서 중복 항목, 누락 값, 일관성 없는 포맷과 같은 이상치를 탐지하기 위해 데이터 프로파일링 기법을 적용하기 위해.
- 사전 정의된 규칙과 검증 논리를 사용하여 식별된 데이터 품질 문제를 수정하기 위해 자동화된 데이터 정제 워크플로우를 구현하기 위해.
- 시스템 수신 및 업데이트 중 지속적인 데이터 무결성을 확보하기 위해 데이터 파이프라인에 데이터 품질 모니터링을 통합하기 위해.
- 메타데이터와 스키마 검증을 사용하여 데이터 포맷을 표준화하고 이질적인 연구 정보 소스 간의 일관성을 향상시키기 위해.
- 연구 정보 시스템에 적합하게 조정된 기존의 데이터 품질 평가 프레임워크를 활용하여 구현 과정을 안내하기 위해.
- 데이터 통합의 여러 단계에서 반복적인 데이터 품질 검사를 적용하여 수정의 신뢰성과 추적 가능성을 보장하기 위해.
실험 결과
연구 질문
- RQ1학술 기관의 연구 정보 시스템에 영향을 주는 주요 데이터 품질 문제는 무엇인가요?
- RQ2자동화된 기법은 연구 데이터에서 중복 및 누락 값과 같은 데이터 품질 문제를 어떻게 탐지하고 해결할 수 있나요?
- RQ3데이터 프로파일링 및 정제가 연구 정보 시스템의 정확성과 일관성에 얼마나 기여할 수 있나요?
- RQ4다양하고 변화하는 연구 데이터 소스 간의 데이터 품질을 유지를 위한 주요 과제는 무엇인가요?
- RQ5데이터 품질 향상은 더 나은 기관 보고 및 연구 평가 과정을 어떻게 지원할 수 있나요?
주요 결과
- 제안된 프레임워크는 자동화된 프로파일링 및 정제를 통해 연구 정보 시스템 내 데이터 중복과 누락 값을 크게 감소시켰다.
- 표준화된 데이터 포맷과 스키마 검증이 이질적인 연구 데이터 소스 간의 데이터 일관성을 향상시켰다.
- 데이터 파이프라인에 지속적인 데이터 품질 모니터링을 구현한 후 기관의 데이터 품질이 향상되었다.
- 프레임워크는 더 정확하고 신뢰할 수 있는 연구 보고를 가능하게 하여 연구 관리의 더 나은 의사결정을 지원한다.
- 이 방법은 최소한의 수동 개입으로 다양한 연구 정보 시스템에 스케일링 가능하고 적응 가능하다.
- 이 연구는 사전적 데이터 품질 관리가 기관 사용을 위한 연구 데이터의 신뢰성 향상에 기여한다는 것을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.