[논문 리뷰] Towards a semantic approach in GLAM Labs: the case of the Data Foundry at the National Library of Scotland
이 논문은 국립도서관 스코틀랜드(National Library of Scotland, NLS)의 데이터 팔공(Data Foundry)에서 제공하는 세 개의 데이터셋을 대상으로, Semantic Web 기준을 사용하여 GLAM(Galleries, Libraries, Archives, and Museums) 메타데이터 데이터셋을 연결형 개방형 데이터(Linked Open Data, LOD)로 변환하는 프레임워크를 제시한다. 이 방법은 기계로 읽을 수 있고 상호운용성이 보장된 데이터 공개를 가능하게 하며, 재사용을 위한 공개된 Jupyter Notebooks와 결과물이 제공된다. 이는 디지털 인문학과 데이터 과학 분야에서 활용 가능하다.
GLAM organisations have been exploring the benefits of publishing their digital collections in a wide variety of forms since the 2000s. Many institutions, and in particular libraries, have adopted the Semantic Web and Linked Data principles to their main catalogues. Recent advances in technology and innovative approaches concerning the reuse of the digital collections by means of computational access have paved the way for the creation of Labs within GLAM organisations. In this work, we present a framework to transform the datasets made available by GLAM organisations under open licenses into LOD. The framework has been applied to three metadata datasets made available by the Data Foundry at the National Library of Scotland. The results of this work are publicly available and can be applied to other domains such as digital humanities and data science.
연구 동기 및 목표
- Semantic publishing을 통해 GLAM 디지털 컬렉션의 계산기반 접근성과 상호운용성을 높이기 위한 과제를 해결한다.
- MARC 및 CSV와 같은 전통적 형식의 한계를 극복하기 위해, 이를 기계로 읽을 수 있고 표준화된 LOD로 변환한다.
- GLAM 기관이 자체 데이터셋을 LOD로 공개하기 위한 재사용 가능하고 최선의 실천 방법을 제공한다.
- 국립도서관 스코틀랜드의 실제 데이터셋을 활용해 의미론적 강화의 실현 가능성과 이점을 입증한다.
- 연결형 개방형 데이터 클라우드와 위키데이터 생태계와의 정렬을 통해 국제적 협업을 지원한다.
제안 방법
- 기존 메타데이터(MARC, 더블리엄 코어 등)를 표준 어휘와 URI를 사용해 RDF로 매핑하는 변환 파이프라인을 설계한다.
- 데이터셋 기술 및 상호링크를 위해 W3C 연결형 데이터 가이드라인과 VoID 어휘의 최선의 실천 방법을 적용한다.
- 재현 가능성을 확보하기 위해 변환 과정을 구현하고 문서화하기 위해 Jupyter Notebooks를 활용한다.
- RDF/JS와 XPath 기반 매핑을 사용해 구조화된 데이터(XML 등)를 RDF 트리플로 변환한다.
- 위키데이터, DBPedia 등 외부 지식 소스를 통합하여 실체를 강화하고 데이터 품질을 향상시킨다.
- 자동화된 검증 절차와 기존 LOD 원칙에의 부합을 통해 데이터 품질을 점검한다.

실험 결과
연구 질문
- RQ1기존의 GLAM 메타데이터 형식(MARC, CSV 등)을 체계적으로 기계로 읽을 수 있고 의미론적으로 풍부한 연결형 개방형 데이터로 변환하는 방법은 무엇인가?
- RQ2이질적인 GLAM 데이터셋에서 신뢰성 있고 재현 가능하며 확장 가능한 LOD 공개를 가능하게 하는 기술적·방법론적 프레임워크는 무엇인가?
- RQ3의미론적 강화가 디지털 인문학 및 데이터 과학 응용 분야에서 데이터의 상호운용성과 재사용 가능성에 얼마나 기여하는가?
- RQ4기관의 GLAM 데이터 공개 워크플로우에 LOD 표준을 도입함에 있어 실질적인 과제와 이점은 무엇인가?
- RQ5결과로 생성된 LOD 데이터셋은 어떻게 효과적으로 문서화하고 공개하며, 연결형 개방형 데이터 클라우드와 같은 글로벌 지식 그래프에 통합할 수 있는가?
주요 결과
- 프레임워크는 국립도서관 스코틀랜드의 데이터 팔공에서 제공하는 세 개의 메타데이터 데이터셋을 구조화되고 기계로 읽을 수 있는 RDF 형식으로 성공적으로 변환하였다.
- 결과로 생성된 LOD 데이터셋은 공개되어 있으며, 위키데이터와 DBPedia와 같은 외부 지식베이스와 상호링크되어 있어 맥락적 풍부성이 향상되었다.
- Jupyter Notebooks의 사용으로 변환 과정의 전면적인 재현 가능성이 확보되어, 다른 기관이 투명성과 재사용을 위해 활용할 수 있었다.
- 기존의 MARC나 CSV 형식 대비 데이터의 표현력과 기계 처리 가능성에서 뚜렷한 향상이 확인되었다.
- 변환 파이프라인은 적절한 URI 설계와 VoID 메타데이터 기술을 포함한 W3C LOD 공개 최선의 실천 방법을 준수하였다.
- 의미론적 공개가 GLAM 기관이 디지털 컬렉션의 영향력과 재사용 가능성을 높이기 위해 실현 가능하고 유익한 방법임을 본 연구는 확인하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.