[논문 리뷰] Data Curation APIs
이 논문은 대량의 분석 파이프라인에서의 스케일링과 자동화된 데이터 쿠레이션의 증가하는 수요를 해결하기 위해, 원시의 비구조화된, 반구조화된, 구조화된 데이터를 보다 고도화된 맥락 기반의 데이터로 변환하는 오픈소스 데이터 쿠레이션 API 세트를 소개한다. 엔티티 추출, 동의어 및 어간 생성, 지식 기반 링킹, 유사도 계산, 분류, 인덱싱 등의 자동화된 작업을 통해 API는 수동 쿠레이션 작업을 줄이고 최종 사용자 및 애플리케이션의 데이터 품질을 향상시킨다.
Understanding and analyzing big data is firmly recognized as a powerful and strategic priority. For deeper interpretation of and better intelligence with big data, it is important to transform raw data (unstructured, semi-structured and structured data sources, e.g., text, video, image data sets) into curated data: contextualized data and knowledge that is maintained and made available for use by end-users and applications. In particular, data curation acts as the glue between raw data and analytics, providing an abstraction layer that relieves users from time consuming, tedious and error prone curation tasks. In this context, the data curation process becomes a vital analytics asset for increasing added value and insights. In this paper, we identify and implement a set of curation APIs and make them available (on GitHub) to researchers and developers to assist them transforming their raw data into curated data. The curation APIs enable developers to easily add features - such as extracting keyword, part of speech, and named entities such as Persons, Locations, Organizations, Companies, Products, Diseases, Drugs, etc.; providing synonyms and stems for extracted information items leveraging lexical knowledge bases for the English language such as WordNet; linking extracted entities to external knowledge bases such as Google Knowledge Graph and Wikidata; discovering similarity among the extracted information items, such as calculating similarity between string, number, date and time data; classifying, sorting and categorizing data into various types, forms or any other distinct class; and indexing structured and unstructured data - into their applications.
연구 동기 및 목표
- 빅데이터 분석 파이프라인에서의 확장성 있고 자동화된 데이터 쿠레이션의 증가하는 필요성을 해결하기 위해.
- 복잡한 작업을 재사용 가능한 API로 추상화하여 수동 데이터 쿠레이션의 시간 소모적이고 실수를 유발하는 성격을 줄이기 위해.
- 개발자들이 이름이 지정된 엔티티, 동의어, 외부 지식 기반 링크와 같은 의미론적 메타데이터로 데이터를 풍부화할 수 있도록 표준화된 인터페이스를 제공하기 위해.
- 다양한 데이터 유형의 표준화 및 맥락화를 통해 데이터 품질 향상과 분석 통찰력을 제고하기 위해.
- GitHub에 공개된 모듈화되고 버전 관리되는 API로서의 쿠레이션 기능을 통해 상호 운용성과 확장성을 지원하기 위해.
제안 방법
- 핵심 데이터 쿠레이션 작업을 봉인하는 애플리케이션 프로그래밍 인터페이스(API) 세트를 설계하기 위해.
- 키워드, 품사, 이름이 지정된 엔티티(예: 개인, 조직, 질병)를 추출하기 위해 자연어 처리(NLP) 기법을 구현하기 위해.
- 추출된 용어의 동의어 및 어간 생성을 위해 WordNet과 같은 어휘 지식 기반 자료를 활용하기 위해.
- Wikidata 및 Google 지식 그래프와 같은 외부 지식 기반 자료를 통합하여 추출된 엔티티를 링크하고 풍부화하기 위해.
- 문자열, 숫자, 날짜 및 시간 유형을 포함한 다양한 데이터 유형 간의 유사도를 비교하고 관계를 설정하기 위해 유사도 알고리즘을 적용하기 위해.
- 사전 정의된 또는 동적 유형으로 데이터를 분류, 정렬, 분류하고 효율적인 검색을 위한 인덱싱을 지원하기 위해.
실험 결과
연구 질문
- RQ1데이터 쿠레이션을 어떻게 재사용 가능하고 조합 가능한 API로 추상화하여 분석 파이프라인에 통합을 간소화할 수 있는가?
- RQ2원시 데이터를 의미론적으로 풍부화된 쿠레이션된 데이터로 변환하는 데 가장 효과적인 핵심 작업 세트는 무엇인가?
- RQ3자동화된 쿠레이션은 수동 작업을 얼마나 줄일 수 있으며, 데이터 품질과 일관성 향상에 얼마나 기여하는가?
- RQ4텍스트, 이미지, 영상, 구조화된 데이터와 같은 다양한 데이터 유형을 동일한 API 인터페이스를 통해 통일적으로 처리하고 풍부화할 수 있는가?
- RQ5외부 지식 기반 자료와 어휘 자원은 쿠레이션된 데이터의 의미론적 가치 향상에 어떤 역할을 하는가?
주요 결과
- 제안된 쿠레이션 API는 이름이 지정된 엔티티 인식, 동의어 생성, 외부 지식 링킹과 같은 다수의 데이터 풍부화 작업을 자동화하는 데 성공했다.
- WordNet과의 통합을 통해 동의어 및 어간 추출을 통한 일관된 정규화가 가능해져 데이터의 통일성 향상에 기여했다.
- 추출된 엔티티를 Wikidata 및 Google 지식 그래프에 연결함으로써 의미론적 풍부함이 향상되었고, 지식 그래프 기반 추론이 가능해졌다.
- 날짜, 숫자, 문자열 등 다양한 데이터 유형 간의 유사도 계산은 데이터 중복 제거 및 관계 탐색을 지원한다.
- 분류 및 인덱싱 기능은 구조화된 및 비구조화된 형식의 쿠레이션된 데이터에 대한 확장 가능한 조직 및 검색을 가능하게 한다.
- GitHub에 공개된 오픈소스 성격 덕분에 커뮤니티가 이 API를 채택하고 확장하며 다양한 데이터 분석 애플리케이션에 통합할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.