[논문 리뷰] Searching Data: A Review of Observational Data Retrieval Practices
이 논문은 146건의 참고문헌에 대한 체계적 문헌 고찰을 통해 관측 데이터 확보 관행을 검토하며, 연구자들의 행동 양태, 정보 필요성, 그리고 연구 데이터 검색 및 재사용 과정에서의 과제를 규명한다. 연구는 데이터 탐색 워크플로우의 핵심 패턴을 드러내며, 현재의 데이터 검색 시스템에 존재하는 격차를 분석하고 과학 연구 분야에서 맥락 인식형, 사용자 중심의 데이터 검색 도구 개선을 제안한다.
<p>This study employed an extensive literature review to identify commonalities in the data retrieval practices of users of observational data. This dataset consists of a BibTeX file with the 146 bibliographic references examined in:<br><br>Gregory, K., Groth, P., Cousijn, H., Scharnhorst, A., & Wyatt, S. (2017). Searching Data: A Review of Observational Data Retrieval Practices. arxiv:1707.06937. [cs.DL]<br><br>The body of literature in the dataset was retrieved using different combinations of keyword searches, primarily in the Scopus database, across all fields. Keyword searches related to information retrieval (e.g. user behavior, information seeking, information retrieval) and data practices (e.g. research practices, community practices, data sharing, data reuse) were combined with keyword searches for research data. As the terms “data” and “search” are ubiquitous in academic literature, title searches also were employed and combined with the controlled vocabulary of the database to locate relevant information. Searches in Scopus included strings such as:<br><br>KEY ( user AND information ) AND TITLE-ABS-KEY ("research data" OR ( scien* W/1 data ) OR ( data W/1 ( repositor* OR archive* ) ) )<br><br>TITLE ( data W/0 ( search OR retriev* OR discover* OR access* OR sharing OR reus* ) )<br>AND ( LIMIT-TO ( EXACTKEYWORD , "Information Retrieval" ) OR LIMIT-TO ( EXACTKEYWORD , "Data Retrieval" ) OR LIMIT-TO ( EXACTKEYWORD , "Data Reuse" ) )<br><br>Bibliometric techniques such as citation chaining and related records were also applied. Pertinent journals and conference proceedings not indexed within Scopus (e.g. the International Journal of Digital Curation) were searched directly using similar keywords.<br><br>The approximately 400 retrieved documents were examined by close reading to identify articles referring to observational data for inclusion in the final dataset.</p><p>Acknowledgements<br>This work has funded by the NWO Grant 652.001.002 (programme Creative Industrie - Thematisch Onderzoek (CI-TO), Re-SEARCH: Contextual Search for Scientific Research Data)</p>
연구 동기 및 목표
- 연구자들과 데이터 사용자들이 과학 연구에서 관측 데이터를 어떻게 확보하는지 이해하기 위해.
- 다양한 연구 분야에서 데이터 확보 관행의 공통된 패턴과 과제를 규명하기 위해.
- 사용자 행동과 정보 필요성을 분석하여 보다 효과적이고 맥락 인식형 데이터 검색 시스템 설계에 기여하기 위해.
- 데이터 재사용, 공유, 정보 검색에 관한 기존 문헌을 맵핑하여 연구 격차와 기회를 규명하기 위해.
- 사용자 중심의 데이터 탐색 워크플로우에 대한 증거 기반 통찰을 통해 고급 데이터 검색 도구 개발을 지원하기 위해.
제안 방법
- 정보 검색, 데이터 관행, 연구 데이터와 관련된 용어를 조합하여 스푸시어스 데이터베이스에서 关건어 검색을 수행한 체계적 문헌 고찰을 수행하였다.
- 정밀도 향상을 위해 불린 논리, 근접 연산자(W/1), 제목/초록 필드 제약 조건을 활용한 구조화된 검색 문자열을 적용하였다.
- 검색 커버리지를 확장하기 위해 인용 체인 및 관련 기록 분석과 같은 문헌미터릭 기법을 적용하였다.
- 스푸시어스에 포함되지 않은 논문을 확보하기 위해 직접 저널 및 컫퍼런스 프로ceedings 검색(예: IJDC)을 보완 조치를 취하였다.
- 관측 데이터 확보에 중점을 둔 연구를 식별하기 위해 약 400건의 문서를 정밀 독해하여 걸러내었다.
- 데이터 검색 시스템 연구에 활용하기 위한 146건의 참고문헌으로 구성된 정제된 데이터셋을 구축하였다.
실험 결과
연구 질문
- RQ1관측 연구 데이터 확보 과정에서 지배적인 사용자 행동과 정보 필요성은 무엇인가?
- RQ2연구자들은 다양한 과학 분야에서 어떻게 관측 데이터를 탐색하고 접근하며 재사용하는가?
- RQ3관측 데이터를 위한 기존 데이터 검색 시스템의 핵심 과제와 제약 조건은 무엇인가?
- RQ4학술 검색에서 전통적 문서 검색과 비교할 때 데이터 검색 관행은 어떻게 다를까?
- RQ5맥락 인식형, 사용자 중심의 데이터 검색 도구 개발을 위한 설계 원칙은 무엇인가?
주요 결과
- 연구자들은 데이터베이스에서 키워드 기반 검색을 자주 활용하지만, 일관되지 않은 메타데이터와 인덱싱으로 인해 관련 관측 데이터셋을 찾는 데 어려움을 겪는다.
- 학술 문헌에서 'data'라는 용어는 매우 모호하므로, 제목 기반 쿼리 및 제어어휘 매칭과 같은 맥락 특화 검색 전략이 필요하다.
- 많은 비중을 차지하는 데이터 확보 활동은 정확한 쿼리 기반 검색이 아닌 탐색적이고 반복적인 검색 행동에 의해 이끌린다.
- 데이터 재사용은 빈약한 문서화, 영구 식별자 부족, 데이터 레포지터리 내 부족한 맥락 정보로 인해 종종 저해된다.
- 사용자들이 데이터 탐색을 기대하는 바와 현재 존재하는 검색 시스템의 기능 사이에 뚜렷한 격차가 있으며, 특히 복잡하고 맥락 민감한 쿼리를 지원하는 데서 문제가 있다.
- 사용자 행동 데이터를 메타데이터 및 제어어휘와 통합하면 데이터 검색 결과의 정밀도와 관련성은 크게 향상될 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.