[논문 리뷰] Data objects and documenting scientific processes: An analysis of data events in biodiversity data papers
이 연구는 GBIF에서 확보한 82편의 생물다양성 데이터 논문에서 데이터 이벤트를 분석하여 과학적 과정과 데이터 변환 과정이 어떻게 문서화되어 있는지 조사한다. 데이터 이벤트 유형 17종을 규명하고, 한 문장 내에서 여러 이벤트가 동시에 발생하는 빈도를 확인하며, 데이터 논문이 독립된 학술 장르로 간주되는 것에 도전하며, 과학 워크플로우 내에서 개선된 데이터 공개 관행의 필요성을 강조한다.
The data paper, an emerging scholarly genre, describes research datasets and is intended to bridge the gap between the publication of research data and scientific articles. Research examining how data papers report data events, such as data transactions and manipulations, is limited. The research reported on in this paper addresses this limitation and investigated how data events are inscribed in data papers. A content analysis was conducted examining the full texts of 82 data papers, drawn from the curated list of data papers connected to the Global Biodiversity Information Facility (GBIF). Data events recorded for each paper were organized into a set of 17 categories. Many of these categories are described together in the same sentence, which indicates the messiness of data events in the laboratory space. The findings challenge the degrees to which data papers are a distinct genre compared to research papers and they describe data-centric research processes in a through way. This paper also discusses how our results could inform a better data publication ecosystem in the future.
연구 동기 및 목표
- 데이터 수집, 변환, 공유와 같은 데이터 이벤트가 데이터 논문에서 어떻게 묘사되는지 조사하기 위해.
- 기존 연구 논문과 비교해 데이터 논문이 얼마나 독립된 학술 장르로 功能하는지 평가하기 위해.
- 특히 데이터 중심 워크플로우의 문서화를 포함한 과학적 과정의 표현 방식을 이해하기 위해.
- 데이터 이벤트의 기록 방식, 즉 빈도와 동시 발생 패턴을 포함한 패턴을 규명하기 위해.
- 생물다양성 연구 분야에서 더 강력하고 표준화된 데이터 공개 생태계의 발전을 뒷받침하기 위해.
제안 방법
- 글로벌 생물다양성정보시설(GBIF)에서 확보한 82편의 데이터 논문 전문을 대상으로 내용 분석을 수행하였다.
- 논문에 기재된 데이터 이벤트를 분류하기 위해 17개의 구분된 카테고리로 구성된 코딩 프레임워크를 개발하였다.
- 사전 정의된 카테고리에 기반해 각 논문의 전문에 걸쳐 데이터 이벤트를 체계적으로 코딩하였다.
- 개별 문장 내에서 데이터 이벤트 카테고리 간 동시 발생 패턴을 분석하여 텍스트의 복잡성 수준을 평가하였다.
- 정성적 및 정량적 분석을 통해 데이터 이벤트 기술의 구조와 표현 방식을 평가하였다.
- 결과의 의미를 데이터 공개 기준 및 생물다양성 과학 분야의 학술 커뮤니케이션에 미치는 영향을 평가하였다.
실험 결과
연구 질문
- RQ1생물다양성 데이터 논문에서 데이터 수집, 처리, 공유와 같은 데이터 이벤트는 어떻게 표현되는가?
- RQ2데이터 논문에서 한 문장 내에 복잡한 다단계 데이터 과정이 얼마나 자주 문서화되는가?
- RQ3구조적 및 세분화 수준 측면에서 데이터 논문의 데이터 이벤트 기술 방식이 전통적 연구 논문과 비교해 어떻게 다른가?
- RQ4개별 문장 내에서 여러 종류의 데이터 이벤트가 동시에 발생하는 패턴은 어떤가?
- RQ5데이터 논문이 기존 연구 논문과 구별되는 독립된 학술 장르로 얼마나 기능하는가?
주요 결과
- 82편의 데이터 논문 분석에서 총 17개의 구분된 데이터 이벤트 카테고리가 규명되었다.
- 많은 데이터 이벤트 카테고리들이 동일한 문장 내에서 함께 묘사되어 있어 문서화의 높은 텍스트 복잡성과 잠재적 모호성을 시사한다.
- 한 문장 내에서 여러 데이터 이벤트가 동시에 발생하는 것은 생물다양성 연구에서 데이터 과정이 빽빽하고 비구조적인 방식으로 기록되고 있음을 시사한다.
- 연구 결과는 데이터 논문이 명확하게 구분된 장르로 간주되는 것에 대한 전제를 도전하며, 그 문서화 방식이 전통적 연구 논문과 유사함을 보여준다.
- 데이터 이벤트의 보고 방식에 상당한 변동성이 있으며, 데이터 워크플로우를 문서화하는 표준화된 접근 방식이 없음을 규명하였다.
- 현재의 데이터 논문 관행이 재현 가능성과 추적 가능성에 악영향을 줄 수 있으며, 데이터 공개에서 더 나은 문서화 기준이 필요함을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.