Skip to main content
QUICK REVIEW

[논문 리뷰] PMLB v1.0: An open source dataset collection for benchmarking machine learning methods

Joseph D. Romano, Trang T. Le|arXiv (Cornell University)|2020. 11. 30.
Explainable Artificial Intelligence (XAI)인용 수 4
한 줄 요약

PMLB v1.0은 기계학습 방법 평가를 간편화하기 위해 설계된 다양한 공개 기반 벤치마크 데이터셋을 통합한 오픈소스이며 중심화된 저장소입니다. Python 및 R 인터페이스를 통해 표준화되고 프로그래밍 가능한 방식으로 액세스할 수 있으며, 다양한 데이터 과학 워크플로우에서 빠른 벤치마킹을 가능하게 하며 이전 버전 대비 사용성 향상과 커뮤니티 기반 개선 사항을 제공합니다.

ABSTRACT

Motivation: Novel machine learning and statistical modeling studies rely on standardized comparisons to existing methods using well-studied benchmark datasets. Few tools exist that provide rapid access to many of these datasets through a standardized, user-friendly interface that integrates well with popular data science workflows. Results: This release of PMLB provides the largest collection of diverse, public benchmark datasets for evaluating new machine learning and data science methods aggregated in one location. v1.0 introduces a number of critical improvements developed following discussions with the open-source community. Availability: PMLB is available at https://github.com/EpistasisLab/pmlb. Python and R interfaces for PMLB can be installed through the Python Package Index and Comprehensive R Archive Network, respectively.

연구 동기 및 목표

  • 새로운 기계학습 방법을 평가하기 위한 표준화되고 쉽게 접근 가능한 벤치마크 데이터셋의 부족을 해결하기 위해.
  • Python 및 R에서 널리 사용되는 데이터 과학 워크플로우와 원활하게 통합되는 중심화된 사용자 友好的 인터페이스를 제공하기 위해.
  • 커뮤니티 기반 개선 사항과 버전 관리된 릴리스를 통해 벤치마크 데이터셋의 접근성과 사용성 향상하기 위해.
  • 다양한 분야에서 잘 연구된 데이터셋을 총망라한 컬렉션을 제공함으로써 재현 가능한 연구를 지원하기 위해.

제안 방법

  • 다양한 출처에서 확보한 공개 가능 데이터셋을 하나의 표준화된 저장소로 통합하기 위해.
  • Python 및 R 패키지를 활용한 일관된 프로그래밍 가능한 인터페이스를 구현하기 위해.
  • 재현성과 사용성 확보를 위해 메타데이터, 데이터 기원, 전처리 노트를 통합하기 위해.
  • 데이터셋 컬렉션의 버전 관리(v1.0)를 통해 벤치마킹 실험 간 안정성과 재현성 확보하기 위해.
  • 기능 개발 및 데이터셋 총괄을 이끄는 데 커뮤니티 피드백과 오픈소스 라이센스를 도입하기 위해.
  • 데이터 과학 파이프라인에 쉽게 설치 및 배포할 수 있도록 패키지 매니저(PyPI 및 CRAN)와 통합하기 위해.

실험 결과

연구 질문

  • RQ1중앙집중화된 표준화된 데이터셋 컬렉션은 기계학습 벤치마킹의 재현성과 효율성에 어떻게 기여할 수 있는가?
  • RQ2기존의 벤치마크 데이터셋 저장소에서 발생하는 주요 사용성 및 통합 과제는 무엇이며, 이를 어떻게 해결할 수 있는가?
  • RQ3커뮤니티 피드백은 오픈소스 벤치마크 데이터셋의 설계 및 유용성에 얼마나 기여할 수 있는가?
  • RQ4Python 및 R을 위한 통합 인터페이스는 기계학습 연구에서 상호운용성과 보급에 어떻게 기여하는가?

주요 결과

  • PMLB v1.0은 단일 표준화된 저장소에 가장 큰 공개 가능한 다양한 벤치마크 데이터셋 컬렉션을 제공합니다.
  • 공식 패키지 매니저(PyPI 및 CRAN)를 통해 Python 및 R 모두에서 액세스 가능하여 광범위한 보급을 가능하게 합니다.
  • 커뮤니티 피드백에 기반한 핵심 사용성 개선 사항이 포함되어 있어 신뢰성 향상과 데이터 과학 워크플로우 통합이 향상되었습니다.
  • 메타데이터, 기원 정보, 일관된 전처리 절차를 포함함으로써 재현 가능한 벤치마킹을 지원합니다.
  • DOI를 부여받아 영구적인 액세스와 학술적 인용 가능성을 확보한 오픈소스 이니셔티브로 운영되고 있습니다.
  • 안정적인 v1.0 릴리스 제공으로 연구 간 일관된 벤치마킹이 가능해졌으며, 기계학습 연구에서의 방법 비교를 촉진합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.