Skip to main content
QUICK REVIEW

[논문 리뷰] Data-Centric Artificial Intelligence

Johannes Jakubik, Michael Vössing|arXiv (Cornell University)|2022. 12. 22.
Big Data and Business Intelligence인용 수 14
한 줄 요약

이 논문은 모델 중심 AI와 보완적인 패러다임으로 데이터 중심 인공지능(AI)을 제안하며, 데이터 품질과 양을 향상시키기 위한 체계적 데이터 엔지니어링을 강조하여 AI 모델 성능을 햖थ기한다. 데이터 중심 AI를 위한 프레임워크를 제안하고, 비즈니스 및 정보 시스템 공학(BISE) 분야에 미치는 영향을 제시하며, 데이터 워크, 거버넌스, 다기관 협업 분야의 핵심 연구 격차를 규명한다.

ABSTRACT

Data-centric artificial intelligence (data-centric AI) represents an emerging paradigm emphasizing that the systematic design and engineering of data is essential for building effective and efficient AI-based systems. The objective of this article is to introduce practitioners and researchers from the field of Information Systems (IS) to data-centric AI. We define relevant terms, provide key characteristics to contrast the data-centric paradigm to the model-centric one, and introduce a framework for data-centric AI. We distinguish data-centric AI from related concepts and discuss its longer-term implications for the IS community.

연구 동기 및 목표

  • 실제 AI 시스템 개발에서 모델 중심 AI와 보완적이고 필수적인 패러다임으로 데이터 중심 AI를 위치짓는 것.
  • 데이터 중심 AI를 모델 중심 AI와 대비하여 정의하고, 데이터 품질, 데이터 워크, 도메인 지식에 중점을 두어 강조하는 것.
  • 데이터 품질, 데이터 워크, 지속적 개선과 같은 차원을 포함한 종합적인 데이터 중심 AI 프레임워크를 소개하는 것.
  • BISE 공동체가 해결할 수 있는 데이터 거버넌스, 데이터 공유, 다기관 협업 분야의 핵심 연구 격차를 규명하는 것.
  • BISE 연구자들이 AI 개발을 위한 체계적 데이터 관리, 표준화, 도구 개발을 촉진할 수 있도록 안내하는 것.

제안 방법

  • 데이터 품질, 데이터 워크, 데이터 거버넌스, 지속적 개선과 같은 핵심 차원으로 구성된 데이터 중심 AI에 대한 개념적 프레임워크를 제안한다.
  • 모델을 고정하고 데이터를 최적화하는 패러다임으로 데이터 중심 AI를 정의하며, 성능 향상을 위해 데이터의 양, 관련성, 레이블 품질에 중점을 둔다.
  • 모델 중심 최적화에서 체계적 데이터 엔지니어링으로의 전환을 제안하며, 데이터 셀렉션, 레이블링, 데이터 버전 관리가 포함된다.
  • 도메인 지식과 준자동화 도구가 데이터 워크를 가속화하고 데이터 품질을 향상시키는 데서 중요한 역할을 한다고 강조한다.
  • 특히 동적인 실세계 환경에서 지속적인 데이터 관리와 반복적인 데이터 정제가 필수적임을 강조한다.
  • 데이터 라이선싱, 버전 관리, 인용, 평판 제도를 포함한 표준을 갖춘 다기관 데이터 공유 플랫폼을 제안하여 신뢰와 협업을 가능하게 한다.

실험 결과

연구 질문

  • RQ1데이터 중심 AI는 모델 중심 AI와 비교해 집중점, 데이터 품질 인식, 도메인 지식 활용 측면에서 어떻게 다를까?
  • RQ2실제 AI 개발에서 데이터 중심 AI를 위한 체계적 프레임워크의 핵심 차원과 구성 요소는 무엇인가?
  • RQ3BISE 연구가 해결할 수 있는 데이터 거버넌스, 데이터 공유, 데이터 품질 관리 분야의 핵심 연구 격차는 무엇인가?
  • RQ4데이터를 기밀성 또는 소유권 제약으로 공유할 수 없는 상황에서도 데이터 중심 AI는 어떻게 조직 간에 구현될 수 있는가?
  • RQ5BISE 연구는 데이터 워크 프로세스 표준화와 확장 가능하고 신뢰할 수 있는 데이터 공유 인fra를 제공하는 데 어떤 역할을 할 수 있는가?

주요 결과

  • 데이터 중심 AI는 모델 아키텍처에서 벗어나 데이터 품질과 양에 중점을 두며, 더 나은 데이터로 성능 향상을 달성한다.
  • 이 패러다임은 모델 중심 AI와 본질적으로 보완적이며, 고성능 실세계 AI 시스템을 위해 둘 다 필요하다.
  • 레이블링, 데이터 셀렉션, 품질 평가 등의 데이터 워크는 자주 간과되고 표준화되지 않은 체계적 AI 개발의 핵심 요소이다.
  • 데이터는 동적으로 변화하므로 지속적인 데이터 개선이 필수적이며, 이는 지속적인 데이터 관리와 버전 관리가 수반되어야 한다.
  • 다기관 데이터 공유가 필수적이지만 거버넌스, 신뢰, 기술적 장벽으로 인해 저해되고 있으며, 데이터 라이선싱, 버전 관리, 평판 제도를 포함한 표준 플랫폼이 필요하다.
  • BISE 연구는 데이터 거버넌스 프레임워크, 데이터 공유 표준, 협업 인프라 개발을 이끄는 데 유일무이한 위치를 점하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.