Skip to main content
QUICK REVIEW

[논문 리뷰] Data-centric AI: Perspectives and Challenges

Daochen Zha, Zaid Pervaiz Bhat|arXiv (Cornell University)|2023. 01. 12.
Data Quality and Management인용 수 5
한 줄 요약

이 논문은 학습 데이터 개발, 추론 데이터 개발, 데이터 유지를 포함하는 세 가지 임무로 핵심 활동을 체계적으로 정리함으로써 데이터 중심 AI(DCAI)를 위한 통합 프레임워크를 제안한다. 데이터 품질, 신뢰성, 생애주기 관리 향상을 위한 체계적 접근을 제안하며, 모델뿐 아니라 데이터 자체가 AI 시스템 발전의 핵심임을 강조하고, 다중 작업 통합, 데이터-모델 공동 설계, 벤치마킹과 같은 주요 열린 과제를 밝혀낸다.

ABSTRACT

The role of data in building AI systems has recently been significantly magnified by the emerging concept of data-centric AI (DCAI), which advocates a fundamental shift from model advancements to ensuring data quality and reliability. Although our community has continuously invested efforts into enhancing data in different aspects, they are often isolated initiatives on specific tasks. To facilitate the collective initiative in our community and push forward DCAI, we draw a big picture and bring together three general missions: training data development, inference data development, and data maintenance. We provide a top-level discussion on representative DCAI tasks and share perspectives. Finally, we list open challenges. More resources are summarized at https://github.com/daochenzha/data-centric-AI

연구 동기 및 목표

  • 모델 중심에서 데이터 중심으로의 접근 전환을 통해 데이터 품질을 모델 성능 향상의 주요 원동력으로 삼는다.
  • 분산된 데이터 개선 노력들을 학습 데이터 개발, 추론 데이터 개발, 데이터 유지를 포함하는 통합된 프레임워크로 통합한다.
  • DCAI 분야의 주요 열린 과제를 규명하고 명시한다. 이는 다중 작업 통합, 데이터-모델 공동 설계, 편향 완화, 벤치마킹을 포함한다.
  • 연구 공동체가 함께 데이터 중심 AI를 발전시킬 수 있도록 상위 수준의 로드맵과 공통된 비전을 제공한다.
  • 실제 AI 시스템에서 지속적인 데이터 품질 보장을 지원하는 체계적 데이터 인프라, 도구, 평가 관행을 적극적으로 홍보한다.

제안 방법

  • DCAI를 위한 세 임무 프레임워크를 제안한다: 학습 데이터 개발(데이터 수집, 레이블링, 준비, 감소, 증강), 추론 데이터 개발(평가 세트 구성, 데이터 품질 분석), 데이터 유지보수(지속적 모니터링, 오류 수정, 버전 관리, 가속화).
  • 각 임무 하위 작업으로 데이터셋 탐색, 주도적 학습, 데이터 프로그래밍, 데이터 정제, 정규화, 쿼리 가속화 등을 제시한다.
  • 특정 도메인 전략과 알고리즘 최적화를 활용한 자동화 및 확장 가능한 기법(특히 데이터 준비 및 감소 분야)의 필요성을 강조한다.
  • 자동화된 머신러닝(AutoML)과 종단 간 파이프라인 탐색이 체계적이고 다중 작업 최적화를 가능하게 한다고 강조한다.
  • 데이터 전략과 모델 아키텍처가 함께 진화함으로써 성능과 공정성을 극대화하는 데이터-모델 공동 설계의 중요성을 주장한다.
  • 모델 중심 AI에서의 모델 벤치마크와 유사하게, 데이터 품질과 DCAI 기법을 종합적으로 평가하기 위한 종합적 데이터 벤치마크 개발을 권장한다.

실험 결과

연구 질문

  • RQ1모델 훈련을 넘어서 전체 AI 생애주기 동안 데이터 품질과 신뢰성을 어떻게 체계적으로 향상시킬 수 있는가?
  • RQ2다양한 AI 응용 분야에서 데이터 중심 AI 관행을 확장하는 데 있어 핵심적인 기술적·조직적 과제는 무엇인가?
  • RQ3실제 AI 시스템에 데이터 유지보수 및 지속적인 데이터 품질 보장 기능을 어떻게 통합할 수 있는가?
  • RQ4데이터와 모델 설계가 어떻게 상호 공진화하여 AI 시스템 성능과 공정성을 극대화할 수 있는가?
  • RQ5표준화된 방식으로 다양한 데이터 중심 AI 기법을 평가하고 비교하기 위해 어떤 종류의 벤치마크가 필요한가?

주요 결과

  • 논문은 데이터 품질이 모델 성능의 핵심 결정 요소임을 입증하며, 체계적으로 코딩되지 않은 데이터에서는 '쓰레기 들어가면 쓰레기 나온다'는 위험이 여전히 크다고 강조한다.
  • 학습 데이터 개발은 잘 연구되었지만, 실세계 배포에서 점점 더 중요해지고 있음에도 불구하고, 추론 데이터 개발과 데이터 유지보수 분야는 여전히 미비하게 다뤄지고 있다.
  • 예를 들어 데이터 증강이 평가 세트 설계에 미치는 영향이나 유지보수 전략이 학습 데이터 특성에 의존하는 것처럼, 다중 작업 간 상호작용은 체계적 최적화에 있어 중대한 과제를 제기한다.
  • 편향은 심각한 문제이며, DCAI는 학습 및 평가 데이터 내 편향을 탐지하고 완화하며 지속적으로 모니터링할 수 있는 새로운 길을 제공한다.
  • 데이터 품질과 DCAI 기법을 평가하기 위한 표준화된 벤치마크 부족은 분야 발전을 방해하는 주요 장애물이며, 현재의 벤치마크는 종종 고립된 작업에 국한되어 있다.
  • 향후 DCAI 분야의 진전은 데이터-모델 공동 설계와 AutoML 기반 종단 간 자동화를 통해 이루어지며, 이는 데이터 파이프라인의 종합적 최적화를 가능하게 할 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.