Skip to main content
QUICK REVIEW

[논문 리뷰] Data Collection and Quality Challenges in Deep Learning: A Data-Centric AI Perspective

Steven Euijong Whang, Yuji Roh|arXiv (Cornell University)|2021. 12. 13.
Data Quality and Management인용 수 40
한 줄 요약

이 설문은 데이터 중심 AI 관점에서 데이터의 1급 시민성 및 데이터 품질이 모델 성능에 미치는 역할을 강조하며 데이터 수집, 검증, 정리, 위생화, 강건한 학습 및 공정성 기술을 다룹니다.

ABSTRACT

Data-centric AI is at the center of a fundamental shift in software engineering where machine learning becomes the new software, powered by big data and computing infrastructure. Here software engineering needs to be re-thought where data becomes a first-class citizen on par with code. One striking observation is that a significant portion of the machine learning process is spent on data preparation. Without good data, even the best machine learning algorithms cannot perform well. As a result, data-centric AI practices are now becoming mainstream. Unfortunately, many datasets in the real world are small, dirty, biased, and even poisoned. In this survey, we study the research landscape for data collection and data quality primarily for deep learning applications. Data collection is important because there is lesser need for feature engineering for recent deep learning approaches, but instead more need for large amounts of data. For data quality, we study data validation, cleaning, and integration techniques. Even if the data cannot be fully cleaned, we can still cope with imperfect data during model training using robust model training techniques. In addition, while bias and fairness have been less studied in traditional data management research, these issues become essential topics in modern machine learning applications. We thus study fairness measures and unfairness mitigation techniques that can be applied before, during, or after model training. We believe that the data management community is well poised to solve these problems.

연구 동기 및 목표

  • 데이터 품질이 모델 성능에 결정적으로 영향을 미치는 데이터 중심 AI로의 전환을 촉진한다.
  • 획득, 라벨링, 기존 데이터를 심층 학습에 적합하도록 개선하는 것을 포함한 데이터 수집 기술을 조사한다.
  • 데이터 검증, 정리 및 통합 방법과 그것이 강건성 및 정확도에 미치는 영향을 조사한다.
  • 잡음이 많거나 오염되었거나 편향된 데이터를 다루기 위한 강건한 학습 기술을 논의한다.
  • 모델 학습 전, 중, 또는 후에 적용 가능한 공정성 측정 및 완화 기법을 강조한다.

제안 방법

  • 데이터 중심 AI 주제를 분류하고 기술을 데이터 유형 및 워크플로우에 매핑한다(데이터 수집, 검증/정리/통합, 강건한 학습, 공정성).
  • 데이터 획득, 라벨링, 검증, 정리, 위생화 및 완화 방법에 걸친 대표적이고 영향력 있는 기술을 요약한다.
  • 데이터 중심 AI 수명 주기 전반의 기술을 연결하는 분류 체계(표 1)와 워크플로우 의사 결정 트리를 제시한다.
  • 실용적 시스템과 프레임워크(예: TF Data Validation, SeeDB, ActiveClean) 및 주목할 만한 방법(GANs, Mixup, data programming)을 논의한다.
  • 편향, 강건성 및 AI 윤리에 대응하기 위해 데이터 관리와 ML 커뮤니티 간의 연결을 구축한다.

실험 결과

연구 질문

  • RQ1특징 엔지니어링이 덜 중심인 상황에서 딥러닝을 가장 잘 지원하는 데이터 수집 전략은 무엇인가?
  • RQ2데이터 검증, 정리 및 통합이 딥러닝의 다운스트림 모델 정확도와 강건성을 어떻게 향상시킬 수 있는가?
  • RQ3감독 학습에서 잡음 많고 오염되었거나 편향된 데이터를 다루는 데 효과적인 강건하고 공정한 학습 기술은 무엇인가?
  • RQ4데이터 중심 AI 팀이 데이터 품질 관행을 수집, 라벨링, 정리, 위생화 및 완화 전반에 걸쳐 어떻게 조정해야 하는가?
  • RQ5딥러닝에서 데이터 관리와 AI 윤리의 교차점에 남아 있는 주요 해상 도전 과제와 향후 방향은 무엇인가?

주요 결과

  • 데이터 수집은 딥러닝 성능의 기초이며, 데이터 발견, 확장 및 생성이 핵심 접근 방식이다.
  • 데이터 라벨링은 기존 라벨, 수동 라벨링, 반지도 학습, 크라우드소싱 및 데이터 프로그래밍을 포함한 약한 감독 등으로 활용할 수 있다.
  • 데이터 검증 및 시각화는 인간-루프 확인을 돕고, 스키마 기반 검증과 자동 이상 탐지가 주목을 받고 있다.
  • 데이터 정리 및 데이터 위생화는 모델 정확도를 개선하거나 때로는 해칠 수 있으며, 적절한 정리 전략을 선택하고 강건성을 고려하는 것이 중요하다.
  • 공정성 및 편향 측정은 필수적이며 학습 전, 중, 또는 후에 통합될 수 있으며 완화 기술은 사전처리, 학습 중 처리, 사후처리 전 범위를 포함한다.
  • 강건성, 공정성, 데이터 품질을 다루기 위해 ML 전체 수명 주기에 걸친 데이터 중심 AI 기술의 전체론적 오케스트레이션이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.