[논문 리뷰] Data Readiness for AI: A 360-Degree Survey
이 논문은 구조화된 및 비구조화된 데이터를 포함하여 120개 이상의 학술 및 산업 자료를 분석함으로써 AI를 위한 데이터 준비도(DRAI) 지표에 대한 종합적인 분류 체계를 제안한다. 데이터 품질, 공정성, 개인정보 보호 및 FAIR 원칙과 관련된 기존 지표를 통합하여 평가의 표준화와 AI 모델 신뢰도 향상을 위한 체계적 데이터 준비를 위한 통합 프레임워크를 제공한다.
Artificial Intelligence (AI) applications critically depend on data. Poor quality data produces inaccurate and ineffective AI models that may lead to incorrect or unsafe use. Evaluation of data readiness is a crucial step in improving the quality and appropriateness of data usage for AI. R&D efforts have been spent on improving data quality. However, standardized metrics for evaluating data readiness for use in AI training are still evolving. In this study, we perform a comprehensive survey of metrics used to verify data readiness for AI training. This survey examines more than 140 papers published by ACM Digital Library, IEEE Xplore, journals such as Nature, Springer, and Science Direct, and online articles published by prominent AI experts. This survey aims to propose a taxonomy of data readiness for AI (DRAI) metrics for structured and unstructured datasets. We anticipate that this taxonomy will lead to new standards for DRAI metrics that will be used for enhancing the quality, accuracy, and fairness of AI training and inference.
연구 동기 및 목표
- AI 훈련 및 추론에서 데이터 준비도 평가를 위한 표준화된 지표 부족 문제를 해결하기 위해.
- 넓은 문헌 기반에서 구조화된 및 비구조화된 데이터셋의 전반적인 데이터 준비도 차원을 식별하고 분류하기 위해.
- 윤리적인 AI 개발을 위해 공정성, 개인정보 보호 및 편향 관련 지표를 데이터 품질 평가에 통합하기 위해.
- 일致된 평가 및 벤치마킹을 지원하는 통합 DRAI(Data Readiness for AI) 분류 체계를 제안하기 위해.
- 데이터 유형, 적용 분야 및 AI 라이프사이클 단계에 따라 적절한 지표를 선택할 수 있도록 연구자 및 실무자들을 안내하기 위해.
제안 방법
- ACM 디지털 라이브러리, IEEE Xplore, 유명 학술지 및 전문가 웹 기사에서 온 120개 이상의 자료를 체계적으로 조사하였다.
- 품질, 접근성, 상호운용성 및 윤리적 차원을 통합하여 360도 프레임워크로 데이터 준비도 차원을 매핑하였다.
- 완전성, 일관성, 정확도, 시기적합성, 공정성, 개인정보 보호 및 재사용성(FAIR)으로 분류된 지표들을 분류하였다.
- IBM의 데이터 품질 툴킷 및 The Materials Data Facility와 같은 FAIR 준수 데이터 인fra구조와 같은 기존 도구를 분석하였다.
- 데이터 준비도의 점수화 메커니즘과 임계값 정의를 평가하였으며, 이해 가능성과 맥락 의존성에 중점을 두었다.
- 다양한 AI 응용 분야에서 라이프사이클 기반의 동적 평가를 지원하는 통합적이고 진화하는 프레임워크를 제안하였다.
실험 결과
연구 질문
- RQ1구조화된 및 비구조화된 데이터 전반에 걸쳐 효과적인 AI 훈련 및 추론을 위해 필수적인 핵심 데이터 준비도 차원은 무엇인가?
- RQ2기존의 데이터 품질 지표(예: 완전성, 정확도)는 AI 전용 요구사항과 윤리적 고려사항과 어떻게 일치하는가?
- RQ3공정성, 편향 및 개인정보 보호 지표는 현재의 데이터 준비도 평가 프레임워크에 어느 정도 통합되어 있는가?
- RQ4데이터 준비도에 대한 통용 가능한 임계값을 정의하는 데 있어 주요 과제는 무엇이며, 이를 어떻게 맥락 기반으로 해결할 수 있는가?
- RQ5도구 및 분야 간 DRAI 지표의 의미 있는 비교를 가능하게 하기 위해 벤치마크 데이터셋과 평가 프로토콜는 어떻게 개발될 수 있는가?
주요 결과
- 조사에서 120개 이상의 관련 자료를 식별하여 AI 및 데이터 과학 문헌에서 데이터 준비도 지표의 분산되어 있지만 성장 중인 생태계를 확인하였다.
- 완전성, 일관성, 정확도 및 시기적합성과 같은 핵심 데이터 품질 차원은 여전히 기초가 되지만, 공정성 및 개인정보 보호 통합 없이선 부족하다.
- FAIR 원칙(Findable, Accessible, Interoperable, Reusable)은 과학적 및 연구 분야에서 AI 준비된 데이터에 대해 점점 더 필수적인 것으로 인식되고 있다.
- 데이터 준비도에 대한 유일한 임계값은 존재하지 않으며, 수용 가능한 수준은 맥락에 따라 크게 달라지며, 적용 분야 및 데이터 유형에 따라 다를 수 있다.
- DRAI 지표의 이해 가능성과 시각화는 이해관계자 수용에 매우 중요하지만, 현재 도구에서는 여전히 개발이 부족한 상태이다.
- 본 연구는 데이터 준비도가 초기 준비 단계를 넘어서 지속적으로 모니터링되어야 하므로, 동적이고 라이프사이클 기반의 평가가 필요하다고 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.