[논문 리뷰] PANDA: Facilitating Usable AI Development
PANDA는 데이터 준비, 모델 설계 및 배포 과정에서의 사용성, 효율성, 신뢰성 문제를 해결함으로써 AI의 민주화를 위한 종합적인 AI 개발 플랫폼을 제안한다. 데이터-모델 매칭 평가, 상호작용 가능한 시각화 도구, 딥러닝에서의 신뢰할 수 있는 영역 탐지 기법을 도입하여 임상의와 같은 도메인 전문가들이 깊은 머신러닝 전문 지식 없이도 신뢰할 수 있는 AI 응용 프로그램을 구축하고 배포할 수 있도록 한다.
Recent advances in artificial intelligence (AI) and machine learning have created a general perception that AI could be used to solve complex problems, and in some situations over-hyped as a tool that can be so easily used. Unfortunately, the barrier to realization of mass adoption of AI on various business domains is too high because most domain experts have no background in AI. Developing AI applications involves multiple phases, namely data preparation, application modeling, and product deployment. The effort of AI research has been spent mostly on new AI models (in the model training stage) to improve the performance of benchmark tasks such as image recognition. Many other factors such as usability, efficiency and security of AI have not been well addressed, and therefore form a barrier to democratizing AI. Further, for many real world applications such as healthcare and autonomous driving, learning via huge amounts of possibility exploration is not feasible since humans are involved. In many complex applications such as healthcare, subject matter experts (e.g. Clinicians) are the ones who appreciate the importance of features that affect health, and their knowledge together with existing knowledge bases are critical to the end results. In this paper, we take a new perspective on developing AI solutions, and present a solution for making AI usable. We hope that this resolution will enable all subject matter experts (eg. Clinicians) to exploit AI like data scientists.
연구 동기 및 목표
- 임상의와 같은 비기술적 도메인 전문가들이 머신러닝이나 소프트웨어 공학 전문 지식 없이도 AI 개발의 사용성을 향상시킴으로써 AI 도입 장벽을 낮추는 것.
- 현재 AI 연구가 정확도에만 집중함으로써 사용성, 효율성, 보안성이 희생되는 문제를 해결하는 것.
- 의료와 같은 실제 도메인에서 데이터 준비, 모델 설계, 제품 배포에 이르기까지 종단 간 AI 응용 프로그램 개발을 촉진하는 것.
- 모델이 안정적으로 작동하는 데이터 분포 영역을 식별하고 제한하여 고위험 응용 프로그램에서의 신뢰성을 확보하는 것.
- 기초 기계학습이나 소프트웨어 공학 전문 지식 없이도 전문가들이 AI 도구를 활용할 수 있도록 AI의 민주화를 이루는 것.
제안 방법
- 데이터 특성과 모델 가정 간의 불일치를 탐지하기 위한 데이터-모델 매칭 평가 프레임워크를 도입하여, 예를 들어 선형 모델에 비선형 데이터를 입력하는 경우와 같은 문제를 식별하고, 데이터 변환 또는 대체 모델 추천을 제안한다.
- 도메인 전문가가 데이터 탐색 및 레이블링을 보다 효과적으로 수행할 수 있도록 애너테이션 및 추천 기능을 갖춘 상호작용적이고 협업 가능한 시각화 도구를 개발한다.
- 딥러닝 모델에서 입력 공간 내에서 모델 성능이 훈련 데이터 성능과 일치하는 영역, 즉 신뢰할 수 있는 영역을 정의하는 메커니즘을 구현한다.
- 모델에 종속되지 않는 신뢰성 평가 기법을 통합하여 신뢰할 수 있는 영역 외부의 데이터 포인트를 식별하고, 이러한 영역의 예측은 피하거나 경고 표시하도록 한다.
- 사용성과 보안을 고려하여 데이터 준비, 모델 선택, 배포를 조율하는 모듈러한 AI 플랫폼(PANDA)을 설계한다.
- 특히 의료 및 유사 도메인에서 특징 공학 및 모델 설계를 안내하기 위해 도메인 지식과 기존 지식 기반을 활용한다.
실험 결과
연구 질문
- RQ1임상의와 같은 비전문가 도메인 전문가들이 머신러닝이나 소프트웨어 공학 지식 없이도 AI 개발에 접근 가능하게 만들 수 있는 방법은 무엇인가?
- RQ2데이터 특성과 모델 가정 간의 불일치를 탐지할 수 있는 메커니즘은 무엇이며, 이를 통해 자동 모델 선택 및 튜닝이 가능하게 할 수 있는가?
- RQ3데이터 시각화 및 상호작용 도구는 데이터 준비 과정에서 도메인 전문가와 데이터 과학자 간의 협업을 어떻게 향상시킬 수 있는가?
- RQ4딥러닝 모델에서 신뢰할 수 있는 예측 영역은 무엇으로 정의되며, 이러한 영역은 어떻게 자동으로 식별되고 고위험 응용 프로그램에서 활용될 수 있는가?
- RQ5실제 응용 프로그램 배포 전 과정에서 신뢰성, 효율성, 보안성을 확보하기 위해 AI 시스템은 어떻게 설계되어야 하는가?
주요 결과
- 데이터-모델 매칭 평가 기법은 비선형 데이터가 선형 모델에 입력되는 등 데이터와 모델 가정 간 불일치를 탐지함으로써 낮은 모델 성능 위험을 크게 감소시킨다.
- 협업 애너테이션 및 추천 기능을 갖춘 상호작용적 시각화 도구는 데이터 품질을 향상시키고, 특히 의료와 같은 복잡한 도메인에서 데이터 준비 속도를 가속화한다.
- 모델 성능이 훈련 데이터 정확도와 일치하는 영역, 즉 신뢰할 수 있는 영역을 정의하고 이를 예측에 제한함으로써 고위험 응용 프로그램, 예를 들어 의료 영상 분석에서의 안전한 배포가 가능해진다.
- 신뢰할 수 있는 영역이 환자 영상의 50%를 커버하고 그 영역에서 정확도가 99%에 도달하는 모델은 방사선 전문의의 작업 부담을 절반으로 줄일 수 있으며, 실용적 영향을 입증한다.
- 신뢰할 수 있는 영역 탐지 기법은 모델이 전반적으로 정확하지 않더라도 안정적이고 고신뢰도의 예측을 가능하게 하여 금융 아웃리어 전략 및 임상 의사결정 지원 분야에서의 활용을 가능하게 한다.
- PANDA 플랫폼 프로토타입은 사용성, 신뢰성, 도메인 전문 지식을 AI 개발 파이프라인에 통합하는 것이 실현 가능하며, 실생활 도입을 위해 필수적임을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.