Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Human Centered AutoML

Florian Pfisterer, Janek Thomas|arXiv (Cornell University)|2019. 11. 06.
Machine Learning and Data Classification참고 문헌 10인용 수 11
한 줄 요약

이 논문은 예측 성능 외에도 해석 가능성, 공정성, 효율성 등의 기준을 자동화된 머신러닝 시스템에 통합함으로써 인간 중심의 AutoML 접근 방식을 주장한다. 예측 성능 이외의 요소를 고려할 수 있도록 도메인 특화된 선호도를 반영할 수 있는 상호작용형 인터페이스를 제안함으로써, 단지 예측 성능만을 고려하는 것 이상의 모델 선택이 가능해진다.

ABSTRACT

Building models from data is an integral part of the majority of data science workflows. While data scientists are often forced to spend the majority of the time available for a given project on data cleaning and exploratory analysis, the time available to practitioners to build actual models from data is often rather short due to time constraints for a given project. AutoML systems are currently rising in popularity, as they can build powerful models without human oversight. In this position paper, we aim to discuss the impact of the rising popularity of such systems and how a user-centered interface for such systems could look like. More importantly, we also want to point out features that are currently missing in those systems and start to explore better usability of such systems from a data-scientists perspective.

연구 동기 및 목표

  • 현재 AutoML 시스템이 예측 성능 외의 요소인 해석 가능성, 공정성, 효율성 등을 간과하는 데서 비롯하는 한계를 해결하기 위해.
  • 기존 AutoML 도구에 인간 중심의 상호작용 기능이 부족하다는 점이 실용적 도입의 주요 장벽임을 규명하기 위해.
  • 파이프라인 검색 과정에서 예측 성능 이외의 기준을 반영할 수 있도록 반복적 피드백을 지원하는 재설계된 AutoML 인터페이스를 제안하기 위해.
  • 복잡한 실생활 데이터 과학 워크플로우에서 중간 결과를 노출하고 사용자 간섭을 허용함으로써 AutoML 시스템이 더 복잡한 요구사항을 충족시킬 수 있도록 하기 위해.
  • 블랙박스 최적화를 넘어서 도메인 전문 지식과 사용자 선호도를 자동화 과정에 통합함으로써 AutoML를 발전시키기 위해.

제안 방법

  • 정확도 외에도 모델 크기, 속도, 해석 가능성 등의 다중 최적화 기준을 사용자가 정의하고 조정할 수 있는 상호작용형 AutoML 인터페이스를 제안한다.
  • 사용자가 평가하고 피드백을 줄 수 있도록 중간 단계의 파이프라인 후보를 노출함으로써 인간 중심의 정밀 조정을 가능하게 한다.
  • 기존 AutoML 프레임워크(예: auto-sklearn, TPOT)를 활용하지만, 기술적 기준과 도메인 특화 기준 간의 다기준 최적화를 지원하도록 확장한다.
  • 해석 가능성 및 공정성 메트릭을 검색 공간에 통합함으로써, 상호 대체 가능성을 명시적으로 고려할 수 있도록 한다.
  • 기준이 모호하거나 쉽게 수치화하기 어려운 경우, 특히 파이프라인 검색 과정에서 인간의 피드백 루프를 활용할 것을 권장한다.
  • 특히 성능이 유일한 목표가 아니라는 상황에서 사용자 입력에 기반한 동적 재구성 기능을 AutoML 시스템에 확장할 것을 촉구한다.

실험 결과

연구 질문

  • RQ1예측 정확도, 해석 가능성, 추론 속도와 같은 상호 모순이 발생할 수 있는 다양한 기준을 지원하도록 AutoML 시스템을 어떻게 재설계할 수 있는가?
  • RQ2기준이 주관적이거나 쉽게 수치화하기 어려운 경우, 인간 전문가가 자동 파이프라인 검색 과정에서 어떤 역할을 해야 하는가?
  • RQ3현재의 AutoML 벤치마크가 왜 실생활 데이터 과학 요구사항을 반영하지 못하는가? 평가 기준을 예측 성능을 넘어서 어떻게 확장할 수 있는가?
  • RQ4AutoML에서 도출된 중간 결과를 사용자가 어떻게 보고 행동할 수 있도록 해야 하는가?
  • RQ5실제 데이터 과학자들이 사용하기에 더 사용하기 쉬우며 신뢰할 수 있는 AutoML 시스템을 만들기 위해 필요한 인터페이스 설계 원칙은 무엇인가?

주요 결과

  • 현재의 AutoML 시스템은 주로 예측 성능 최적화에 치중되어 있으며, 해석 가능성, 공정성, 모델 효율성과 같은 핵심 기준을 간과하는 경향이 있다.
  • 데이터 과학자들이 데이터 정제 및 전처리에 소비하는 시간은 모델 구축에 소비하는 시간을 크게 초월하며, 이는 모델링 단계의 자동화 향상이 절실함을 시사한다.
  • 기존 AutoML 도구는 사용자 피드백 및 중간 결과 검토 기능이 부족하여, 복잡한 실생활 워크플로우에서의 사용성에 한계가 있다.
  • 다기준 최적화가 실용적 배포를 위해 필수적이다. 정확도 외에도 저지연, 고해석 가능성 등의 다양한 요구사항을 충족시켜야 하기 때문이다.
  • 특히 중간 파이프라인에 대한 인간의 피드백을 통한 인간 중심의 상호작용은 자동화된 모델의 관련성과 신뢰성 향상에 크게 기여한다.
  • 표준 AutoML 벤치마크에 공정성 및 투명성 메트릭이 포함되어 있지 않다는 점은 생성된 모델의 신뢰성과 윤리적 타당성을 떨어뜨린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.