Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond the technical challenges for deploying Machine Learning solutions in a software company

Ilias Flaounas|arXiv (Cornell University)|2017. 08. 08.
Ethics and Social Impacts of AI참고 문헌 2인용 수 13
한 줄 요약

이 논문은 소프트웨어 기업 내에서 기계학습 시스템을 구현할 때 발생하는 비기술적이고 인간 중심의 과제를 다루며, 아이디어 도출, 실행, 운영 단계에서 이해관계자 간 협업의 중요성을 강조한다. 성공적인 ML 구현은 제품 매니저, 엔지니어, 데이터 과학자, SRE 간의 공유 책임, 명확한 소통, 운영 내성에 기반하며, 모델 훈련 이후의 프로덕션화 및 유지보수 단계에서 약 90%의 노력이 소요된다는 점을 부각한다.

ABSTRACT

Recently software development companies started to embrace Machine Learning (ML) techniques for introducing a series of advanced functionality in their products such as personalisation of the user experience, improved search, content recommendation and automation. The technical challenges for tackling these problems are heavily researched in literature. A less studied area is a pragmatic approach to the role of humans in a complex modern industrial environment where ML based systems are developed. Key stakeholders affect the system from inception and up to operation and maintenance. Product managers want to embed "smart" experiences for their users and drive the decisions on what should be built next; software engineers are challenged to build or utilise ML software tools that require skills that are well outside of their comfort zone; legal and risk departments may influence design choices and data access; operations teams are requested to maintain ML systems which are non-stationary in their nature and change behaviour over time; and finally ML practitioners should communicate with all these stakeholders to successfully build a reliable system. This paper discusses some of the challenges we faced in Atlassian as we started investing more in the ML space.

연구 동기 및 목표

  • 알고리즘적 과제를 초월해 산업 소프트웨어 환경에서의 기계학습 배포에 대한 비기술적 장벽을 식별하고 분석하는 것.
  • 제품 매니저, 데이터 과학자, SRE, 법무팀, 개발자 등 다양한 이해관계자의 역할과 과제를 ML 라이프사이클 전반에서 검토하는 것.
  • 실제 환경에서 데이터 드프트, 불안정성, 비정상적인 행동 등으로 인해 기계학습 시스템 운영의 복잡성이 증가하는 점을 부각하는 것.
  • '당신이 만들었으니 당신이 유지보수한다' 원칙과 기능 플래그 같은 조직적 관행을 통해 시스템 신뢰성과 소유권을 향상시키기 위한 주장.
  • 성능, 확장성, 장기적 유지보수성을 균형 있게 고려한 기계학습 프로젝트 관리의 실용적 프레임워크 제공

제안 방법

  • Atlassian에서 사례 연구를 수행하여 아이디어 도출, 실행, 운영 단계에서의 실제 기계학습 배포 과제를 기록했다.
  • 구조화된 표를 사용해 각 단계의 핵심 이해관계자들을 특정 과제와 연결했다 (예: 제품 매니저는 영향도 측정 과제를 겪는다; SRE는 시스템 안정성 과제를 겪는다).
  • 모델 성능 저하 시 런타임에서의 장애 복구를 가능하게 하기 위해 기능 플래그의 사용을 강조했다.
  • 가짜 양성/가짜 음성에 대한 피드백 루프를 포함한 인간 중심의 메커니즘을 통해 모델를 조정하고 안정화시키기 위한 조치를 제안했다.
  • 모델 성능과 데이터 품질을 추적하기 위해 기존의 최선의 실천 방법(예: Breck 등, 2016)을 기반으로 한 운영 모니터링 관행을 제안했다.
  • 특히 '당신이 만들었으니 당신이 유지보수한다' 원칙을 통해 교차 기능적 협업과 공동 소유권을 강조했다.

실험 결과

연구 질문

  • RQ1소프트웨어 기업에서 기계학습 시스템을 배포할 때 이해관계자가 겪는 비기술적 과제는 무엇인가?
  • RQ2모델 훈련 이후로 여겨지는 최종 10%로 여겨지는 프로덕션화 단계가 왜 총 작업의 90%를 차지하는가?
  • RQ3데이터 소스의 불안정성과 비정상성은 실제 환경에서 기계학습 시스템의 장기적 운영에 어떻게 영향을 미치는가?
  • RQ4기계학습 시스템의 유지보수성과 신뢰성을 향상시키기 위해 조직적·공학적 관행은 무엇이 가능한가?
  • RQ5피드백 메커니즘과 기능 플래그는 데이터 입력의 높은 변동성으로 인해 발생하는 운영 리스크를 어떻게 완화할 수 있는가?

주요 결과

  • 기계학습 프로토타입의 프로덕션화 과정은 총 프로젝트 시간의 약 90%를 차지하지만, 이는 개발의 마지막 10%로 여겨지는 경향이 있다.
  • 제품 매니저, 법무팀, SRE와 같은 이해관계자들은 모델 훈련의 주요 책임자가 아니지만, 시스템 설계와 배포에 상당한 영향을 미친다.
  • 데이터 소스의 불안정성과 비정상성은 모델 성능 저하의 주요 원인으로, 회복을 위해 활성 모니터링과 인간의 피드백이 자주 필요하다.
  • '당신이 만들었으니 당신이 유지보수한다' 원칙은 장기적인 시스템 신뢰성을 확보하고 운영 부채가 축적되는 것을 방지하는 데 핵심적이다.
  • 기능 플래그를 통해 모델 성능 저하 시 백업 시스템으로의 안전한 장애 전환을 가능하게 하여 정지 시간을 줄이고 운영 내성을 향상시킨다.
  • 특히 가짜 양성/가짜 음성에 대한 조정과 피드백 메커니즘은 모델 훈련보다도 더 많은 시간을 소요하는 기계학습 시스템 유지보수의 핵심 요소이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.