Skip to main content
QUICK REVIEW

[논문 리뷰] Collaboration Challenges in Building ML-Enabled Systems: Communication, Documentation, Engineering, and Process

Nadia Nahar, Shurui Zhou|arXiv (Cornell University)|2021. 10. 19.
Big Data and Business Intelligence인용 수 20
한 줄 요약

이 논문은 28개 조직의 45명의 전문가 인터뷰를 통해 ML 기반 시스템을 구축할 때의 核심 협업 과제를 규명한다. 요구사항 규명, 데이터 품질 협의, 제품-모델 통합이라는 세 가지 핵심 협업 포인트를 강조하며, 커뮤니케이션, 문서화, 엔지니어링, 프로세스가 핵심 주제임을 밝히고, ML 개발의 다학제적 협업을 향상시키기 위한 실행 가능한 권고안을 제시한다.

ABSTRACT

The introduction of machine learning (ML) components in software projects has created the need for software engineers to collaborate with data scientists and other specialists. While collaboration can always be challenging, ML introduces additional challenges with its exploratory model development process, additional skills and knowledge needed, difficulties testing ML systems, need for continuous evolution and monitoring, and non-traditional quality requirements such as fairness and explainability. Through interviews with 45 practitioners from 28 organizations, we identified key collaboration challenges that teams face when building and deploying ML systems into production. We report on common collaboration points in the development of production ML systems for requirements, data, and integration, as well as corresponding team patterns and challenges. We find that most of these challenges center around communication, documentation, engineering, and process and collect recommendations to address these challenges.

연구 동기 및 목표

  • 생산용 ML 기반 시스템을 구축할 때 데이터 과학자와 소프트웨어 엔지니어 간의 협업 과제를 이해하기 위해.
  • 다양한 조직 구조에서 요구사항, 데이터, 통합 분야의 반복되는 협업 포인트와 관련 과제를 특정하기 위해.
  • 조직 패턴, 팀 구성, 권력 관계가 ML 프로젝트의 협업 효율성에 미치는 영향을 분석하기 위해.
  • 모델 중심적 고려사항을 초월해 엔지니어링, 문서화, 프로세스의 부족한 평가를 드러내기 위해.
  • 커뮤니케이션, 문서화, 계획 수립을 통한 개선을 통해 다학제적 협업을 향상시키기 위한 근거 기반 권고안을 제공하기 위해.

제안 방법

  • 데이터 과학자, 소프트웨어 엔지니어, 관리자 포함 28개 조직의 45명의 전문가를 대상으로 반구조화된 인터뷰를 실시함.
  • 주제 분석을 통해 조직적 맥락에서 반복되는 협업 포인트와 과제를 식별함.
  • ML 시스템, 소프트웨어 공학, 협업 과제에 관한 문헌 검토를 통해 결과를 교차 검증함.
  • 사례 예시를 활용해 조직 구조와 팀 패턴을 매핑함. 팀 역할 및 책임을 시각화한 표현 포함.
  • 주요 협업 포인트에서 공통적인 과제를 규명함: 요구사항 분해, 데이터 협의, ML 및 소프트웨어 엔지니어링 작업 통합.
  • 관찰된 패턴을 바탕으로 권고안을 수립함. 다학제 팀 간 문서화, 엔지니어링의 엄격함, 프로세스 기획을 중심으로 강조함.

실험 결과

연구 질문

  • RQ1ML 기반 시스템 개발에서 데이터 과학자와 소프트웨어 엔지니어 간의 주요 협업 포인트는 무엇인가요?
  • RQ2이 협업 포인트에서 발생하는 특정 과제는 무엇이며, 특히 요구사항, 데이터, 통합 분야에서 어떤 과제가 있나요?
  • RQ3조직 구조, 팀 구성, 권력 관계는 ML 프로젝트의 협업 결과에 어떻게 영향을 미치나요?
  • RQ4더 나은 또는 더 나쁜 협업 결과와 관련된 팀 조직 및 실천 패턴은 무엇인가요?
  • RQ5커뮤니케이션, 문서화, 엔지니어링, 프로세스를 통해 협업을 향상시키기 위한 권고안은 무엇인가요?

주요 결과

  • 가장 중요한 세 가지 협업 포인트는 요구사항 규명, 데이터 품질 및 양 협의, 제품-모델 통합이며, 각각 다른 다학제적 과제를 야기함.
  • 커뮤니케이션 실패는 널리 퍼져 있으며, 특히 기술 배경과 용어의 차이로 인해 데이터 과학자와 소프트웨어 엔지니어 간의 부합되지 않는 이해가 빈번히 보고됨.
  • 문서화가 종종 부족하거나 일관되지 않으며, 모델 요구사항, 데이터 기대치, 공정성 및 설명 가능성과 같은 모델 품질을 명시하는 표준화된 절차가 없음.
  • 엔지니어링 관행가 흔히 간과되며, 자동화, 테스팅, 모니터링의 부족으로 인해 ML이 도입하는 복잡성에도 불구하고 모델의 프로덕션화에 어려움을 겪음.
  • 프로세스 과제는 ML의 비선형적이고 탐색적인 성격이 기존 소프트웨어 개발 수명주기와 충돌함으로써 발생하며, 이로 인해 일정이 맞지 않거나 책임 소재가 명확하지 않게 됨.
  • 좋은 협업 결과를 낸 조직들은 다학제 훈련, 명확한 인터페이스 문서화, 계획 단계에서 데이터 과학 및 소프트웨어 엔지니어링 팀의 조기에 참여를 투자함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.