[論文レビュー] Beyond the technical challenges for deploying Machine Learning solutions in a software company
この論文は、ソフトウェア会社における機械学習システムの導入における技術的でない、人的中心の課題を検討し、アイデーション、実行、運用の各フェーズにおいてステークホルダー間の協働を強調している。成功したML導入は、プロダクトマネージャー、エンジニア、データサイエンティスト、SREが、共有責任、明確なコミュニケーション、運用のレジリエンスを通じて一致することにかかっていると主張しており、90%の作業がモデル学習をはるかに超えて、プロダクション化と保守に費やされることが多いと指摘している。
Recently software development companies started to embrace Machine Learning (ML) techniques for introducing a series of advanced functionality in their products such as personalisation of the user experience, improved search, content recommendation and automation. The technical challenges for tackling these problems are heavily researched in literature. A less studied area is a pragmatic approach to the role of humans in a complex modern industrial environment where ML based systems are developed. Key stakeholders affect the system from inception and up to operation and maintenance. Product managers want to embed "smart" experiences for their users and drive the decisions on what should be built next; software engineers are challenged to build or utilise ML software tools that require skills that are well outside of their comfort zone; legal and risk departments may influence design choices and data access; operations teams are requested to maintain ML systems which are non-stationary in their nature and change behaviour over time; and finally ML practitioners should communicate with all these stakeholders to successfully build a reliable system. This paper discusses some of the challenges we faced in Atlassian as we started investing more in the ML space.
研究の動機と目的
- 技術的でない障壁、特にアルゴリズム的課題を超えた産業的ソフトウェア環境におけるML導入の障壁を特定・分析すること。
- プロダクトマネージャー、データサイエンティスト、SRE、法務チーム、開発者など多様なステークホルダーの役割と課題を、MLライフサイクル全体で検討すること。
- 実世界の環境におけるMLシステムの長期的運用において、データドリフト、不安定性、非定常的行動が引き起こす運用の複雑さを強調すること。
- システムの信頼性と所有権を向上させるために、'あなたが作ったものはあなたが保守する'やフィーチャーフラグといった組織的慣行を提唱すること。
- パフォーマンス、スケーラビリティ、長期的保守可能性のバランスを取る実用的なMLプロジェクト管理フレームワークを提供すること。
提案手法
- Atlassian社における事例研究を通じて、アイデーション、実行、運用フェーズにおける実際のML導入の課題を文書化した。
- 構造化された表を用いて、各フェーズにおける主要なステークホルダーと特定の課題をマッピングした(例:プロダクトマネージャーは影響の推定に直面)。
- モデルの劣化時にランタイムフェイルオーバーを可能にするために、フィーチャーフラグの使用を強調した。
- 誤検出・見逃しのフィードバックループを含む、人間を介したメカニズムを提唱し、モデルのチューニングと安定化を図った。
- Breckら(2016年)などの確立されたベストプラクティスに基づく運用監視慣行を提案し、モデルのパフォーマンスとデータ品質を追跡した。
- 特に'あなたが作ったものはあなたが保守する'という原則を通じて、クロスファンクショナルな連携と共有所有権の重要性を強調した。
実験結果
リサーチクエスチョン
- RQ1ソフトウェア会社におけるMLシステムの導入において、ステークホルダーが技術的でない課題に直面するのはなぜか?
- RQ2MLシステムのプロダクション化フェーズは、開発の最後の10%と見なされる一方で、なぜ全体の90%の作業を占めることが多いのか?
- RQ3データソースの不安定性と非定常性は、実世界環境におけるMLシステムの長期的運用にどのように影響を与えるか?
- RQ4導入後の保守性と信頼性を向上させるために、どのような組織的・工学的慣行が有効か?
- RQ5変動が大きいデータ入力を持つMLシステムにおいて、フィードバックメカニズムとフィーチャーフラグは、運用リスクをどのように軽減できるか?
主な発見
- MLプロトタイプのプロダクション化は、全体のプロジェクト時間の90%を占めることが多く、開発の最後の10%と見なされるにもかかわらずそうである。
- プロダクトマネージャー、法務チーム、SREなど、モデル学習の主要責任者ではないステークホルダーが、システム設計と導入に顕著に影響を与えている。
- データソースの不安定性と非定常性は、モデルの劣化の主な要因であり、回復にはしばしば監視と人間のフィードバックが必要となる。
- 'あなたが作ったものはあなたが保守する'という原則は、長期的なシステム信頼性を確保し、運用上の負債が蓄積されるのを防ぐために極めて重要である。
- フィーチャーフラグは、モデルの劣化時にフォールバックシステムへの安全なフェイルオーバーを可能にし、ダウンタイムを削減し、運用のレジリエンスを向上させる。
- 特に誤検出・見逃しのチューニングとフィードバックメカニズムは、モデル学習よりも時間がかかることが多く、MLシステム保守の最も作業量の多い部分である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。