[論文レビュー] Assessing the Fairness of AI Systems: AI Practitioners' Processes, Challenges, and Needs for Support
本研究は、実世界の状況においてAI実務者が分散型公平性評価をどのように設計するかを調査し、指標選定、ステークホルダー同定、データ収集における重要な課題を明らかにした。組織的圧力—特に、弱い立場のグループよりも顧客への影響を優先すること、スケール志向の展開—が公平性評価を著しく妨げていることが判明した。これにより、AI開発ワークフロー内でのステークホルダー参加の強化と構造的支援の必要性が示唆された。
Various tools and practices have been developed to support practitioners in identifying, assessing, and mitigating fairness-related harms caused by AI systems. However, prior research has highlighted gaps between the intended design of these tools and practices and their use within particular contexts, including gaps caused by the role that organizational factors play in shaping fairness work. In this paper, we investigate these gaps for one such practice: disaggregated evaluations of AI systems, intended to uncover performance disparities between demographic groups. By conducting semi-structured interviews and structured workshops with thirty-three AI practitioners from ten teams at three technology companies, we identify practitioners' processes, challenges, and needs for support when designing disaggregated evaluations. We find that practitioners face challenges when choosing performance metrics, identifying the most relevant direct stakeholders and demographic groups on which to focus, and collecting datasets with which to conduct disaggregated evaluations. More generally, we identify impacts on fairness work stemming from a lack of engagement with direct stakeholders or domain experts, business imperatives that prioritize customers over marginalized groups, and the drive to deploy AI systems at scale.
研究の動機と目的
- AI実務者がAIシステムの分散型公平性評価を設計する際の現実世界のプロセスと課題を理解すること。
- ビジネス上の優先順位やステークホルダー参加の欠如といった、公平性評価を阻害する組織的障壁を同定すること。
- 文脈的に適切な公平性評価を実施するための実務者の支援ニーズを明らかにすること。
- 組織的文脈が公平性評価実践、特にスケーリングと展開スケジュールとの関係において、どのように影響を与えるかを検討すること。
提案手法
- 3つのテクノロジー企業の10チームに所属する33名のAI実務者を対象に、半構造化インタビューを実施した。
- Barocasら(2021)が提唱するアプローチを改変した、公平性評価設計プロセスを支援する構造的ワークショップを実施した。
- 自然言語処理、不正検知、チャットボットを含む多様なAIシステムを開発するチームを対象とし、多様な文脈的インサイトを得ることを目的とした。
- 指標選定、ステークホルダー同定、マイノリティグループ選定、データ収集の課題に関するデータを収集した。
- テーマ的コーディングを用いて、繰り返し現れる課題と支援ニーズを同定した。
- インタビューの質的洞察と参加型ワークショップの出力を統合した混合研究法を採用した。
実験結果
リサーチクエスチョン
- RQ1実務者がAIシステムの分散型評価を設計する際の、現在のプロセスと課題は何か?
- RQ2分散型評価を設計するにあたり、実務者が必要とする組織的支援は何か。また、そのニーズをリーダーシップにどのように伝えているか?
- RQ3組織的文脈が、実務者のプロセス、課題、支援ニーズにどのように影響を与えているか?
主な発見
- 実務者は、技術的実現可能性と公平性目標の間のトレードオフのため、分散型公平性評価に適切なパフォーマンス指標を選定する上で顕著な課題に直面している。
- 評価に最も関連する直接的ステークホルダーおよびマイノリティグループを同定することが難しい。特に、ステークホルダーが明確に定義されておらず、開発初期段階で関与されていない場合に顕著である。
- 代表的かつ高品質なデータセットがマイノリティグループに限定されていることが、意味のある分散型評価を実施する上で主要な障壁となっている。
- スケールでのAIシステム展開を優先する組織的圧力が、徹底的な公平性評価を妨げており、結果として急ぎのまたは表面的な評価が行われている。
- 分野専門家や直接的ステークホルダーとの関与が不十分であるため、文脈的に関連する公平性リスクを逃す可能性がある。
- 公平性評価を推進するための公式な支援構造が不足しており、特に顧客維持や迅速な展開といったビジネス目標と衝突する場合に顕著である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。