Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing the Fairness of AI Systems: AI Practitioners' Processes, Challenges, and Needs for Support

Michael Madaio, Lisa Egede|arXiv (Cornell University)|2021. 12. 10.
Ethics and Social Impacts of AI인용 수 12
한 줄 요약

이 연구는 실세계 환경에서 AI 전문가들이 비균형 평가를 어떻게 설계하는지 조사하며, 지표 선택, 이해관계자 특정, 데이터 수집과 관련된 핵심 과제를 드러낸다. 조직적 압박—특히 소수자 그룹보다 고객 영향을 우선시하고 스케일 기반 배포를 추구하는 것—이 정당성 평가를 크게 저해함을 발견하였으며, 이는 AI 개발 워크플로우 내에서 이해관계자 참여 및 구조적 지원을 개선할 것을 촉구한다.

ABSTRACT

Various tools and practices have been developed to support practitioners in identifying, assessing, and mitigating fairness-related harms caused by AI systems. However, prior research has highlighted gaps between the intended design of these tools and practices and their use within particular contexts, including gaps caused by the role that organizational factors play in shaping fairness work. In this paper, we investigate these gaps for one such practice: disaggregated evaluations of AI systems, intended to uncover performance disparities between demographic groups. By conducting semi-structured interviews and structured workshops with thirty-three AI practitioners from ten teams at three technology companies, we identify practitioners' processes, challenges, and needs for support when designing disaggregated evaluations. We find that practitioners face challenges when choosing performance metrics, identifying the most relevant direct stakeholders and demographic groups on which to focus, and collecting datasets with which to conduct disaggregated evaluations. More generally, we identify impacts on fairness work stemming from a lack of engagement with direct stakeholders or domain experts, business imperatives that prioritize customers over marginalized groups, and the drive to deploy AI systems at scale.

연구 동기 및 목표

  • AI 시스템에 대한 분리된 정당성 평가를 설계할 때 AI 전문가들이 겪는 실제 과정과 과제를 이해하기 위해.
  • 비즈니스 우선순위와 이해관계자 참여 부족과 같은 조직적 장벽이 효과적인 정당성 평가를 저해하는 방식을 특정하기 위해.
  • 맥락에 맞는 정당성 평가를 수행하기 위해 전문가들이 필요로 하는 지원을 탐색하기 위해.
  • 조직적 맥락이 스케일과 배포 일정과 관련하여 정당성 평가 관행에 어떻게 영향을 미치는지 검토하기 위해.

제안 방법

  • 세 개의 기술 기업에서 10개 팀의 33명의 AI 전문가를 대상으로 반구조화된 인터뷰를 실시하였다.
  • Barocas 등 (2021)의 접근 방식을 변형한 정형화된 워크숍을 통해 전문가들이 정당성 평가 설계 과정을 안내하였다.
  • 자연어 처리, 사기 탐지, 챗봇을 포함한 다양한 AI 시스템을 개발하는 팀을 집중적으로 다루어 다양한 맥락적 통찰을 확보하였다.
  • 지표 선택, 이해관계자 특정, 인구집단 선택, 데이터 수집 과제에 관한 데이터를 수집하였다.
  • 주제 코드 분석을 통해 반복되는 과제와 지원 요구 사항을 식별하였다.
  • 인터뷰의 질적 통찰과 참가형 워크숍 결과를 융합한 혼합 방법 접근법을 사용하였다.

실험 결과

연구 질문

  • RQ1AI 전문가들이 자신의 AI 시스템에 대해 분리된 평가를 설계할 때 기존의 과정과 과제는 무엇인가?
  • RQ2분리된 평가를 설계할 때 전문가들이 조직적 지원이 필요로 하는 이유는 무엇이며, 리더십에게 이러한 요구를 어떻게 전달하는가?
  • RQ3조직적 맥락은 전문가들의 평가 과정, 과제, 지원 요구에 어떻게 영향을 미치는가?

주요 결과

  • 전문가들은 기술적 실행 가능성과 정당성 목표 사이의 상충 관계로 인해 분리된 정당성 평가에 적절한 성능 지표를 선택하는 데 상당한 과제를 겪는다.
  • 평가에 가장 관련성이 높은 직접 이해관계자와 인구집단을 특정하는 것이 어렵다. 특히 이해관계자가 명확히 정의되지 않았거나 개발 초기 단계에서 참여하지 않은 경우 더욱 그렇다.
  • 대표성 있고 고품질의 데이터셋을 소수 집단에 대해 접근할 수 없는 것은 의미 있는 분리된 평가를 수행하는 데 주요 장벽이다.
  • AI 시스템을 대규모로 배포하려는 조직적 압박이 정당성 평가의 철저함을 저해하여, 서두르거나 표면적인 평가로 이어진다.
  • 분야 전문가 및 직접 이해관계자와의 소통 부족으로 인해 맥락적으로 관련된 정당성 리스크를 간과할 수 있다.
  • 정당성 평가가 고객 유지를 유지하거나 빠른 배포와 같은 비즈니스 목표와 충돌할 경우, 전문가들은 정당성 평가를 옹호하기 위한 공식적 지원 체계를 확보하기 어렵다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.