Skip to main content
QUICK REVIEW

[논문 리뷰] Do Humans Trust Advice More if it Comes from AI? An Analysis of Human-AI Interactions

Kailas Vodrahalli, Daneshjou, Roxana|arXiv (Cornell University)|2021. 07. 14.
Explainable Artificial Intelligence (XAI)참고 문헌 20인용 수 11
한 줄 요약

이 논문은 인간이 AI 조언을 사용할지 여부와 이를 어떻게 통합할지 설명하는 이단계적 '활성화-통합' 모델을 제안한다. 연구 결과, 출처(인간 대 AI)는 활성화에 영향을 주지만 통합에는 영향을 주지 않으며, 신뢰도는 주로 성능 인식에 의해 결정된다. 이 모델은 피부과 전문의를 포함한 다양한 작업과 인구 집단에서 유효하다.

ABSTRACT

In decision support applications of AI, the AI algorithm's output is framed as a suggestion to a human user. The user may ignore this advice or take it into consideration to modify their decision. With the increasing prevalence of such human-AI interactions, it is important to understand how users react to AI advice. In this paper, we recruited over 1100 crowdworkers to characterize how humans use AI suggestions relative to equivalent suggestions from a group of peer humans across several experimental settings. We find that participants' beliefs about how human versus AI performance on a given task affects whether they heed the advice. When participants do heed the advice, they use it similarly for human and AI suggestions. Based on these results, we propose a two-stage, "activation-integration" model for human behavior and use it to characterize the factors that affect human-AI interactions.

연구 동기 및 목표

  • 인간이 의사결정 맥락에서 AI 조언과 인간 조언을 어떻게 사용하는지 이해하는 것.
  • 개인들이 AI 또는 인간 출처의 조언을 활성화(사용)하거나 통합(통합)하는 데 영향을 주는 요인을 특정하는 것.
  • 일반인과 의료 전문가를 포함한 다양한 작업과 인구 집단에서 인간-AI 상호작용의 이중단계 모델을 검증하는 것.
  • 인구통계학적, 작업 특화, 신념 기반 요소가 조언 활용에 미치는 영향을 정량화하는 것.
  • 연구 공용을 위한 데이터를 수집 및 공개하고, 조작 가능한 신뢰도가 AI 시스템에 미치는 윤리적 함의를 분석하는 것.

제안 방법

  • 다양한 실험 설정에서 인간 대상자들이 AI와 인간 동료의 조언에 어떻게 반응하는지 비교하기 위해 '판사-조언자' 파라다임(JAS)을 사용했다.
  • 이미지 분류, 비유어 감지, 표 형태 데이터 예측의 세 가지 데이터 모odal을 포함한 실험을 설계하였으며, 1,100명이 넘는 커뮤니티 노동자와 37명의 피부과 전문가가 참여했다.
  • 이중단계적 '활성화-통합' 모델을 제안: 첫째, 개인이 조언을 사용할지 여부를 결정하는 활성화 단계; 둘째, 판단을 갱신하는 통합 단계.
  • 자신감, 일관성, 사전 신념, 노출 정도 등의 예측 변수를 위한 계수를 추정하기 위해 로지스틱 회귀 및 선형 회귀 모델을 사용했다.
  • 미국, 영국, 아시아 등 다양한 지리적 지역과 작업 유형(실제 의료 의사결정 포함)에서 모델의 타당성을 검증했다.
  • IRB 승인을 받은 의료 작업을 포함하여 익명화된 데이터셋을 수집하고 공개하여 윤리적인 데이터 관행을 확보했다.

실험 결과

연구 질문

  • RQ1조언의 출처(인간 대 AI)가 개인이 이를 사용할지 여부에 영향을 미치는가?
  • RQ2사용을 결정한 후 개인은 AI 조언을 인간 조언과 어떻게 다르게 통합하는가?
  • RQ3자신감, 일관성, 사전 신념 등의 요소가 조언의 활성화 또는 통합을 예측하는 데 어떤 영향을 미치는가?
  • RQ4활성화-통합 모델이 다양한 작업, 인구 집단, 데이터 모달에 걸쳐 일반화되는 정도는 어느 정도인가?
  • RQ5AI 경험 또는 임상 전문성은 실제 의사결정 맥락에서 조언 활용에 어떤 영향을 미치는가?

주요 결과

  • 참가자들은 출처가 능력 있다고 믿을 경우 더 자주 조언을 사용하지만, 사용한 이후 조언의 통합 방식에는 출처 유형이 유의미하게 영향을 주지 않는다.
  • 활성화 단계—조언을 사용할지 여부의 결정—는 AI 대 비해 인간의 성능에 대한 사전 신념에 영향을 받으며, AI 성능에 대한 사전 신념은 음의 계수를 보이지만 유의미하지 않다(β = -0.283, p = 0.427).
  • 피부병변 생검 작업에서 피부과 전문가 대상으로 AI와 인간 조언 모두 정확도를 약 67.6%에서 약 74.0%로 향상시켰으며, 활성화 비율은 각각 29.7%와 29.8%로 유의미한 차이가 없었다.
  • 통합 단계는 조언 출처에 크게 영향을 받지 않으며, 응답 변화에 대한 AI 조언의 계수는 -0.002(p = 0.427)로, 조언 통합 방식에 의미 있는 차이가 없음을 시사한다.
  • 응답 자신감과 조언과의 일관성은 활성화의 강력한 예측 변수이며, 자신감은 유의미한 음의 영향을 미친다(β = -0.531, p < 0.001).
  • 임상 경력 연수는 활성화에 부정적 영향을 미치며(β = -0.845, p = 0.048), 경험 많은 임상의일수록 외부 조언을 덜 사용하지만, 통합 정도는 경력과 관계없이 유사하게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.