Skip to main content
QUICK REVIEW

[논문 리뷰] Do You Trust ChatGPT? -- Perceived Credibility of Human and AI-Generated Content

Martin Huschens, Martin Briesch|arXiv (Cornell University)|2023. 09. 05.
Artificial Intelligence in Healthcare and Education인용 수 18
한 줄 요약

본 연구는 인간 생성 콘텐츠와 AI 생성 콘텐츠의 신뢰도에 대한 지각을 세 가지 UI 조건에서 비교하고 두 원천 간 유사한 신뢰도를 발견했으며, AI 콘텐츠가 더 선명하고 더 매력적으로 평가되었다.

ABSTRACT

This paper examines how individuals perceive the credibility of content originating from human authors versus content generated by large language models, like the GPT language model family that powers ChatGPT, in different user interface versions. Surprisingly, our results demonstrate that regardless of the user interface presentation, participants tend to attribute similar levels of credibility. While participants also do not report any different perceptions of competence and trustworthiness between human and AI-generated content, they rate AI-generated content as being clearer and more engaging. The findings from this study serve as a call for a more discerning approach to evaluating information sources, encouraging users to exercise caution and critical thinking when engaging with content generated by AI systems.

연구 동기 및 목표

  • UI 디자인(ChatGPT, 원문 텍스트, 위키피디아 스타일)가 텍스트 발췌에 대한 신뢰 판단에 어떤 영향을 미치는지 평가한다.
  • 사람이 생성한 콘텐츠와 LLM 생성 콘텐츠의 인지된 신뢰도를 비교한다.
  • 원천(출처)과 UI에 따라 능력(competence), 신뢰성(trustworthiness), 명확성(clarity), 몰입도(engagement)에 대한 지각이 달라지는지 분석한다.
  • 신뢰할 수 있는 비교를 보장하기 위해 참가자의 인구통계 및 관련 공변량을 통제한다.

제안 방법

  • Prolific를 통해 모집된 606명의 영어권 참가자를 대상으로 온라인 설문조사를 실시했다.
  • 각 참가자는 두 원천(human-generated, LLM-generated)과 세 가지 UI 조건으로 제시된 네 가지 주제를 평가했다(아카데미 시상식, 캐나다, 악성 소프트웨어, 미국 상원).
  • 신뢰도는 5점 리커트 척도의 11개 항목으로 측정되었으며 네 가지 요인(능력, 신뢰성, 명확성, 몰입도)에 걸쳐 평가되었다.
  • 확증적 요인분석(CFA)이 신뢰도와 타당도 검사를 포함한 네 요인 측정모형을 확인하였다.
  • UI 조건과 콘텐츠 원천을 비교하기 위해 비모수 검정(Kruskal-Wallis, Wilcoxon)과 기술적 시각화를 사용했다.

실험 결과

연구 질문

  • RQ1UI 조건(ChatGPT, Raw Text, Wikipedia UI)이 텍스트 발췌에 대한 지각된 신뢰도에 영향을 미치는가?
  • RQ2UI 조건에 따라 인간 생성 콘텐츠와 LLM 생성 콘텐츠 간에 지각된 신뢰도에 차이가 있는가?
  • RQ3신뢰도의 어느 차원들(능력, 신뢰성, 명확성, 몰입도)은 콘텐츠 원천이나 UI 조건에 의해 영향을 받는가?

주요 결과

  • UI 조건은 차원 간 신뢰도 지각이나 읽기 수행에 실질적인 영향을 미치지 않았다.
  • 참가자들은 인간 생성 콘텐츠와 LLM 생성 콘텐츠 간에 능력이나 신뢰성에서 차이를 보이지 않았다.
  • LLM 생성 텍스트가 인간 생성 텍스트보다 더 명확하고 더 몰입감을 주는 것으로 지각되었으며 읽기 시간이 짧았다.
  • UI 그룹 내에서 명확성과 몰입은 LLM 생성 콘텐츠를 선호했으며 효과크기는 소-중간 정도였다(명확성: p<0.01, r=0.261; 몰입도: p<0.01, r=0.134).
  • LLM 생성 콘텐츠의 읽기 시간이 유의하게 짧았다(p<0.01, r=0.114).
  • 본 연구는 AI 생성 정보에 대한 비판적 평가와 오정보 위험을 완화하기 위한 잠재적 라벨링의 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.