[논문 리뷰] Fact-checking information from large language models can decrease headline discernment
이 연구는 대규모 언어 모델(Large Language Model, LLM)이 생성한 사실 확인 정보가 사용자의 정치 뉴스 정확성 식별 능력과 공유 의도에 미치는 영향을 조사한다. LLM이 잘못된 헤드라인을 올바르게 해명했음에도 불구하고, 잘못된 것으로 잘못 분류된 진실된 헤드라인에 대한 신뢰를 떨어뜨리고 불확실할 경우 거짓 헤드라인에 대한 신뢰를 높여, 인공지능 기반 사실 확인 시스템에서 의도하지 않은 해로움이 발생할 수 있음을 시사한다.
Fact checking can be an effective strategy against misinformation, but its implementation at scale is impeded by the overwhelming volume of information online. Recent artificial intelligence (AI) language models have shown impressive ability in fact-checking tasks, but how humans interact with fact-checking information provided by these models is unclear. Here, we investigate the impact of fact-checking information generated by a popular large language model (LLM) on belief in, and sharing intent of, political news headlines in a preregistered randomized control experiment. Although the LLM accurately identifies most false headlines (90%), we find that this information does not significantly improve participants' ability to discern headline accuracy or share accurate news. In contrast, viewing human-generated fact checks enhances discernment in both cases. Subsequent analysis reveals that the AI fact-checker is harmful in specific cases: it decreases beliefs in true headlines that it mislabels as false and increases beliefs in false headlines that it is unsure about. On the positive side, AI fact-checking information increases the sharing intent for correctly labeled true headlines. When participants are given the option to view LLM fact checks and choose to do so, they are significantly more likely to share both true and false news but only more likely to believe false headlines. Our findings highlight an important source of potential harm stemming from AI applications and underscore the critical need for policies to prevent or mitigate such unintended consequences.
연구 동기 및 목표
- 대규모 언어 모델(LLM)이 생성한 사실 확인 정보가 정치 뉴스 맥락에서 사용자가 어떻게 반응하는지 조사하기 위해.
- LLM 사실 확인이 사용자의 진실된 헤드라인과 거짓 헤드라인을 식별하는 능력 향상에 기여하는지 평가하기 위해.
- 참가자들이 정치 뉴스를 공유할 의도에 LLM 사실 확인이 미치는 영향을 평가하기 위해.
- 정당 소속 일치성이 LLM이 생성한 사실 확인 정보를 노출한 후 신념과 공유 행동을 형성하는 데 미치는 영향을 조사하기 위해.
- 실제 정보 생태계에서 LLM을 활용한 자동 사실 확인을 도입할 경우 발생할 수 있는 뜻하지 않은 결과를 규명하기 위해.
제안 방법
- 사전 등록된 랜덤화된 대조 실험을 통해 미국 내 N=1,548명의 참가자를 대상으로 LLM 사실 확인이 뉴스 인식에 미치는 인과적 영향을 평가하였다.
- 참가자들은 진실된 뉴스 기사 20건과 거짓 뉴스 기사 20건을 노출받았으며, 정당 소속 일치성( democratic 또는 republican 친화성)을 균형 있게 배치하였다.
- 참가자들은 '신념' 및 '공유' 그룹으로 나뉘었고, ChatGPT가 생성한 사실 확인 정보를 볼 것인지 여부를 무작위로 배정받았다.
- 다중 수준 회귀 모델과 강력한 표준오차를 사용하여 사실 확인 정보 노출, 헤드라인 진실성, 정당 소속 일치성 등이 신념과 공유 의도에 미치는 영향을 분석하였다.
- 사실 확인 정보 노출 여부, 헤드라인 진실성, 정당 소속 일치성 간의 상호작용 효과를 테스트하여 차별적 영향을 평가하였다.
- 보정된 부호 검정(Bonferroni correction)을 사용한 사후 비교를 통해 조건 간의 신념 및 공유 의도 기울기의 차이를 평가하였다.

실험 결과
연구 질문
- RQ1LLM이 생성한 사실 확인 정보에 노출되면 사용자의 정치 뉴스 헤드라인 정확성 식별 능력이 향상되는가?
- RQ2LLM 사실 확인을 시청하면 참가자의 진실된 정치 뉴스와 거짓 정치 뉴스를 공유할 의도에 어떤 영향을 미치는가?
- RQ3LLM이 헤드라인의 진위를 불확실하게 판단하거나 잘못 분류하면 정확한 뉴스에 대한 신뢰가 떨어지거나 거짓 뉴스에 대한 믿음이 증가하는가?
- RQ4정당 소속 일치성이 LLM 사실 확인이 신념과 공유 의도에 미치는 영향을 어떻게 조절하는가?
- RQ5실제 정보 생태계에서 LLM을 활용한 자동 사실 확인을 도입할 경우 발생할 수 있는 뜻하지 않은 결과는 무엇인가?
주요 결과
- LLM은 잘못된 헤드라인을 정확히 해명했지만, 사실 확인 정보가 참가자의 헤드라인 정확성 식별 능력 향상에 유의미한 영향을 주지 못했다.
- LLM은 잘못된 것으로 잘못 분류된 진실된 헤드라인에 대한 신뢰를 감소시켜 정확한 정보에 대한 신뢰를 해칠 수 있는 해로운 영향을 보였다.
- LLM이 헤드라인의 진위에 대해 불확실할 경우 거짓 헤드라인에 대한 믿음을 높여, 오류 정보 확산 위험을 증가시킬 수 있음을 시사했다.
- 참가자가 LLM 사실 확인을 볼 것을 선택한 경우, 진실된 뉴스와 거짓 뉴스 모두를 더 많이 공유할 가능성이 높아졌지만, 거짓 뉴스에 대한 믿음은 더욱 증가했다.
- 사실 확인 정보를 볼 것을 선택하지 않은 참가자들은 참조 헤드라인의 공유 의도에 대해 정당 소속 불일치성이 유의미한 부정적 영향을 미쳤다. 이는 선택하지 않은 사용자가 정당성에 더 민감하게 반응했음을 시사한다.
- 참가자가 사실 확인 정보를 볼 것을 선택한 경우, 정당 소속 일치성은 공유 의도에 유의미한 영향을 미치지 않았다. 이는 LLM 사실 확인이 공유 행동에서 정당성 편향을 상쇄할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.