[논문 리뷰] AI-Augmented Predictions: LLM Assistants Improve Human Forecasting Accuracy
이 연구는 인간 예측에서 대규모 언어 모델(Large Language Models, LLMs)을 의사결정 보조 도구로 평가하며, 높은 품질의 '초예측가' 보조자와 편향되며 과신하는 보조자 모두가 제어 조건(이전의 비예측 전용 LLM을 사용)보다 평균 23% 높은 인간 예측 정확도를 달성하는 것으로 나타났다. 조건이 열악한 LLM이라도 개선 효과가 유지되므로, LLM 보조는 모델 신뢰도와 관계없이 추론 능력을 향상시킨다.
Large language models (LLMs) match and sometimes exceeding human performance in many domains. This study explores the potential of LLMs to augment human judgement in a forecasting task. We evaluate the effect on human forecasters of two LLM assistants: one designed to provide high-quality ("superforecasting") advice, and the other designed to be overconfident and base-rate neglecting, thus providing noisy forecasting advice. We compare participants using these assistants to a control group that received a less advanced model that did not provide numerical predictions or engaged in explicit discussion of predictions. Participants (N = 991) answered a set of six forecasting questions and had the option to consult their assigned LLM assistant throughout. Our preregistered analyses show that interacting with each of our frontier LLM assistants significantly enhances prediction accuracy by between 24 percent and 28 percent compared to the control group. Exploratory analyses showed a pronounced outlier effect in one forecasting item, without which we find that the superforecasting assistant increased accuracy by 41 percent, compared with 29 percent for the noisy assistant. We further examine whether LLM forecasting augmentation disproportionately benefits less skilled forecasters, degrades the wisdom-of-the-crowd by reducing prediction diversity, or varies in effectiveness with question difficulty. Our data do not consistently support these hypotheses. Our results suggest that access to a frontier LLM assistant, even a noisy one, can be a helpful decision aid in cognitively demanding tasks compared to a less powerful model that does not provide specific forecasting advice. However, the effects of outliers suggest that further research into the robustness of this pattern is needed.
연구 동기 및 목표
- 실제 세계의 전망 작업에서 LLM이 인간의 예측 정확도를 향상시킬 수 있는지 평가하는 것.
- LLM 보조가 낮은 능력의 예측자에게 더 큰 도움을 주는지 여부를 검토하는 것.
- LLM 보조가 예측 다양성을 감소시키거나 집단 예측의 지혜를 떨어뜨리는지 조사하는 것.
- LLM 보조의 효과가 질문의 난이도에 따라 달라지는지 평가하는 것.
- LLM 보조의 효과가 주로 모델의 정확도에 기인하는지, 또는 인지 보조 기제에 기인하는지 판단하는 것.
제안 방법
- 참가자(N = 991)는 세 조건 중 하나로 무작위 배정되었으며, GPT-3.5-turbo(DaVinci-003)를 사용하는 제어군, '초예측가' LLM 보조자, 편향되고 과신하는 LLM 보조자이다.
- 모든 참가자는 인플레이션 목표치 및 석유 자원 등 경제 및 시장 지표를 포함한 일련의 전망 작업을 수행하였다.
- LLM 보조자는 고품질의 캘리브레이션된 예측을 제공하거나, 과신과 기초 빈도 忽시를 보여주도록 프롬프트가 주어졌다.
- 예측 정확도는 브리어 점수(Brier scores)를 사용해 측정되었으며, 높은 정확도는 낮은 브리어 점수에 해당한다.
- 사전 등록된 분석은 조건 간 정확도를 비교하였고, 탐색적 분석은 이질적 사례와 부분군 효과를 검토했다.
- 연구는 무작위 배정과 블라인드 데이터 분석을 통한 통제된 실험 설계를 사용하여 타당성을 확보하였다.
실험 결과
연구 질문
- RQ1LLM 보조는 낮은 능력의 LLM을 사용하는 제어 조건보다 인간 예측 정확도를 유의미하게 향상시키는가?
- RQ2낮은 능력의 예측자가 높은 능력의 예측자보다 LLM 보조에서 더 큰 이점을 얻는가?
- RQ3LLM 보조는 예측 다양성을 감소시키거나 집단 예측의 정확도를 떨어뜨리는가?
- RQ4LLM 보조의 효과는 예측 질문의 난이도에 따라 달라지는가?
- RQ5예측 정확도 향상의 원인이 LLM의 본질적 예측 품질인지, 또는 인지 보조 기제인지?
주요 결과
- LLM 보조는 낮은 능력의 LLM을 사용하는 제어군 대비 평균 23% 높은 인간 예측 정확도를 달성하였다.
- 탐색적 분석에서 '초예측가' LLM 보조자는 외곽 질문을 제외한 결과에서 정확도를 43% 향상시켰고, 편향된 보조자는 28% 향상시켰다.
- 편향된 LLM 보조자조차도 정확도를 향상시켰기 때문에, 조건이 열악한 LLM이라도 의미 있는 인지 보조 기능을 제공할 수 있음을 시사한다.
- 낮은 능력과 높은 능력의 예측자 간 LLM 보조의 이점에 통계적으로 유의미한 차이가 없었으며, 이는 낮은 능력자에게 더 큰 이점이 있다는 가설을 뒷받침하지 못한다.
- LLM 보조는 예측 다양성에 유의미한 영향을 주지 않았고, 집단 예측의 정확도도 떨어뜨리지 않았다. 이는 집단 지능에 일관된 부정적 영향이 없다는 것을 시사한다.
- 쉬운 질문과 어려운 질문 간 LLM 보조의 효과에 통계적으로 유의미한 차이가 없었으며, 이는 과제 난이도에 관계없이 균일한 이점이 있음을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.