[논문 리뷰] Deficiency of Large Language Models in Finance: An Empirical Examination of Hallucination
이 논문은 금융 분야에서 대규모 언어 모델(LM)의 환각 현상에 대해 실증적으로 연구하며, 금융 개념 설명 및 역대 주가 조회에 대한 정확도를 평가한다. 연구 결과, 표준형 LLM은 심각한 환각 현상을 보이며, 프롬프트 기반 툴 학습과 RAG는 사실 정확도를 크게 향상시키며, 툴 보강 모델은 주가 조회 과제에서 100%의 정확도를 달성한다.
The hallucination issue is recognized as a fundamental deficiency of large language models (LLMs), especially when applied to fields such as finance, education, and law. Despite the growing concerns, there has been a lack of empirical investigation. In this paper, we provide an empirical examination of LLMs' hallucination behaviors in financial tasks. First, we empirically investigate LLM model's ability of explaining financial concepts and terminologies. Second, we assess LLM models' capacity of querying historical stock prices. Third, to alleviate the hallucination issue, we evaluate the efficacy of four practical methods, including few-shot learning, Decoding by Contrasting Layers (DoLa), the Retrieval Augmentation Generation (RAG) method and the prompt-based tool learning method for a function to generate a query command. Finally, our major finding is that off-the-shelf LLMs experience serious hallucination behaviors in financial tasks. Therefore, there is an urgent need to call for research efforts in mitigating LLMs' hallucination.
연구 동기 및 목표
- 금융 작업에 적용된 LLM에서 환각 현상을 실증적으로 검토하는 것, 특히 금융 용어 설명 및 역대 주가 조회에 중점을 둔다.
- 시간에 민감하고 사실 정밀도가 요구되는 금융 질의를 처리할 때 표준형 LLM의 신뢰성 평가
- 소수 예시 프롬프팅, DoLa 디코딩, RAG, 프롬프트 기반 툴 학습의 네 가지 완화 전략이 환각 현상을 줄이는 데 얼마나 효과적인지 평가하는 것
- 환각 현상이 외부 사실 확인 메커니즘이 없는 한 실제 금융 애플리케이션에 LLM을 도입하는 데 중요한 장벽으로 남아 있음을 입증하는 것
- 고위험 금융 AI 시스템에서 사실 정확성을 보장하기 위해 환각 현상 완화에 대한 집중적인 연구를 촉구하는 것
제안 방법
- 제로샷 및 소수 예시 프롬프팅을 사용하여 LLM의 금융 개념 및 용어 설명 능력을 실증 평가
- 실제 질의를 사용하여 LLM의 역대 주가 검색 정확도를 테스트하기 위한 벤치마크 작업 설계
- 소수 예시 프롬프팅, 대조 레이어 기반 디코딩(DoLa), 검색 보강 생성(RAG), 기능 호출 생성을 위한 프롬프트 기반 툴 학습의 네 가지 완화 기법 평가
- LLM이 최신 금융 데이터에 접근하기 위한 정확한 API 질의를 생성할 수 있도록 프롬프트 기반 툴 학습 구현
- 제로샷 및 소수 예시 설정을 통해 Llama2-7B, Llama2-13B, GPT-3.5-turbo, GPT-4를 포함한 다양한 LLM의 성능 비교
- 모델 출력과 기저 진실 주가 응답 간 정확한 일치 평가를 통해 사실 정확도 측정
실험 결과
연구 질문
- RQ1표준형 LLM이 금융 용어나 개념을 설명할 때 얼마나 심각한 환각 현상을 보이는가?
- RQ2외부 도구나 검색 메커니즘이 없는 조건에서 LLM은 얼마나 정확하게 역대 주가를 복구할 수 있는가?
- RQ3소수 예시 프롬프팅, DoLa 디코딩, RAG, 프롬프트 기반 툴 학습이 금융 LLM 과제에서 환각 현상을 줄이는 데 얼마나 효과적인가?
- RQ4프롬프트 기반 툴 학습은 금융 질의 과제에서 거의 완벽한 정확도를 달성할 수 있으며, 다른 방법과 비교해 볼 때 어떤가?
- RQ5DoLa와 소수 예시 프롬프팅은 금융 데이터와 관련된 지식 격차를 해결하는 데 어떤 한계를 지니는가?
주요 결과
- 표준형 LLM은 금융 과제에서 심각한 환각 현상을 보이며, 금융 용어 설명과 주가 검색에 심각한 사실 오류를 범한다.
- Llama2-7B 및 Llama2-7B-chat 모델은 외부 도구 없이 제로샷 주가 조회에서 거의 0%의 정확도를 기록하여 사실 기반 과제에서의 신뢰성 부족을 드러낸다.
- 프롬프트 기반 툴 학습을 통해 Llama2-7B 및 Llama2-7B-chat 모델은 단 한 개의 예시만으로도 주가 조회 과제에서 100.00%의 정확도를 달성하여 높은 효능을 입증한다.
- GPT-3.5-turbo 및 GPT-4는 제로샷 모드에서 주가 조회 질의에 응답하지 못하지만, 프롬프트 기반 툴 학습을 보강하면 완벽한 정확도를 달성한다.
- 소수 예시 프롬프팅은 질문-답변 형식 준수를 향상시키지만 사실 정확도 향상에 큰 영향을 주지 않아 환각 현상 감소에 한계가 있음을 시사한다.
- DoLa 디코딩은 사실 정확도 향상에 제한적인 기여를 하며, 특히 특정 주식 티커 정보가 사전 훈련 데이터에 충분히 포함되어 있지 않은 경우에 더 두드러진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.