[논문 리뷰] Large Language Models in Finance: A Survey
이 종합 검토는 금융 분야의 대규모 언어 모델(Large Language Models, LLMs)에 대한 포괄적인 개요를 제공하며, 금융 NLP 작업에 대한 제로샷 프롬프팅, 피니테이닝, 맞춤형 훈련과 같은 기법들을 평가한다. 데이터, 컴퓨팅 자원, 성능 제약 조건을 바탕으로 전문가들이 LLM 전략을 선택할 수 있도록 안내하는 决책 프레임워크를 제안하며, 금융 응용 분야에서의 책임감 있는 도입을 위한 실용적인 로드맵을 제시한다.
Recent advances in large language models (LLMs) have opened new possibilities for artificial intelligence applications in finance. In this paper, we provide a practical survey focused on two key aspects of utilizing LLMs for financial tasks: existing solutions and guidance for adoption. First, we review current approaches employing LLMs in finance, including leveraging pretrained models via zero-shot or few-shot learning, fine-tuning on domain-specific data, and training custom LLMs from scratch. We summarize key models and evaluate their performance improvements on financial natural language processing tasks. Second, we propose a decision framework to guide financial professionals in selecting the appropriate LLM solution based on their use case constraints around data, compute, and performance needs. The framework provides a pathway from lightweight experimentation to heavy investment in customized LLMs. Lastly, we discuss limitations and challenges around leveraging LLMs in financial applications. Overall, this survey aims to synthesize the state-of-the-art and provide a roadmap for responsibly applying LLMs to advance financial AI.
연구 동기 및 목표
- 금융 응용 분야에서의 대규모 언어 모델(LLMs) 현황을 종합적으로 분석하여 실용적인 해결책과 구현 전략에 중점을 둔다.
- 제로샷, 팔십샷, 피니테이닝, 맞춤형 훈련과 같은 핵심 LLM 기법들이 금융 NLP 작업에 어떻게 적용되는지 식별하고 평가한다.
- 금융 전문가들에게 지침이 부족한 점을 보완하고자, 데이터, 컴퓨팅 자원, 성능 요구 사항에 기반한 LLM 솔루션 선택을 위한 체계적인 결책 프레임워크를 제안한다.
- 규제된 금융 환경 내에서 LLM의 환상, 편향, 해석 불가능성 등의 위험 요소를 부각한다.
- 가벼운 실험에서부터 완전한 맞춤형 모델까지의 책임감 있고 확장 가능한 LLM 도입을 위한 로드맵을 제공한다.
제안 방법
- 제로샷/팔십샷 프롬프팅, 도메인 특화 금융 데이터 기반 피니테이닝, 그리고 완전히 새로 훈련한 LLM의 기법 분류 체계를 활용해 금융 분야의 기존 LLM 응용 사례를 조사한다.
- 표준 평가 지표(예: F1 점수, 정밀도, 재현율, MAPE, RMSE, R²)와 금융 분야 특화 지표(예: 샤프 지수, 백테스팅 시 총 수익)를 사용해 금융 NLP 작업에서의 LLM 성능을 평가한다.
- 데이터 가용성, 계산 자원, 요구 성능에 따라 저비용의 오프더셰프 LLM에서 고투자형의 피니테이닝 또는 맞춤형 모델로의 전환을 안내하는 결책 프레임워크를 제안한다.
- 외부 지식 소스에 기반한 응답을 제공함으로써 환상 현상을 줄이고 사실적 정확도를 향상시키기 위해 검색 기반 생성(Retrieval-Augmented Generation, RAG)을 적용한다.
- Liang 등(2022)이 제시한 종합 평가 시스템과 같은 도구를 활용해 LLM 출력물의 공정성, 강건성, 편향, 정확도를 다차원적으로 평가한다.
- 모델의 환상, 인종·성별·종교적 편향, 그리고 추론 능력이 있음에도 불구하고 투명하지 못한 블랙박스 성격과 같은 한계를 분석한다.

실험 결과
연구 질문
- RQ1제로샷, 팔십샷, 피니테이닝, 맞춤형 훈련 등의 다양한 LLM 기법들이 정서 분석, 질의 응답, 요약과 같은 금융 NLP 작업에서 어떻게 성능을 내는가?
- RQ2금융 응용 분야에서 LLM 전략을 선택할 때 비용, 성능, 자원 요구 사항 간의 주요 상충 관계는 무엇인가?
- RQ3금융 전문가들이 데이터 및 운영 제약 조건에 따라 오프더셰프 모델, 피니테이닝 모델, 맞춤형 LLM 간에 체계적으로 어떤 기준으로 선택할 수 있는가?
- RQ4LLM을 금융 분야에 사용할 경우 주요 위험 요소로 환상, 편향, 해석 불가능성이 있으며, 이를 어떻게 완화할 수 있는가?
- RQ5일반 목적 모델 대비 LLM이 금융 작업 성능을 얼마나 향상시키는가? 그리고 샤프 지수나 수익률 같은 성능 지표가 정확도 지표와 어떻게 일치하는가?
주요 결과
- 일반 목적 LLM을 도메인 특화 금융 데이터에 대해 피니테이닝하면 정서 분석, 질의 응답, 요약과 같은 금융 NLP 작업에서 성능 향상이 뚜렷하게 나타난다.
- 대규모 고품질 금융 코퍼스를 기반으로 훈련된 맞춤형 LLM은 전반적인 성능과 특화된 금융 작업에서 일반 모델 및 피니테이닝 모델을 뛰어넘는 성능을 보인다.
- 제안된 결책 프레임워크는 저비용의 제로샷 추론에서 고투자형 맞춤형 LLM까지의 확장 가능한 경로를 제공하며, 데이터 가용성, 컴퓨팅 능력, 성능 요구 사항에 따라 모델 선택을 정렬한다.
- 검색 기반 생성(Retrieval-Augmented Generation, RAG)은 외부 지식 소스에 기반한 응답 생성을 통해 금융 텍스트 생성에서 환상 현상을 효과적으로 감소시킨다.
- 콘텐츠 검열 및 출력 제한과 같은 편향 완화 기법은 LLM이 생성한 금융 콘텐츠에서 인종, 성별, 종교적 편향을 효과적으로 줄이는 데 기여한다.
- 백테스팅에서의 샤프 지수 및 총 수익과 같은 성능 지표는 거래 응용 분야에서 LLM 평가에 매우 중요하지만, 과적합을 방지하고 강건성을 확보하기 위해 정확도 지표와의 일치가 필수적이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.