[논문 리뷰] Large Language Model in Financial Regulatory Interpretation
이 논문은 복잡한 금융 규제, 특히 베사르 III 시장 리스크 규정을 해석하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 체계적으로 활용하는 프레임워크를 제안한다. 구체적으로 정밀한 프롬프트 설계와 문서 로딩 방법을 최적화하여 GPT-4가 상관관계 식별에서 96.5%의 정확도와 버킷 분류에서 85%의 정확도를 기록함으로써, 난이도 높은 프롬프트나 다른 LLM들보다 뛰어난 성능을 보였다.
This study explores the innovative use of Large Language Models (LLMs) as analytical tools for interpreting complex financial regulations. The primary objective is to design effective prompts that guide LLMs in distilling verbose and intricate regulatory texts, such as the Basel III capital requirement regulations, into a concise mathematical framework that can be subsequently translated into actionable code. This novel approach aims to streamline the implementation of regulatory mandates within the financial reporting and risk management systems of global banking institutions. A case study was conducted to assess the performance of various LLMs, demonstrating that GPT-4 outperforms other models in processing and collecting necessary information, as well as executing mathematical calculations. The case study utilized numerical simulations with asset holdings -- including fixed income, equities, currency pairs, and commodities -- to demonstrate how LLMs can effectively implement the Basel III capital adequacy requirements. Keywords: Large Language Models, Prompt Engineering, LLMs in Finance, Basel III, Minimum Capital Requirements, LLM Ethics
연구 동기 및 목표
- GPT-4와 같은 대규모 언어 모델(LLMs)을 활용해 베사르 III 시장 리스크 규정과 같은 매우 복잡하고 긴 금융 규제를 해석하는 데 도전하는 것.
- LLMs가 금융 규제 해석에서 겪는 주요 한계, 즉 낮은 수학적 추론 능력과 프롬프트 설계에 대한 민감성 등을 특정하고 이를 완화하는 것.
- LLM의 정확도를 향상시키기 위해 규제 요구사항을 추출하는 데 도움이 되는 체계적인 프롬프트 엔지니어링 및 문서 로딩 프레임워크를 개발하는 것.
- GPT-4, GPT-3.5, 클로드-3, 지미-1.5와 같은 여러 LLM의 규제 텍스트 해석 작업에서의 성능을 평가하고 비교하는 것.
- 실제 자산 보유 상황을 반영한 사례 연구를 통해 프레임워크의 유효성을 검증하는 것 — 특히 베사르 III의 시장 리스크에 대한 최소 자본 요구사항에 초점
제안 방법
- 규제 요소(예: 리스크 버킷, 가중치, 상관관계 등)를 통합한 체계적인 프롬프트 엔지니어링 방법론을 설계하여 LLM이 정확한 해석으로 이끌 수 있도록 유도하는 것.
- 규제 문서의 PDF 및 이미지 입력 방식을 비교함으로써 문서 로딩 방법을 평가하고, 이미지 형식의 시각적 파싱 이점을 활용하는 것.
- 수작업으로 정제한 베사르 III 규제 텍스트 데이터셋을 기반으로 GPT-3.5, GPT-4, 클로드-3-오퍼스, 지미-1.5-프로의 LLM 성능을 비교 테스트한 것.
- 고정수익증권, 주식, 외환, 상품 등의 수치 시뮬레이션을 구현하여 LLM이 생성한 자본 요구사항 계산의 수학적 정확도를 검증한 것.
- 수식, 법적 용어, 표, 각주 등에서 발생하는 파싱 오류를 식별하고 해결하기 위한 트러블슈팅 프로세스를 적용한 것.
- 엔드 투 엔드 파이프라인 테스트를 위해 사례 연구 프레임워크를 적용함: 문서 입력 → 프롬프트 처리 → 규제 추출 → 수학적 계산

실험 결과
연구 질문
- RQ1GPT-4, GPT-3.5, 클로드-3, 지미-1.5와 같은 다양한 LLM들이 베사르 III 규제 텍스트에서 자본 요구사항을 추출하고 계산하는 데 어떻게 성능을 내는가?
- RQ2PDF 대비 이미지 형식의 문서 로딩 방식이 복잡한 규제 문서(텍스트, 수식, 표, 각주 포함)를 해석하는 데 있어 LLM의 정확도에 어떤 영향을 미치는가?
- RQ3엔지니어링된 프롬프트 설계가 난이도 높은 프롬프트에 비해 리스크 버킷, 가중치, 상관관계 식별 성능을 얼마나 향상시키는가?
- RQ4정확한 프롬프트 설계와 최적의 입력 형식을 통해 안내받는 LLM이 베사르 III의 시장 리스크 프레임워크 하에서 최소 자본 요구사항을 정확히 계산할 수 있는가?
- RQ5LLMs가 금융 규제 해석에서 겪는 주요 실패 유형은 무엇이며, 이를 체계적으로 완화할 수 있는가?
주요 결과
- 세부적인 프롬프트를 사용할 경우 GPT-4는 리스크 가중치 식별에서 100%의 정확도를 기록했으며, 리스크 버킷 분류에서는 85%의 정확도를 달성했고, 이는 난이도 높은 프롬프트의 65.5%보다 뚜렷이 높은 성능이었다.
- 문서를 이미지 형식으로 로드했을 경우 GPT-4는 상관관계 식별에서 96.5%의 정확도를 기록했고, PDF로 로드했을 경우 68%에 그쳤다. 이는 시각적 입력 방식에서 뛰어난 성능을 보임을 시사한다.
- 클로드-3-오퍼스는 이미지 로딩 시 97.5%의 정확도를 기록했고, PDF로 로딩했을 경우 76.5%에 머물렀다. 이는 복잡한 레이아웃에서 이미지 기반 파싱의 우수성을 보여준다.
- GPT-3.5는 복잡한 계산에서 완전히 실패하여 정확도가 0%였지만, 규제 내용 식별에서는 정확하게 파악했다. 이는 그가 수학적 추론 능력에서의 한계를 보여준다.
- 지미-1.5-프로는 상관관계 식별에서 58%의 정확도를 기록했고, 중간 수준의 성능을 보였지만 여전히 GPT-4의 이미지 입력 기반 96.5%에 못 미쳤다.
- 이 연구는 프롬프트 엔지니어링과 문서 형식이 핵심 요소임을 확인했다. GPT-4의 상관관계 탐지 정확도는 PDF에서 이미지로 전환함으로써 68%에서 96.5%로 상승했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.