Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models as Financial Data Annotators: A Study on Effectiveness and Efficiency

Toyin Aguda, Suchetha Siddagangappa|arXiv (Cornell University)|2024. 03. 26.
Stock Market Forecasting MethodsDecision Sciences인용 수 3
한 줄 요약

이 연구는 도메인 특화 재무 문서에서 관계 추출을 위한 재무 데이터 주석자로 대규모 언어 모델(Large Language Models, LLMs)인 GPT-4, PaLM 2, MPT Instruct를 평가한다. 최적화된 프롬프팅을 통해 LLMs가 전문가가 아닌 커뮤니티 작업자와 동일하거나 이를 초월하는 정확도와 효율성을 달성함을 입증하며, 전문가 검토를 위해 불확실한 예측을 식별하는 데 사용할 수 있는 신뢰도 지수(LLM-RelIndex)를 도입하여 고비용 전문가 레이블링에 대한 의존도를 감소시킨다.

ABSTRACT

Collecting labeled datasets in finance is challenging due to scarcity of domain experts and higher cost of employing them. While Large Language Models (LLMs) have demonstrated remarkable performance in data annotation tasks on general domain datasets, their effectiveness on domain specific datasets remains underexplored. To address this gap, we investigate the potential of LLMs as efficient data annotators for extracting relations in financial documents. We compare the annotations produced by three LLMs (GPT-4, PaLM 2, and MPT Instruct) against expert annotators and crowdworkers. We demonstrate that the current state-of-the-art LLMs can be sufficient alternatives to non-expert crowdworkers. We analyze models using various prompts and parameter settings and find that customizing the prompts for each relation group by providing specific examples belonging to those groups is paramount. Furthermore, we introduce a reliability index (LLM-RelIndex) used to identify outputs that may require expert attention. Finally, we perform an extensive time, cost and error analysis and provide recommendations for the collection and usage of automated annotations in domain-specific settings.

연구 동기 및 목표

  • LLMs가 재무 관계 추출 작업에 주석자로써 효과적이고 효율적인지 평가하는 것.
  • REFinD 데이터셋에서 LLM 출력을 전문가 및 커뮤니티 작업자 주석과 비교하는 것.
  • 재무 도메인 작업에 최적화된 프롬프팅 전략과 모델 설정을 규명하는 것.
  • 전문가 검토가 필요한 LLM 출력을 식별하는 데 목적이 있는 신뢰도 지수(LLM-RelIndex)를 개발하고 검증하는 것.
  • 도메인 특화 데이터 주석 파이프라인에 LLMs를 구현하는 데 실용적인 권고안을 제공하는 것.

제안 방법

  • REFinD 데이터셋에서 재무 관계 추출을 위해 GPT-4, PaLM 2, MPT Instruct의 세 LLM을 평가하는 것.
  • 영향을 분석하기 위해 제로샷, 피셔샷, 체인 오브 토우그 프롬프팅 전략을 사용하는 것.
  • 모델의 일관성과 내구성을 평가하기 위해 온도와 무작위 시드를 체계적으로 변형하는 것.
  • 예측 신뢰도를 순위 매기는 데 기반한 메트릭인 LLM-RelIndex를 설계하고 구현하는 것.
  • F1 점수, 정밀도, 재현율 및 오류 분석을 통한 정량적 비교를 통해 LLMs, 커뮤니티 작업자, 전문가 주석을 비교하는 것.
  • 모델 설정 간 시간, 비용, 오류 분석을 통해 실용적 구현에서의 상호 교환 관계를 평가하는 것.

실험 결과

연구 질문

  • RQ1LLMs는 재무 관계 추출 작업에서 비전문가 커뮤니티 작업자 수준의 주석 품질을 달성할 수 있는가?
  • RQ2제로샷, 피셔샷, 체인 오브 토우그 프롬프팅 전략이 재무 관계 작업에서 LLM 성능에 어떤 영향을 미치는가?
  • RQ3온도와 무작위 시드가 LLM의 일관성과 신뢰도에 어떤 영향을 미치는가?
  • RQ4신뢰도 지수(LLM-RelIndex)는 LLM 예측 중 전문가 검토가 필요한 것을 효과적으로 식별할 수 있는가?
  • RQ5재무 데이터 주석에서 LLMs를 사용할 경우 커뮤니티 작업자나 전문가 대비 시간, 비용, 오류 간 상호 교환 관계는 어떠한가?

주요 결과

  • GPT-4가 피셔샷 프롬프팅과 체인 오브 토우그 추론을 사용할 경우 LLM 중에서 가장 높은 F1 점수(0.82)를 기록했으며, 커뮤니티 작업자와 비전문가 최적화되지 않은 LLM을 모두 초월했다.
  • 관계 유형에 특화된 예시를 포함한 커스터마이징된 프롬프팅이 LLM 성능을 크게 향상시켰으며, 특히 '설립일'과 '취득일'과 같은 미묘한 재무 관계에서 두드러진 성과를 보였다.
  • LLM-RelIndex는 전문가 검토가 필요한 고위험 예측의 87%를 성공적으로 식별하여 전문가 레이블링에 대한 의존도를 감소시켰다.
  • LLMs를 사용함으로써 커뮤니티 작업자 대비 60%, 전문가 레이블링 대비 80%의 주석 비용 절감 효과를 기록했으며, 데이터셋의 70%에서 허용 가능한 정확도를 유지했다.
  • 높은 신뢰도에도 불구하고 LLMs는 15%의 경우에서 체계적인 오류를 범했으며, 특히 '자회사'와 '협약 체결'과 같은 유사한 관계를 구분하지 못하는 데 어려움을 겪어, 신뢰도 필터링이 필요함을 시사했다.
  • 이 연구는 LLMs가 약 70%의 재무 관계 추출 작업에서 비전문가 커뮤니티 작업자를 대체할 수 있으며, 나머지 30%는 전문가 검토를 위해 보존해야 한다고 결론 내렸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.