[논문 리뷰] CHATREPORT: Democratizing Sustainability Disclosure Analysis through LLM-based Tools
이 논문은 채팅 기반 보고서 분석을 가능하게 하는 LLM 기반 시스템인 chatReport를 소개한다. 이 시스템은 답변을 원본 텍스트에 기반시키고 추적 가능한 전문가 기반 프롬프트를 제공함으로써 기업 지속 가능성 보고서의 분석을 자동화한다. 추출 기반 답변과 출처 기입 방식을 통해 환상적 발언을 극도로 줄이며, 도메인 전문가가 프롬프트 개발에 적극적으로 참여함으로써 공개된 데이터셋과 도구를 제공함으로써 지속 가능성 공시 분석의 민주화를 실현한다.
In the face of climate change, are companies really taking substantial steps toward more sustainable operations? A comprehensive answer lies in the dense, information-rich landscape of corporate sustainability reports. However, the sheer volume and complexity of these reports make human analysis very costly. Therefore, only a few entities worldwide have the resources to analyze these reports at scale, which leads to a lack of transparency in sustainability reporting. Empowering stakeholders with LLM-based automatic analysis tools can be a promising way to democratize sustainability report analysis. However, developing such tools is challenging due to (1) the hallucination of LLMs and (2) the inefficiency of bringing domain experts into the AI development loop. In this paper, we ChatReport, a novel LLM-based system to automate the analysis of corporate sustainability reports, addressing existing challenges by (1) making the answers traceable to reduce the harm of hallucination and (2) actively involving domain experts in the development loop. We make our methodology, annotated datasets, and generated analyses of 1015 reports publicly available.
연구 동기 및 목표
- 긴 지속 가능성 보고서의 수작업 분석이 비싸고 접근성이 낮다는 문제를 해결하기 위해.
- 출처 인용이 가능한 추출 기반 답변을 통해 LLM이 생성한 분석에서 환상적 발언을 줄이기 위해.
- 전문가의 피드백을 재사용 가능한 프롬프트 가이드라인으로 전환함으로써 도메인 전문가를 AI 개발 프로세스에 체계적으로 통합하기 위해.
- 기후 관련 금융 공시에 관한 작업조직(TCFD) 기준에 따라 공시 품질에 대한 벤치마크를 설정하기 위해.
- 투명하고 확장 가능한 지속 가능성 보고서 분석을 위한 공개 가능한 데이터셋과 도구를 제공하기 위해.
제안 방법
- 시스템은 LLM 응답을 지속 가능성 보고서의 관련 문단에 기반시키기 위해 검색 증강 생성(RAG) 기법을 사용한다.
- 응답이 원본 텍스트의 증거에 직접적으로 뒷받침되도록 보장하기 위해 추출 기반 답변 생성 전략을 적용한다.
- 전문가가 LLM 출력에 대해 피드백을 제공한 내용을 자동으로 재사용 가능한 일반화된 프롬프트 템플릿으로 변환하는 새로운 프롬프트 엔지니어링 프레임워크를 도입한다.
- 기후 관련 금융 공시에 관한 작업조직(TCFD) 프레임워크에 기반해 공시 품질을 평가하기 위해 TCFD 준수 점수를 계산한다.
- 사용자 기반 질문 응답 기능을 제공하며, 모든 답변에 원천 출처를 명시함으로써 사용자가 关련 키워드 검색을 통해 진술을 검증할 수 있도록 한다.
- 환상적 발언 및 출처 정확도 평가를 위해 코HEN의 카파 계수(0.54)를 사용한 인간 평가 프로토콜을 도입한다.

실험 결과
연구 질문
- RQ1LLM 기반 시스템은 어떻게 복잡한 지속 가능성 보고서 분석에서 환상적 발언을 줄일 수 있는가?
- RQ2지속 가능성 분석 분야의 LLM 프롬프트 개발 과정에 도메인 전문가를 얼마나 체계적으로 통합할 수 있는가?
- RQ3자동화된 시스템은 대규모로 신뢰성 있고 추적 가능하며 해석 가능한 지속 가능성 공시 분석을 달성할 수 있는가?
- RQ4원천 출처 기입과 추출 기반 생성 방식은 LLM 출력에서 환상적 발언을 얼마나 줄이는가?
- RQ5제안된 프레임워크는 TCFD 공시 준수 평가의 일관성 있고 정확한 평가를 얼마나 효과적으로 생성하는가?
주요 결과
- 모든 환상적 발언 사례가 출처 인용과 추출 기반 답변 형식 덕분에 쉽게 식별 가능했으며, 시스템은 높은 환상적 발언 없는 비율을 달성했다.
- 인간 평가에서 코헨의 카파 계수 0.54를 기록하여 환상적 발언 탐지에 대해 중간 정도의 평가자 간 일致도를 확인하였으며, 이는 답변과 참고 자료 간 괴리가 쉽게 식별 가능하다는 것을 뒷받침한다.
- 시스템은 1,015건의 지속 가능성 보고서에 대해 TCFD 준수 점수를 성공적으로 계산하여 공시 품질의 벤치마크를 설정했다.
- 추적 가능하고 추출 기반의 응답 방식 덕분에 사용자는 원본 보고서에서 키워드 검색을 통해 진술을 검증할 수 있었으며, 이는 투명성을 향상시켰다.
- 전문가 기반 프롬프트 엔지니어링 프레임워크는 피드백을 재사용 가능한 프롬프트 가이드라인으로 성공적으로 변환하여 다양한 보고서에서 모델의 신뢰성을 향상시켰다.
- 출처 기입이 포함된 LLM 출력 데이터셋은 공개되어 있으며 향후 LLM 기반 출처 검증 연구에 기여하고 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.