[論文レビュー] ESGReveal: An LLM-based approach for extracting structured data from ESG reports
ESGReveal は、三重構造アーキテクチャ(ESGメタデータ、レポート前処理、LLMエージェントモジュール)を備えたリtrieval-augmented LLMフレームワークであり、企業レポートから構造化されたESGデータを抽出する。GPT-4を用いた実験では、データ抽出で76.9%、開示分析で83.7%の正確性を達成し、ベースラインを著しく上回った。166社の香港上場企業を対象とした分析では、環境分野の開示率が69.5%、社会分野が57.2%と低水準にとどまり、透明性の向上に余地があることが明らかになった。
ESGReveal is an innovative method proposed for efficiently extracting and analyzing Environmental, Social, and Governance (ESG) data from corporate reports, catering to the critical need for reliable ESG information retrieval. This approach utilizes Large Language Models (LLM) enhanced with Retrieval Augmented Generation (RAG) techniques. The ESGReveal system includes an ESG metadata module for targeted queries, a preprocessing module for assembling databases, and an LLM agent for data extraction. Its efficacy was appraised using ESG reports from 166 companies across various sectors listed on the Hong Kong Stock Exchange in 2022, ensuring comprehensive industry and market capitalization representation. Utilizing ESGReveal unearthed significant insights into ESG reporting with GPT-4, demonstrating an accuracy of 76.9% in data extraction and 83.7% in disclosure analysis, which is an improvement over baseline models. This highlights the framework's capacity to refine ESG data analysis precision. Moreover, it revealed a demand for reinforced ESG disclosures, with environmental and social data disclosures standing at 69.5% and 57.2%, respectively, suggesting a pursuit for more corporate transparency. While current iterations of ESGReveal do not process pictorial information, a functionality intended for future enhancement, the study calls for continued research to further develop and compare the analytical capabilities of various LLMs. In summary, ESGReveal is a stride forward in ESG data processing, offering stakeholders a sophisticated tool to better evaluate and advance corporate sustainability efforts. Its evolution is promising in promoting transparency in corporate reporting and aligning with broader sustainable development aims.
研究の動機と目的
- 企業や業界を横断した指標を統合する公開可能で詳細な ESG 開示データベースの不足に対処すること。
- 高度な LLM とリtrieval-augmented generation (RAG) を用いて、非構造化レポートからの ESG データ抽出の正確性と一貫性を向上させること。
- さまざまな LLM が ESG 特化タスクにおけるデータ抽出および分析に果たす性能を評価・ベンチマーク化すること。
- 香港証券取引所の12業界にまたがる開示を分析することで、ESG報告の透明性のギャップを同定すること。
- ステークホルダーの意思決定や規制監視を支援する、スケーラブルで柔軟なフレームワークを構築すること。
提案手法
- ESGReveal フレームワークは、大規模言語モデル(LLM)とリtrieval-augmented generation(RAG)を統合し、ESGレポートからの文脈認識型データ抽出を強化する。
- ESGメタデータモジュールは、LLMによる意味的理解を活用して、多様なESG報告基準(例:GRI、SASB)を構造化された抽出コマンドにマッピングする。
- レポート前処理モジュールは、生のESGレポートを機械可読形式に解析・構造化し、効率的なリトリーブとインデキシングを可能にする。
- LLMエージェントモジュールは、ドメイン固有の知識に基づいたRAG強化型プロンプトを用い、文脈認識型で数値的およびテキスト的ESG指標を抽出する。
- システムはGPT-4やその他のLLMを用いてデータ抽出および開示分析を実行し、人的アノテーション基準との比較によって性能を評価する。
- 拡張可能なメタデータスキーマとリファレンスデータベースからの関連ESG基準の動的リトリーブにより、多基準対応性を実現する。

実験結果
リサーチクエスチョン
- RQ1LLMベースのRAGフレームワークは、非構造化企業レポートからの構造化ESGデータ抽出にどの程度効果的か?
- RQ2GPT-3.5 や GPT-4 などの異なるLLMは、ESGデータ抽出および開示分析タスクにおいて、どのように性能を発揮するか?
- RQ3さまざまな業界にまたがる企業は、環境的・社会的・ガバナンス的指標をどの程度開示しているのか。その背後にはどのようなパターンが存在するか?
- RQ4ESGメタデータモジュールは、多基準ESG報告環境においてLLMのパフォーマンスをどのように向上させるか?
- RQ5画像や図表などの非テキストデータを扱う際、現在のLLMベースESG抽出システムの主な制限は何か?
主な発見
- GPT-4 は、構造化データ抽出で76.9%、開示分析で83.7%の正確性を示し、ベースラインモデルを20%以上上回った。
- ESGメタデータモジュールは、GPT-4 の性能を2.5ポイント、GPT-3.5 の性能を9.9ポイント向上させた。
- 環境分野の開示率は平均69.5%、社会分野は平均57.2%であり、企業の透明性向上に大きな余地があることが示された。
- 業界全体のESG開示率は80%を上回ることはなく、報告の完全性にシステム的ギャップが存在することが明らかになった。
- 業界横断的に共通するESG行動として「排出削減」や「デジタルヘルスの推進」が同定された。金融業界では「グリーンファイナンス」、工業部門では「サステナブルサプライチェーン」といったセクター固有の行動も確認された。
- フレームワークは、香港証券取引所に上場する12業界・166社にわたり高い適応性を示し、業界横断的なベンチマーキングを可能にした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。