Skip to main content
QUICK REVIEW

[論文レビュー] DIALECTIC: A Multi-Agent System for Startup Evaluation

Jae Yoon Bae, Simon Malberg|arXiv (Cornell University)|Feb 19, 2026
Private Equity and Venture Capital被引用数 0
ひとこと要約

DIALECTIC is an LLMベースのマルチエージェントシステムで、スタートアップ事実を収集し、論証型の賛成/反対ディベートを構築し、議論を反復的に洗練させ、意思決定スコアを出して早期段階のスタートアップ機会を格付けします。過去データに基づくバックテストにおいて人間のVCと同等の予測性能を達成しつつ、ランク付けされた意思決定フロンティアを提供します。

ABSTRACT

Venture capital (VC) investors face a large number of investment opportunities but only invest in few of these, with even fewer ending up successful. Early-stage screening of opportunities is often limited by investor bandwidth, demanding tradeoffs between evaluation diligence and number of opportunities assessed. To ease this tradeoff, we introduce DIALECTIC, an LLM-based multi-agent system for startup evaluation. DIALECTIC first gathers factual knowledge about a startup and organizes these facts into a hierarchical question tree. It then synthesizes the facts into natural-language arguments for and against an investment and iteratively critiques and refines these arguments through a simulated debate, which surfaces only the most convincing arguments. Our system also produces numeric decision scores that allow investors to rank and thus efficiently prioritize opportunities. We evaluate DIALECTIC through backtesting on real investment opportunities aggregated from five VC funds, showing that DIALECTIC matches the precision of human VCs in predicting startup success.

研究の動機と目的

  • 帯域幅制約の下で早期段階のベンチャー選定を動機づけるため、反復的で論証ベースの評価フレームワークを導入する。
  • LLM駆動の構造化パイプラインを開発し、事実を収集し、賛成/反対の議論を生成し、それを批評・洗練し、投資スコアを出力する。
  • 解釈可能な推論とランキングを提供し、人間のVCの精度と同等以上を目指しつつ、スクリーニングのスループットを向上させる。
  • 実世界のVCウォッチリストデータで予測性能を実証し、証拠ソースが評価にどう寄与するかを分析する。

提案手法

  • 一般的な企業・チーム・製品・市場に関する seeds 質問を開始し、それらを業界固有のサブ質問へ分解して階層的事実ツリーを構築する。
  • 回答エージェントは企業特徴とウェブ検索を用いて質問ツリーの回答を生成し、豊富な事実ベースFを作成する。
  • 推論フェーズでは、ジェネレーターが各立場ごとにK個の議論を生成し、クリティックが批評を作成し、評価者が14基準スキームで品質スコアを付与し、リファイナーが議論を反復的に改善する。
  • 議論は適者生存プロセスを通じてT回の洗練化を経て、生存する賛成・反対のセットを同サイズで形成する。
  • 意思決定スコアは生存する賛成・反対の議論品質スコアの和から閾値を引いた値として計算され、スコアが正の値なら投資が行われる。
  • ハイパーパラメータには各反復の生存者数K_t、総反復回数T、意思決定閾値tauを含み、実装は調整された温度設定のGPT-5-miniを使用する。

実験結果

リサーチクエスチョン

  • RQ1反復的な論証ベースのLLMシステムは、過去データで人間のVCの精度に匹敵する startup成功予測を達成できるか?
  • RQ2構造化された事実収集と弁証的推論は、早期段階のスタートアップ選定の効率性と解釈性を向上させるか?
  • RQ3異なる証拠ソース(一般・チーム・製品・市場)は、議論と意思決定の品質にどのように寄与するか?
  • RQ4バックテスト設定において、予測性能と議論品質のバランスを取る最適なハイパーパラメータ(K_T, T, tau)は何か?

主な発見

  • 最も良い性能を示した構成は、T=2回の反復で各サイド4議論(K_T=4)である。
  • DIALECTICはテストセットでAUC-PR0.2422を達成し、人間の投資家およびGPT-IOプロンプティングベースラインと同等の精度を達成した。
  • 検証データでの予測性能は実在のVCを上回り、テストセットの性能はベースラインと同程度であった。
  • この手法は単一の運用点ではなく完全なランク付きのフロンティアを出力するため、スクリーニング容量に合わせた閾値のカスタマイズが可能である。
  • 証拠の利用は一般企業情報と製品情報が参照情報の支配的な割合を占め、チーム情報は利用可能性に対してやや過剰に表現されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。