Skip to main content
QUICK REVIEW

[论文解读] DIALECTIC: A Multi-Agent System for Startup Evaluation

Jae Yoon Bae, Simon Malberg|arXiv (Cornell University)|Feb 19, 2026
Private Equity and Venture Capital被引用 0
一句话总结

DIALECTIC 是一个基于大语言模型的多代理系统,收集初创企业事实,构建基于论证的支持/反对辩论,迭代改进论点,并输出决策分数以对早期创业机会进行排序。它在回测数据中实现的预测性能可与人类风投相当,同时提供一个排序的决策前沿。

ABSTRACT

Venture capital (VC) investors face a large number of investment opportunities but only invest in few of these, with even fewer ending up successful. Early-stage screening of opportunities is often limited by investor bandwidth, demanding tradeoffs between evaluation diligence and number of opportunities assessed. To ease this tradeoff, we introduce DIALECTIC, an LLM-based multi-agent system for startup evaluation. DIALECTIC first gathers factual knowledge about a startup and organizes these facts into a hierarchical question tree. It then synthesizes the facts into natural-language arguments for and against an investment and iteratively critiques and refines these arguments through a simulated debate, which surfaces only the most convincing arguments. Our system also produces numeric decision scores that allow investors to rank and thus efficiently prioritize opportunities. We evaluate DIALECTIC through backtesting on real investment opportunities aggregated from five VC funds, showing that DIALECTIC matches the precision of human VCs in predicting startup success.

研究动机与目标

  • 通过在带宽受限的情况下引入一个迭代、基于论点的评估框架,推动早期阶段风险投资筛选。
  • 开发一个结构化的以LLM为驱动的管线,用于收集事实、生成支持/反对论点、批判并改进它们,并输出投资分数。
  • 实现可解释的推理和排序,以达到或超过人类风投的准确性,同时提高筛选吞吐量。
  • 在真实世界的风险投资观察名单数据上展示预测性能,并分析证据来源如何对评估产生贡献。

提出的方法

  • 提出关于一般公司、团队、产品和市场的种子问题,并把它们分解为行业特定的子问题,以建立一个分层事实树。
  • 一个答案生成代理使用公司特征和网络搜索为问题树生成答案,形成丰富的事实库 F。
  • 在推理阶段,生成器针对每种立场产生 K 个论点,批评者提出批评,评估者通过14项标准评分,改良者迭代改进论点。
  • 论点通过生存竞争过程在 T 次改进迭代中存活,形成等量的正负集。
  • 决策分数被计算为存活的正反论点质量分数之和减去一个阈值,若分数为正则进行投资。
  • 超参数包括每次迭代的生存者数量 K_t、总迭代次数 T,以及决策阈值 tau;实现使用为 GPT-5-mini 的定制化温度设置。

实验结果

研究问题

  • RQ1在历史数据上,迭代的、基于论点的 LLM 系统是否能够在预测初创企业成功方面达到与人类风投相当的精度?
  • RQ2结构化的事实收集和辩证推理是否能够提高早期创业筛选的效率和可解释性?
  • RQ3不同证据来源(一般信息、团队、产品、市场)如何对论证质量和决策质量产生影响?
  • RQ4在回测设置中,平衡预测性能与论点质量的最优超参数(K_T、T、tau)是什么?

主要发现

  • 表现最好的配置在 T=2 次迭代、每边 K_T=4 个论点。
  • DIALECTIC 在测试集上的 AUC-PR 为 0.2422,预测能力可与人类投资者和 GPT-IO 提示基线相当。
  • 在验证数据上的预测性能超过真实的风投,而测试集的性能与基线相当。
  • 该方法输出一个完整的排序前沿,而非单一操作点,便于为筛选容量自定义阈值。
  • 证据使用显示一般公司信息和产品信息的参考占比领先,团队信息略高于可用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。