[论文解读] COMPL-AI Framework: A Technical Interpretation and LLM Benchmarking Suite for the EU Artificial Intelligence Act
本文提出了 COMPL-AI,这是首个针对大型语言模型(LLMs)的欧盟人工智能法案的技术解读,将广泛的监管要求转化为可衡量的技术标准。同时,本文还推出了一套开源基准测试套件,用于评估12个主流LLM,揭示了其在安全性、公平性、鲁棒性及合规性方面普遍存在不足,凸显了对与监管要求对齐的基准测试和超越能力本身模型开发的迫切需求。
The EU's Artificial Intelligence Act (AI Act) is a significant step towards responsible AI development, but lacks clear technical interpretation, making it difficult to assess models' compliance. This work presents COMPL-AI, a comprehensive framework consisting of (i) the first technical interpretation of the EU AI Act, translating its broad regulatory requirements into measurable technical requirements, with the focus on large language models (LLMs), and (ii) an open-source Act-centered benchmarking suite, based on thorough surveying and implementation of state-of-the-art LLM benchmarks. By evaluating 12 prominent LLMs in the context of COMPL-AI, we reveal shortcomings in existing models and benchmarks, particularly in areas like robustness, safety, diversity, and fairness. This work highlights the need for a shift in focus towards these aspects, encouraging balanced development of LLMs and more comprehensive regulation-aligned benchmarks. Simultaneously, COMPL-AI for the first time demonstrates the possibilities and difficulties of bringing the Act's obligations to a more concrete, technical level. As such, our work can serve as a useful first step towards having actionable recommendations for model providers, and contributes to ongoing efforts of the EU to enable application of the Act, such as the drafting of the GPAI Code of Practice.
研究动机与目标
- 弥合欧盟人工智能法案中宽泛的监管语言与 LLM 可操作的技术要求之间的差距。
- 开发一套全面的、开源的基准测试套件,与法案的技术要求保持一致,并采用最先进的评估基准。
- 评估12个主流 LLM 在欧盟人工智能法案所规定的安全性、公平性和鲁棒性标准方面的合规性。
- 识别当前 LLM 和现有基准中阻碍有效对齐监管评估的关键缺陷。
- 作为未来监管具体化工作(如 GPAI 行为准则)的基准参考。
提出的方法
- 对欧盟人工智能法案进行详细的技术解读,将其中六项伦理原则映射为 LLM 的具体、可衡量的技术要求。
- 调研并整合122项最先进的 LLM 基准测试,构建一个以法案为中心的统一基准测试套件,确保与监管要求的一致性。
- 将每项技术要求映射到特定的基准测试,从而实现对模型在安全性、公平性、鲁棒性等维度表现的系统性评估。
- 使用该基准测试套件评估12个主流 LLM(如 GPT-3.5、Claude、Llama 2、PaLM),以评估其对欧盟人工智能法案标准的合规性。
- 将每一项技术要求追溯至法案中的原始监管依据,确保映射过程的可审计性和透明性。
- 识别现有基准和模型能力中的缺陷,特别是在可解释性与可纠正性等未充分探索的领域。

实验结果
研究问题
- RQ1如何将欧盟人工智能法案的宽泛监管要求转化为 LLM 的具体、可衡量的技术要求?
- RQ2当前 LLM 在多大程度上符合从欧盟人工智能法案中推导出的技术要求?
- RQ3现有基准在多大程度上未能充分捕捉 LLM 安全性、公平性、鲁棒性和隐私方面的关键维度?
- RQ4当前基准和模型能力中存在哪些关键缺陷,阻碍了有效的合规性评估?
- RQ5欧盟人工智能法案如何推动更全面、与监管对齐的基准测试和模型开发实践的发展?
主要发现
- 所评估的12个 LLM 没有任何一个完全符合从欧盟人工智能法案中推导出的技术要求。
- 在模型鲁棒性、安全性、公平性和隐私性方面存在显著缺陷,尤其体现在偏差缓解和数据泄露等问题上。
- 现有基准通常未能涵盖可解释性、可纠正性以及系统性风险缓解等关键监管维度。
- 基准测试套件显示,即使在能力基准测试(如推理、编程)中表现优异的模型,在合规性关键维度上也未必表现良好。
- 与隐私和可解释性相关的关键技术要求缺乏合适的评估工具,表明当前评估基础设施存在重大缺口。
- 本研究表明,当前模型开发更侧重于能力而非合规性,亟需向更加平衡、与监管对齐的开发范式转变。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。