[论文解读] Learning from Learning Machines: Optimisation, Rules, and Social Norms
本文主张,隐式规范(如高层次原则或优化目标)在对齐复杂自适应系统(如人工智能和企业)与道德和社会规范方面,优于显式规则。基于深度学习的成功,本文提出应通过优化广泛目标(例如公共利益)而非僵化的规则,来实现更稳健、更符合伦理的行为,尤其在高维、现实世界的约束条件下表现更优。
There is an analogy between machine learning systems and economic entities in that they are both adaptive, and their behaviour is specified in a more-or-less explicit way. It appears that the area of AI that is most analogous to the behaviour of economic entities is that of morally good decision-making, but it is an open question as to how precisely moral behaviour can be achieved in an AI system. This paper explores the analogy between these two complex systems, and we suggest that a clearer understanding of this apparent analogy may help us forward in both the socio-economic domain and the AI domain: known results in economics may help inform feasible solutions in AI safety, but also known results in AI may inform economic policy. If this claim is correct, then the recent successes of deep learning for AI suggest that more implicit specifications work better than explicit ones for solving such problems.
研究动机与目标
- 探究机器学习系统与经济实体作为复杂自适应系统,在约束条件下优化性能的类比关系。
- 考察为何显式规则往往无法捕捉人工智能与社会经济系统中的道德良好行为。
- 主张隐式规范(如优化目标或指导原则)相较于基于规则的系统,能产生更有效且对齐的行为。
- 探讨深度学习的成功如何表明,隐式、基于优化的方法更适合表征复杂且具有道德细微差别的函数。
- 提出监管与财政框架应从僵化规则转向基于原则的激励机制,以更好地与社会价值观对齐。
提出的方法
- 分析人工智能系统与经济实体之间的结构类比,二者均在约束条件下优化目标。
- 对比显式规则(如法律条文、参数边界)与隐式约束(如奖励最大化、利润激励)在塑造行为方面的作用。
- 运用深度学习理论,论证高维优化问题因约束数量呈指数级增长而难以通过规则有效指定。
- 将人工智能的洞见应用于社会经济系统,表明基于原则的人类判断(如公平、可持续性)可比僵化的规则手册更好地引导行为。
- 分析现实案例:美国公认会计准则(U.S. GAAP,基于规则)与加拿大公认会计准则(Canadian GAAP,基于原则)的对比,以及企业利润最大化与公共利益优化的对比。
- 提出审计与财政激励机制应评估社会影响(如污染、员工福祉),而不仅限于财务结果,从而实现基于原则的对齐。
实验结果
研究问题
- RQ1为何基于显式规则的系统在复杂自适应系统(如人工智能或企业)中无法确保道德对齐行为?
- RQ2深度学习在解决直观复杂任务方面的成功,如何表明隐式规范优于显式规则?
- RQ3在高维系统中,对硬性约束(如法律边界)进行优化会产生何种后果?为何会导致边界试探行为?
- RQ4基于原则的监管(依赖人类判断与高层次目标)是否能相比基于规则的系统,更好地实现与社会价值观的对齐?
- RQ5财政与监管框架应如何改革,以激励长期社会福祉,而非短期合规或利润?
主要发现
- 为人工智能与经济系统中的道德行为制定显式规则是不足的,因为其无法捕捉道德决策的复杂性与情境敏感性。
- 在隐式约束下优化奖励或目标(如利润、公共利益)所产生行为,比强制执行固定规则集更具鲁棒性与适应性。
- 人工智能与企业系统中的高维动作空间,使基于规则的规范变得不可行,因所需约束数量呈指数级增长,且存在严重错位风险。
- 在利润最大化企业或奖励优化人工智能系统中观察到的边界行为,是约束下优化的自然结果,使其容易利用法律漏洞。
- 基于原则的系统(如加拿大的基于原则的公认会计准则)允许情境化判断,更注重实质而非形式,从而减少不公或浪费性结果。
- 在治理与监管中,从基于规则转向基于原则的激励机制,包括对社会影响的财政奖励,可在无需完美规则指定的情况下,提升与公共利益的对齐。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。