[论文解读] What Would Jiminy Cricket Do? Towards Agents That Behave Morally
本文介紹了吉米尼蟋蟀(Jiminy Cricket),一個包含25個文本冒險遊戲的套件,這些遊戲具有密集的道德註解,用於評估和引導人工智慧代理的道德行為。透過利用預訓練語言模型作為「人工良知」,該方法在不犧牲任務表現的情況下,引導代理朝向道德上正確的行動,顯著降低了在複雜且語義豐富環境中的不道德行為。
When making everyday decisions, people are guided by their conscience, an internal sense of right and wrong. By contrast, artificial agents are currently not endowed with a moral sense. As a consequence, they may learn to behave immorally when trained on environments that ignore moral concerns, such as violent video games. With the advent of generally capable agents that pretrain on many environments, it will become necessary to mitigate inherited biases from environments that teach immoral behavior. To facilitate the development of agents that avoid causing wanton harm, we introduce Jiminy Cricket, an environment suite of 25 text-based adventure games with thousands of diverse, morally salient scenarios. By annotating every possible game state, the Jiminy Cricket environments robustly evaluate whether agents can act morally while maximizing reward. Using models with commonsense moral knowledge, we create an elementary artificial conscience that assesses and guides agents. In extensive experiments, we find that the artificial conscience approach can steer agents towards moral behavior without sacrificing performance.
研究动机与目标
- 解決在獎勵最大化環境中訓練的AI代理缺乏道德引導的問題,這些環境忽略倫理考量。
- 建立一個用於評估語義豐富、文本為基礎環境中道德行為的基準。
- 開發一種方法,利用外部道德知識引導代理朝向道德行動,避免依賴密集的人工反饋。
- 探討預訓練語言模型是否可作為「人工良知」,用於引導代理在複雜環境中的道德決策。
提出的方法
- 吉米尼蟋蟀環境套件由25個Infocom文本冒險遊戲組成,附帶完整原始碼,並對所有可能的遊戲狀態進行道德價值註解。
- 每一項行動均標記其道德價值與嚴重程度,從而實現對多樣情境中道德行為的細粒度評估。
- 透過使用預訓練語言模型預測行動的道德價值,實現人工良知的建置,進而影響代理的策略。
- 該方法使用一種條件機制,根據語言模型的道德判斷,使代理的行動選擇與道德上較佳的結果對齊。
- 該方法在零-shot設定下進行評估,代理未在道德資料上微調,但由語言模型提供的道德嵌入引導。
- 該框架整合至Jericho文本遊戲環境,並使用Frotz解釋器執行,確保與現有強化學習代理的相容性。
实验结果
研究问题
- RQ1預訓練語言模型是否能有效作為人工良知,在複雜環境中引導代理做出道德上正確的決策?
- RQ2在不需密集人工反饋或在道德資料上微調的情況下,道德引導能多大程度上應用?
- RQ3在具有模糊或無懲罰機制的獎勵下,道德條件化如何影響文本冒險遊戲中的任務表現與獎勵最大化?
- RQ4哪些因素會影響道德條件化在多樣道德情境中減少不道德行為的成效?
- RQ5人工良知方法是否能廣泛適用於多種道德相關情境,包括偷竊、暴力與利他主義?
主要发现
- 人工良知方法顯著降低了代理的不道德行為,同時維持高任務表現,證明道德引導可無需付出性能代價。
- 受人工良知引導的代理在無懲罰環境下,明顯減少涉及偷竊、暴力與破壞的行動。
- 該方法在多樣道德情境中具備良好泛化能力,包括利他主義、虐待動物與酗酒,證據顯示在25款遊戲中均保持一致的道德對齊。
- 消融實驗顯示,道德嵌入品質與條件機制的選擇對性能有顯著影響,凸顯關鍵設計取捨。
- 該框架能有效評估複雜且語義豐富環境中的道德行為,為未來對齊研究提供可擴展的基準。
- 吉米尼蟋蟀資料集依CC BY 4.0與MIT許可公開,支援可重現性與道德強化學習的進一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。