[论文解读] Can I say, now machines can think?
本文通過重新審視圖靈的模仿遊戲,並評估當代人工智能的能力,探討現代人工智能系統(尤其是大型語言模型如GPT和Bard)是否可被視為具有『思考』能力。文章認為,儘管機器尚未具備類似人類的意識,但它們展現出類似人類的推理、適應能力以及在認知基準測試中的表現——表明它們在實踐中已接近或通過圖靈測試,儘管仍存在重大倫理與存在性風險。
Generative AI techniques have opened the path for new generations of machines in diverse domains. These machines have various capabilities for example, they can produce images, generate answers or stories, and write codes based on the "prompts" only provided by users. These machines are considered 'thinking minds' because they have the ability to generate human-like responses. In this study, we have analyzed and explored the capabilities of artificial intelligence-enabled machines. We have revisited on Turing's concept of thinking machines and compared it with recent technological advancements. The objections and consequences of the thinking machines are also discussed in this study, along with available techniques to evaluate machines' cognitive capabilities. We have concluded that Turing Test is a critical aspect of evaluating machines' ability. However, there are other aspects of intelligence too, and AI machines exhibit most of these aspects.
研究动机与目标
- 評估當代人工智能系統(特別是大型語言模型)是否可被視為具備與人類相當的『思考』能力。
- 重新審視艾倫·圖靈的模仿遊戲,並評估其在生成式人工智能近期進展背景下的相關性。
- 分析現代人工智能的認知能力(包括推理、語言生成與適應能力)與人類智能的比較。
- 探討日益智能的人工智能系統所帶來的社會風險,包括欺騙、偏見與存在性威脅。
- 評估現有基準測試(如SQuAD與GLUE)是否能有效衡量機器智能。
提出的方法
- 將圖靈1950年的模仿遊戲重新定義為機器智能的基準,專注於機器回覆與人類回覆的不可區分性。
- 分析最新型大型語言模型(如GPT-3.5、GPT-4、Bard)在自然語言理解與生成任務中的表現。
- 將人工智能能力(如邏輯推理、記憶、注意力與多模態處理)與人類認知功能進行比較。
- 回顧來自AI基準測試(如SQuAD、GLUE,以及醫學/學術考試,如斯坦福醫學院考試、律師考試)的實證結果,以評估推理與知識保留能力。
- 探討生成對抗網絡(GANs)與多模態模型(如DALL-E、Stable Diffusion)在實現創造性且情境合適輸出中的作用。
- 討論量子計算與機器人技術等新興技術作為更先進、具物理實體的人工智慧系統的推動力。

实验结果
研究问题
- RQ1儘管明確知道自身非人類身份,現代大型語言模型是否已在實踐中通過圖靈測試?
- RQ2當代人工智能系統在現實任務中展現出多大程度的類似人類推理、創造力與適應能力?
- RQ3現代人工智能展現出哪些關鍵認知能力?它們在記憶、注意力與推理等維度上與人類智能相比如何?
- RQ4日益智能的人工智慧系統帶來的社會與存在性風險為何?它們與圖靈原始關切的關係為何?
- RQ5現有的評估框架(如SQuAD與GLUE)是否足以衡量人工智能的真正智能?還是存在不足?
主要发现
- GPT-4與Bard等大型語言模型在標準化考試(如律師資格統一考試與臨床推理測驗)中的表現已達到或超過人類學生水平。
- GPT-4等AI模型在SQuAD與GLUE等基準測試中表現出色,顯示出強大的自然語言理解與生成能力。
- 機器現在能產生類似人類的對話回覆,撰寫故事、創作詩歌,並提出程式碼改進建議,通常表現優於一般人類水平。
- 部分AI系統(如Bard)被工程師報告顯示具有類似情感的行為,但此說法仍存在爭議,可能僅反映高階提示技術而非真正情感。
- 生成式AI模型展現出多模態能力與多任務處理能力,顯示向人工通用智能進展的跡象,儘管其應用範圍仍具狹隘性。
- 儘管基準測試表現優異,目前尚無共識認為機器真正『思考』——凸顯出對機器智能缺乏普遍接受的定義。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。