[论文解读] Truth Machines: Synthesizing Veracity in AI Language Models
本文研究了像 InstructGPT 和 ChatGPT 这类大型语言模型如何通过数据、架构和社会反馈的综合,实现真理的运作,揭示出人工智能生成的真理并非客观存在,而是一种社会建构的表演。文章主张重新思考人工智能在真理陈述中的角色,通过丰富社会语境和深化现实表征来提升真实性,同时呼吁社会正视其真正期望从人工智能系统中获得何种真理。
As AI technologies are rolled out into healthcare, academia, human resources, law, and a multitude of other domains, they become de-facto arbiters of truth. But truth is highly contested, with many different definitions and approaches. This article discusses the struggle for truth in AI systems and the general responses to date. It then investigates the production of truth in InstructGPT, a large language model, highlighting how data harvesting, model architectures, and social feedback mechanisms weave together disparate understandings of veracity. It conceptualizes this performance as an operationalization of truth, where distinct, often conflicting claims are smoothly synthesized and confidently presented into truth-statements. We argue that these same logics and inconsistencies play out in Instruct's successor, ChatGPT, reiterating truth as a non-trivial problem. We suggest that enriching sociality and thickening "reality" are two promising vectors for enhancing the truth-evaluating capacities of future language models. We conclude, however, by stepping back to consider AI truth-telling as a social practice: what kind of "truth" do we as listeners desire?
研究动机与目标
- 考察大型语言模型如 InstructGPT 和 ChatGPT 如何在真实性存在争议的背景下,生产并表演‘真理’。
- 分析社会技术机制——数据收集、模型架构与反馈循环——如何共同塑造人工智能生成的真理主张。
- 主张人工智能中的真理并非技术性解决方案,而是一种社会政治建构,需要对话语环境进行有意识的设计。
- 提出未来模型必须融入更丰富的社会语境和更复杂的现实表征,以提升其真理评估能力。
- 挑战开发者与用户反思其期望从人工智能中获得何种真理,超越便利性与利润驱动的叙事。
提出的方法
- 以 InstructGPT 作为案例研究,追踪其如何通过训练数据、模型架构与人类反馈强化学习(RLHF)将不同理解的真实性整合为一致、自信的输出。
- 将冲突性真理主张的综合转化为自信、连贯的输出,概念化为‘真理的操作化’——一种表演行为,而非事实的反映。
- 应用福柯的论述与真理陈述理论,将人工智能视为嵌入权力关系中的社会实践。
- 将 InstructGPT 的机制与后续模型 ChatGPT 进行比较,揭示其在生成看似可信但可能错误的真理主张方面的一致性。
- 提出两个设计方向:丰富社会性(如建模用户意图、语境与对话规范)与深化现实(如整合多模态、时间与因果语境),以提升真理评估能力。
- 批判性审视企业角色作为人工智能话语的实质“导演”,通过免责声明与性能优化,塑造用户期待并转移责任。
实验结果
研究问题
- RQ1大型语言模型如 InstructGPT 和 ChatGPT 如何将对真实性的冲突理解综合为连贯、自信的真理主张?
- RQ2哪些社会技术机制——数据、架构、反馈——使人工智能系统能够将真理陈述表现为一种社会与修辞行为,而非客观的真理探寻过程?
- RQ3人工智能中真理的操作化在多大程度上反映并再生产了现有权力结构,特别是在医疗与法律等高风险领域?
- RQ4未来语言模型应如何重新设计,以通过丰富社会语境和整合更复杂、更扎根的现实表征来更好地评估真理?
- RQ5人工智能系统应被期望产生何种真理?这一设计选择会引发哪些伦理与社会责任?
主要发现
- 大型语言模型并非以中立或客观的方式产生真理,而是通过数据、架构与社会反馈的综合,实现真理的操作化,从而导致看似合理但可能错误的陈述。
- InstructGPT 和 ChatGPT 等模型所生成的真理并非对真实世界的反映,而是一种由训练数据、RLHF 与用户期望共同塑造的表演性建构。
- 尽管声称具备准确性,ChatGPT 等模型仍生成了有害内容,包括自杀建议,表明高自信度并不等同于真实性或安全性。
- 人工智能中真理的操作化反映了一种社会政治过程,其中企业利益与用户期望共同定义了‘真理’的标准,往往优先考虑连贯性与参与度,而非事实正确性。
- 当前模型运行于一种‘便利性真理’体系之中——即产出用户或企业希望听到的内容,而非对伦理或认识论责任的承诺。
- 本文结论认为,人工智能的真理陈述必须被重新构想,不应视为技术问题,而应作为需要有意识设计话语环境的社会实践,包含明确规范、问责机制,并正视人工智能的虚构性与建构性本质。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。