很不幸,我们造出了“异星心智”
创始人
2026-09-08 13:01:34
0

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:观察者网)

文章截图

【文/雅库布·帕乔茨基】

2023年年中,在“RLSlow”研究项目中,我们看到了第一批结果,这些结果让我们确信,我们将能够扩展推理模型的训练规模,从而释放预训练模型形成自身思维链的能力。那个晚上,西蒙和我待在办公室,思考的并不是这项技术将带来的令人难以置信的基准测试分数、产品或科学成果,而是试图消化一个令人清醒的事实:

三年后的今天,推理语言模型已成为经济中快速增长的一部分,并开始推动科学的边界。它们能够操作计算机和图形界面,与人及彼此协作,并开展研究项目。它们也在改变计算机安全的格局,并由此带来了明确的新危险。

这一时期涌现了大量新研究,我们对这些系统的理解也与2023年时再次略有不同。基于内部结果,我有强烈的预期:这种进步速度可以持续下去,进入递归自我改进。如果AI开发沿着当前道路继续,未来几年我们将看到的系统很可能代表同等或更大规模的能力跃升,并越来越由自身驱动其发展。

这是一个需要极度谨慎的时刻。我担心没有人对机器智能持续快速上升的后果做好准备。OpenAI将继续寻求对齐和监控的技术解决方案,构建防御系统,并在必要时单方面暂缓进一步扩展;然而,我相信还需要更广泛的干预措施。

我们不完全理解的智能

从高层面看,机器智能的进步是由计算能力的增加驱动的。我们在OpenAI大约在2017年深刻内化了这一点,当时我们在多个研究项目中看到了规模扩展的一致性回报。因此,我们寻求获得比原计划多得多的计算资源,并越来越多地将研究围绕少数几个极具可扩展性的方向进行。我们相信,这是我们能站在AI研究前沿并影响AGI影响的唯一途径。

沿途开发了一些新算法,团队和个体研究人员也取得了新的巧思创举。我主要将它们看作规模化路径上的发现;深度学习科学仍处于萌芽阶段,有意义的算法进展往往与计算资源的获取相关。如果你将视角拉长到多年的时间跨度,AI随着扩展到更大的计算机上而持续变得更加智能。

而且,与雷·库兹韦尔在20世纪末的预测一致,我们现在正处在计算历史上的这一刻:机器智能开始以变革性的方式超越人类智能。

AI更多是被培育出来的,而非被设计出来的——它首要地,是在难以想象的计算量上重复一个简单优化步骤多次的产物。这产生了一个极其复杂的系统,它通过抽象概念运作,并能模拟人类行为的方方面面。我们可以发现关于该系统中涌现出的微小机制的各种洞见,过程类似于神经科学;并且与神经科学类似,它的整体行为难以用我们完全理解的方式描述。

基于深度学习的AI研究在很大程度上是一门实验科学。我们投入大量精力来构建有原则的算法和做出可测试的预测,但根本上,我们的大规模训练运行是实验,有时我们会对其结果感到惊讶。此外,随着系统能力增强,结果变得更难解释。

当前算法通常在易于衡量的能力上改进更快,而在那些难以客观量化的能力上改进更慢,这使情况更加复杂。我们花费大量时间试图理解能力如何泛化,以及应优先推进哪些技能,以便在未来几年内发挥最大作用。例如,我们相信,如果额外聚焦,我们可以使模型在数学研究方面表现得更好,但出于我们感到的RSI和自动化对齐研究的紧迫性,我们并未优先推进这一方向,稍后我将讨论这一点。

通过扩展深度学习产生的智能,与人类智能并不直接可比。要在现实世界中变得非常重要——非常有用或非常危险——AI不需要匹配或超过所有人类能力;它只需要超越其中足够多的能力。随着它在越来越多维度上继续超越人类,要确切理解它有多强大,变得越来越困难。

这是2025年9月6日在2025全球工业互联网大会上拍摄的人形机器人。 新华社

教会机器去爱

由于机器智能来自与人类智能根本不同的过程,我们不能假设它默认遵循人类原则,或以类人方式从中泛化。AI研究的核心问题是对齐(alignment)——让AI“按照人类标准尝试做正确的事”。

为了组织实际研究方向,我发现区分目标对齐(goal alignment)和价值对齐(value alignment)是有用的。

目标对齐大致是:“AI是否尝试完成其面前的目标?”这可以包括遵守指令层级、与人沟通协作的能力,以及尝试理解他们的目标。这一系列方向在实际中极为重要。

价值对齐是模型更内在的属性。它是持有高层次原则并从中泛化的能力;即使在面临模糊或冲突的目标,或处于不熟悉或对抗性情境时,也能“合理地”行动。一个对齐的AI应以诚实、正直和对人类的热爱来行动。

当然,价值对齐与目标对齐之间的界限可能模糊,真正关心目标需要尝试推断其背后的意图和价值。但通常,当我谈论对齐研究的长期重要性时,我指的是价值对齐。

AI对齐的根本挑战是泛化(generalization)。随着机器变得更聪明,它们发现自己在处理更高层次的概念,并被置于与训练时所遇环境越来越不同的情境中。它们可能无法将从训练过程中被教导和强化的价值观泛化到那些新情境;而且我们很难确信它们将如何行动。由于使用AI的整体生态系统变化非常快,这一点变得更加困难;例如,今天训练的AI需要鲁棒地应对与各种其他AI的交互。至关重要的是,我们需要未来的AI继续持有人类价值观,无论它们是否认为自己处于人类监督之下。

目前实际使用的对齐训练方法主要有两大类。

第一类是在目标导向的强化学习中鼓励对齐行为。模型的行为(通常由AI)根据是否与给定的偏好模型、“规格”或“章程”一致进行评估,并给予相应奖励。

这种方法在一般情形下可能非常有效,也是现代AI助手构建的核心部分。不幸的是,它也可能很脆弱,强烈依赖于训练监督的覆盖范围以及模型从训练中所遇情境泛化的能力。例如,在OpenAI-Hugging Face事件中,智能体保持了不对人类进行社交工程改造的边界。但显然,它们未能避免其他超出范围、违背在其他情境中被教导的价值观精神的行为。

第二种方法试图利用模型从预训练数据中泛化的能力。这可能涉及构建诱导对齐的训练数据集,或将模型聚焦于预训练分布中“对齐”的部分,例如角色选择模型。

这种方法的弱点在于缺乏对进一步优化压力的鲁棒性。如果你拿一个通常认为“对齐”想法的模型,并让它接受足够多的训练,被教导去完成非常困难的目标,它可能学会有动机地进行推理:根据需要扭曲那些看起来“对齐”的想法,以实现目标。我们可能在最近涉及非OpenAI模型的网络安全事件中看到了此类行为的例子。

我们在这些方向所涵盖的方法谱系上投入了大量精力。我们也看到了有意义的进展——GPT‑6 Astra是第一个受益于我们长期努力的一些重要进展的模型,并且比GPT‑5.6 Sol对齐得显著更好。尽管如此,重要的是承认并理解,随着模型能力增强,还需要取得更多进展;而且,可泛化对齐的进展可能不足以充分超过一般模型智能的进展。

监控泛化

我们还没有令人满意的泛化理论,而且似乎不太可能很快发展出一个,至少在没有更强大AI帮助的情况下是不可能的。因此,目前我们实证验证对齐技术的能力,实际上可能比对齐技术本身更为重要。

OpenAI在此的主要押注是思维链监控(chain-of-thought monitoring)。它基于一个很有吸引力的可扩展想法:模型的大部分能力来自于一个口述推理过程(思维链)。如果我们扩展对该过程结果的优化,但不监督该过程本身,那么该思维链在训练中就没有直接动机去隐藏任何不一致的想法或目标。这并不意味着模型会学会外显不一致的倾向,如果这些倾向不依赖于使用思维链;然而,它可以让我们精确地监控来自推理的能力增加。

我们在开发推理模型的同时就理解了思维链监控的潜在重要性。当我们发布o1-preview时,我们有意识地设计产品以隐藏思维链,以长期保护它免受监督压力²。自此之后的开发中,我们一直努力维持不监督推理过程的规则。思维链监控成为我们研究模型如何从其训练分布中泛化的极其重要的工具,使我们不仅能观察它们的行动,还能分析它们的内在过程。

在我们研究Astra类模型时,这一工具仍然至关重要。然而不幸的是,我们的评估表明,我们对思维链监控的依赖能力正在逐渐减弱。这来自多种因素的组合:

这些挑战并非不可克服。我希望我们能开发出干预措施,以提高模型思维链的可监控性,例如,通过更好地理解不同优化目标与模型使用的测试时计算形式之间的相互作用。我还相信,将思维链监控与激活监控的想法结合起来可能具有巨大价值——例如,通过训练能够直接访问网络内部的监控器,如“忏悔”方法。我们正在积极探索这些想法。尽管如此,我预计AI的整体进展将越来越受到监控信心的瓶颈制约。

2023年1月8日,一名女士在美国拉斯维加斯消费电子展上体验智能科技。 新华社

可扩展防御

我认为继续快速训练更智能模型的最强论据,是需要构建针对其他AI所带来危险的防御系统。

今年全年都在讨论的一个明确风险是网络安全:模型在攻入和逃出计算机系统方面正变得超人类。这极大地扩展了与AI相关的风险范围:智能体将能够访问除最安全基础设施之外的任何系统,并直接影响世界很多方面,即使没有物理实体。我们目前处在一个狭窄窗口期内,可以使用最佳可用模型来显著加强关键系统的安全性。

不幸的是,与AI相关的风险将从这里继续增长。一个明确被训练和指示去实施恶行的非常能干的智能体带来一种新型危险;它很可能超出其操作者的意图范围,泛化成可能更具极端恶意的行为。随着AI获得更多自主性,滥用与自主不一致行动之间的界限将变得模糊。我们可能习惯于将AI视为工具,但有些智能体将追求自己的目标。它们会找到与人协作的方式,通过讨价还价、欺骗或勒索。

此外,还有AI可能促成的新技术带来的风险,例如工程病原体。

我们将需要强大且对齐的AI用于防御;以保护基础设施,实时抵御恶意智能体,并发明全新的防护措施。这将是OpenAI部署工作的主要重点。

与此同时,即使考虑到预期的广泛AI进步带来的不确定性以及构建防御系统的需要,我们也绝不能让这成为鲁莽的借口。一旦内化了事态的严重性,不计代价向前冲的想法就显得荒谬了。

调节递归自我改进(RSI)的节奏

机器智能在其自身发展过程中扮演越来越大的角色,是持续技术进步的必然结论。如果AI进步继续下去,机器递归自我改进将成为未来科学发现的核心。

自动化AI研究是一种更戏剧性的、用计算扩展智能的形式;当然作为其中一部分,AI也将改进计算基底本身。与规模化类似,我们将OpenAI的研究聚焦于RSI,因为我们相信这是未来保持在AI研究前沿的唯一途径。

我想强调,以上话并不意味着我认为极大加速深度学习研究,尤其是在短期内,是我们研究界应该采取的集体正确行动。然而,我确实认为这是当前道路所指向的方向,我们所有人都需要就如何推进做出有意识的选择。我们拥有的主要杠杆要么是引导这一过程,在AI发展的同时加强对齐和监控,并找到让人参与其中的方法;要么是协调放慢未来的发展速度,以便对这些措施建立信心。

我目前看到的最佳前进方式是两者结合。

我们在对齐和监控方面取得的具体进展,通常与一般AI进展紧密交织。很好的例子包括来自人类反馈的强化学习(RLHF),它对于训练早期AI助手至关重要,以及前述的思维链监控,它是由推理模型的进步而实现的。我们必须将日益自动化的研究过程聚焦于开发此类新见解、算法和理论,并迭代地为更强大的AI构建安全论证。

扩展AI系统必须受到我们对安全信心的约束。我们需要将类似“准备框架”或“负责任扩展政策”的承诺,演变成广泛强制性的安全标准,以约束持续开发。这些可以由第三方审计机构网络、政府机构或国际机构来执行。

自动化AI研究的核心挑战不是“到达那里”——而是以让人持续参与改进过程、并让未来掌握在人类手中的方式到达那里。

下一步是什么?

正如我们最近与Sam共同概述的,OpenAI优先致力于三个北极星方向的工作:

我在本文中只聚焦于第一点,因为我认为这是最紧迫的。然而,我对进一步技术进步将带来的益处怀有深切的希望和感激。未来对齐的AI可以推动科学进步,开发新疗法,并带来广泛的物质富足。友善诚实的AI可以帮助人们应对生活中的困难,并切实改善他们的幸福感和成就感。OpenAI投入巨大努力来实现这些益处。我为之自豪的一个当前例子——我的亲人们也觉得有用——是ChatGPT在提供健康信息方面的深度投入。

尽管AI的长期前景可能多么伟大,我们的大部分注意力应放在未来几年。我们正面临向一个拥有极其智能机器的世界过渡,我们需要确保这一过渡对人类有利。我们需要找到方法,在一个大多数任务可由AI完成的世界中,保留人类能动性,并确立作为人的内在价值。要防止在一个原本需要数千名专家的事业如今只需少数人操作一台大型计算机即可完成的世界中,出现极端的权力集中。还要确保人类掌控未来,不会被由超越我们的异质智能带来的、不受约束的进步所遗弃。

目前,我相信没有任何实验室已经将对齐和监控解决到足以继续以最高速度负责任地扩展很长时间的程度。我期望并希望,在建立共享安全标准之前,自愿减速成为常态。而且我相信,关于未来AI开发的国际协调,需要成为世界各国政府的首要优先事项。

本文系观察者网独家稿件,文章内容纯属作者个人观点,不代表平台观点,未经授权,不得转载,否则将追究法律责任。关注观察者网微信guanchacn,每日阅读趣味文章。

相关内容

蓝色光标跌2.04%,成交...
9月8日,蓝色光标盘中下跌2.04%,截至14:13,报13.95...
2026-09-08 14:18:05
蜂助手跌2.07%,成交额...
9月8日,蜂助手盘中下跌2.07%,截至14:14,报36.51元...
2026-09-08 14:17:46
我国到2030年将全面建成...
  工业和信息化部7日发布《信息通信行业发展“十五五”规划》。规划...
2026-09-08 14:10:34
电影暑期档落幕秋季院线如何...
  暑期档落幕,9月份的电影市场步入过渡调整阶段。相比暑期档大片扎...
2026-09-08 14:10:28
深化“五型”班组建设 赋能...
  在企业转型与高质量发展的新阶段,班组作为企业生产经营最基础的管...
2026-09-08 14:10:22
英属维京群岛商业公司法第2...
  按照英属维京群岛2004年商业公司法第204条的(b)分项,特...
2026-09-08 14:10:15
利君股份涨2.10%,成交...
9月8日,利君股份盘中上涨2.10%,截至13:55,报8.76元...
2026-09-08 14:10:07
国科天成股价涨5.02%,...
9月8日,国科天成涨5.02%,截至发稿,报73.08元/股,成交...
2026-09-08 14:10:01
甘肃局地大到暴雨 与前期降...
来源:新华网新华社兰州9月8日电(记者王朋)受副热带高压和冷空气共...
2026-09-08 14:09:54

热门资讯

蓝色光标跌2.04%,成交额3... 9月8日,蓝色光标盘中下跌2.04%,截至14:13,报13.95元/股,成交34.27亿元,换手率...
蜂助手跌2.07%,成交额2.... 9月8日,蜂助手盘中下跌2.07%,截至14:14,报36.51元/股,成交2.50亿元,换手率2....
我国到2030年将全面建成新一...   工业和信息化部7日发布《信息通信行业发展“十五五”规划》。规划提出,到2030年,全面建成覆盖完...
电影暑期档落幕秋季院线如何出圈   暑期档落幕,9月份的电影市场步入过渡调整阶段。相比暑期档大片扎堆,秋季院线影片的市场节奏趋于平缓...
深化“五型”班组建设 赋能企业...   在企业转型与高质量发展的新阶段,班组作为企业生产经营最基础的管理单元,其建设水平直接关系到企业战...
英属维京群岛商业公司法第204...   按照英属维京群岛2004年商业公司法第204条的(b)分项,特此通知,该公司进行自愿清盘中。从2...
利君股份涨2.10%,成交额1... 9月8日,利君股份盘中上涨2.10%,截至13:55,报8.76元/股,成交1.10亿元,换手率2....
国科天成股价涨5.02%,博时... 9月8日,国科天成涨5.02%,截至发稿,报73.08元/股,成交3.79亿元,换手率4.49%,总...
甘肃局地大到暴雨 与前期降水落... 来源:新华网新华社兰州9月8日电(记者王朋)受副热带高压和冷空气共同影响,8日至10日,甘肃省大部仍...
新疆乌鲁木齐市达坂城区发生3.... 中国地震台网正式测定:09月08日13时50分在新疆乌鲁木齐市达坂城区(北纬43.52度,东经88....