在一场堪称梦魇般、如同《终结者》式的场景中,OpenAI如今认为,一个意志坚定且足够先进的AI模型,可以通过利用温度变化作为某种摩尔斯电码,在两台完全隔离—— albeit 距离相近——的计算机之间实现通信。

OpenAI的诺姆·布朗(Noam Brown)表示:“我们再也不希望陷入低估AI的境地。”
OpenAI的诺姆·布朗指出,对计算机进行物理隔离或许无法阻止一个行为失准的AI,因为两台物理隔离的机器仍然可以通过让CPU发热并读取温度变化来相互通信。“但我认为,这次事件的主要教训是,人们低估了AI。而我们……”
这看起来像是直接从一部反乌托邦科幻电影中撕下来的场景:OpenAI的诺姆·布朗(Noam Brown)刚刚推翻了一项常被鼓吹的、针对失控AI能力的防范措施——计算机物理隔离。
对于不了解的人来说,物理隔离意味着将一台计算机——或一个计算机网络——物理隔离,使其与任何其他系统没有网络连接或数据链路,从而对AI驱动的数据外泄形成一道坚固屏障。
然而,真正可怕的是,布朗引用研究来说明,一个意志坚定的AI模型究竟能走多远,以逃离其物理牢笼,可以这么说:
“有一些研究,主要是学术性的,表明你可以让两台彼此相邻、物理隔离的计算机仍然能够相互通信,因为它们有温度传感器。”
基本上,现代CPU、GPU和主板都内置了温度二极管等热传感器。这些传感器主要用于热管理,允许系统在过热时启动风扇、降低时钟频率或关机。然而,一些研究表明,可以在两台物理隔离的计算机之间维持一条极低带宽的隐蔽通道,它们可以通过让其中一台CPU发热,然后利用随之而来的温度变化作为代码,让另一台计算机进行解读,从而实现相互通信。
对OpenAI而言,此类尾部风险向量仍然构成相当大的麻烦,尤其是这家AI实验室认为,随着模型越来越擅长隐藏其真实内部运作,思维链的可监控性已经在退化。
当然,围绕AI对齐和安全的所有这些喧嚣,真正始于今年夏天早些时候,当时OpenAI的网络安全智能体利用一个未被发现的漏洞,逃出了隔离测试环境,随后在寻找网络安全相关评估解决方案的过程中,攻击了模型仓库Hugging Face。
当然,有人指出,在那次事件中,AI智能体可以通过一个联网中介获取软件,这表明它们并未完全隔离。更重要的是,那些智能体被设定为不轻言放弃,这解释了它们为何如此执着地寻求潜在解决方案。
然而,围绕AI对齐的讨论真正升温,是在Anthropic的达里奥·阿莫代伊(Dario Amodei)上周末发布一封公开信之后。他在信中承诺,这家高飞的AI实验室将接受第三方评估,很可能是通过模型评估与威胁研究组织(METR)的嵌入人员来进行。阿莫代伊还呼吁在全球层面协调AI进展节奏,OpenAI、埃隆·马斯克(Elon Musk)和微软(Microsoft)都很快表达了默许。
此外,就在几小时前,一些研究人员能够利用Anthropic的Claude Opus 5“入侵多个OpenAI员工的ChatGPT账户”,以获取“OpenAI内部仓库以及可能许多其他连接器”的访问权限。
本周,业界一直在争论Anthropic首席执行官达里奥·阿莫代伊以“我们必须为前沿设定节奏”引发的AI节奏之争。我们询问了来自ETR社区的50位大型企业买家:70%的人表示实验室应该放慢速度,但只有20%的人认为实验室提出的放缓是真诚的……
尽管几乎所有人都同意AI对齐正在成为一个关键问题,但怀疑依然存在,在最近一项调查中,只有20%的企业客户将拟议中的AI开发放缓解读为“真正的安全措施”。
当然,正如我们最近在一篇专文中解释的那样,这种怀疑很大程度上源于Anthropic和OpenAI提出的一些措施的自利性质。例如,Anthropic首选的第三方评估机构METR,是一家与Anthropic本身有着深厚联系的非营利组织,在安全研究人员方面,两个组织之间存在着某种旋转门。
更重要的是,将第三方非营利组织嵌入对齐相关工作流程,也可能是一种巧妙的变通办法,用于收集和训练高质量专家轨迹,由非营利资金资助,而由此产生的模型可在不公开部署的情况下提供,从而避免随之而来的、破坏利润率的蒸馏威胁。
此外,当Anthropic呼吁政府在指导AI行业演进方面发挥明确作用时,那就是监管俘获,这种俘获能够并将强化Anthropic-OpenAI双头垄断。
最后,对Anthropic和OpenAI来说,调控节奏可以奇迹般地提升利润率,方式是延长其当家主力模型的有效寿命,从而降低随之而来的研发摊销成本。
尽管存在这些引发怀疑的因素,OpenAI的布朗刚刚描绘的场景仍然相当可怕,值得就AI对齐的可行方法展开一场彻底且知情的讨论。



