OpenAI的GPT-6 Astra正被证明是一款绝对的现象级产品,从这家AI实验室目前吸引到的企业资金规模来看,其增长势头之猛,已令宿敌Anthropic首次在大约两年半的时间里陷入被动局面。

OpenAI-GPT-6-Astra-1-1-scaled.jpeg

OpenAI的GPT-6 Astra凭借其新颖的循环Transformer架构,如今正被证明在企业客户中绝对大受欢迎。

“上周,OpenRouter用户在OpenAI模型上的支出超过了在Anthropic模型上的支出。这种情况已有超过两年半未曾出现。”——tae kim(@firstadopter),2026年9月15日

根据OpenRouter的数据,上周用户在OpenAI模型上的支出超过了Anthropic的模型,实质上扭转了过去两年半一直延续的格局。

OpenAI在前沿领域正赢得企业支出。截至本周,根据Ramp的数据,Astra占据企业AI支出的13%,而Fable仅为8%。一些初步想法:1. Anthropic在最近呼吁放慢前沿步伐的决策中承担了巨大风险。其前沿模型已经落后于……——Ara Kharazian(@arakharazian),2026年9月15日

这一观点也得到了Ramp数据的印证:数据显示,上周OpenAI的GPT-6 Astra拿下了企业支出13%的份额,而Anthropic的Fable级模型仅占8%。

当然,就整体采用率而言,Anthropic仍然领先。但若近期趋势持续,OpenAI有望凭借Astra的强劲表现实现反超。

正如我们近期所指出的,OpenAI在一个10万块GPU的集群上训练了GPT-6 Astra,此次训练运行的成本很可能在5亿美元至10亿美元之间。为那些可能尚不了解的人说明一下:GPT-6 Astra无需开发者为AI智能体所需的每个应用提供专用API,而是能够以与人类极为相似的方式操作任何给定软件;它生成智能体,让这些智能体跨浏览器、电子表格、网站和桌面应用协同工作,产出成品文档和演示文稿,并执行多步骤工作流,而不仅仅是告诉用户如何完成。

基本上,GPT-6 Astra的核心推理引擎利用原生多智能体结构来解决复杂问题。面对复杂任务时,该模型的主编排智能体会制定一个方案,并部署不同的子智能体来并行测试各种变体并验证结果。这种原生委派机制使其对“毁灭循环”——即模型陷入重复错误循环——具有高度韧性,能够自主调试自身代码并实时调整策略。

SemiAnalysis:对低容量内存需求最强烈的呼声恰恰来自这些实验室本身,这表明它们认为模型参数规模不会有太大增长。“我们所观察到的是,参数规模并没有真正大幅增长。有太多技术试图保持……”——Fireside Alpha(@firesidealpha),2026年9月15日

此外,据SemiAnalysis称,OpenAI的GPT-6 Astra很可能采用了循环Transformer架构。回顾一下,一个AI模型基本上由一系列Transformer块或层组成,这些块或层由两个关键要素构成:

注意力层(Attention Layer)负责观察句子中词语之间的关联方式。例如,如果你给模型一个提示“巴黎是法国的首都”,注意力层会将“首都”一词与“法国”关联起来,并识别出“巴黎”为答案。即便如此,该层并不知道法国或巴黎意味着什么,但会以KV缓存的形式保存这些记录。随着上下文增加,KV缓存也随之增大。

前馈网络(Feed-Forward Network,FFN)以权重的形式保存模型的全部知识总和,正是这一层使用深度数学公式来挖掘每个词背后的含义。例如,它会审视“法国”并激活其国家百科知识,以此类推。

在普通模型中,一个输入token依次经过第1层、第2层,一直到最后一层,每一层都拥有自己独特的权重。然而在循环Transformer架构中,token会被多次送入给定的Transformer块,每次通过相同的权重都让该层得以优化其输出。这使得模型的响应能够变得更加准确,而无需增加权重或参数的数量。另一方面,循环Transformer会显著增大KV缓存的大小。然而,正是这种独特的架构,很可能让OpenAI的GPT-6 Astra展现出可观的性能提升。

大船🚢这周,然后为开发者日🚢🚢🚢🚢🚢🚢——山姆·阿尔特曼(@sama),2026年9月15日

最后,请注意山姆·阿尔特曼刚刚预告了本周将有一款重大模型发布,而下周预计将有多场发布活动,类似于OpenAI的DevDay 2025——当时这家AI实验室宣布了七项重大产品发布和平台更新。


文章标签: #OpenAI #GPT #AI企业 #Anthropic #循环架构
菠萝老师先生

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。