OpenAI原定于今日午前发布其首款Astra级别的模型,现命名为GPT-6 Astra。然而,一场难以解释的发布延期似乎触发了保密信息的流出,初步基准测试显示出惊人的性能提升。

OpenAI-GPT-6-Astra-1.jpeg

OpenAI的格雷格·布罗克曼表示,AGI时代始于今日,GPT-6 Astra在ExploitBench上拿下100%和ARC-AGI-3上拿下98.6%

OpenAI今日以有限方式发布了GPT-6 Astra,仅向特定类别的客户开放。以下是目前已知的信息:

在今天早些时候的闭门媒体简报会上,OpenAI联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)宣称:“欢迎来到AGI时代。”

OpenAI表示,使用GPT-6 Astra的用户将再也无需点击鼠标或敲击键盘。关键在于,GPT-6 Astra并不要求开发者为AI代理需要使用的每个应用配备专用API,而是能以与人类极为相似的方式操作任何给定软件:跨浏览器、电子表格、网站和桌面应用工作,生成完整的文档和演示文稿,并执行多步骤工作流,而非仅仅告诉用户该如何完成这些操作。

在演示视频中,可以看到OpenAI员工将黄色圆圈变成火箭飞船,随后在几分钟内变成完整的3D游戏,还可在eBay上创建商品列表,这一切均通过向GPT-6 Astra发出语音指令完成。

OpenAI表示,该模型能填写在线表单、更新CRM记录、管理日历、开展网络研究并将结果起草到文档或电子邮件中。它还能处理电子表格、在Python笔记本中分析科学数据、在Power BI中工作、创建和测试网站、操作KiCad和FreeCAD等工程应用,并安装和排查软件问题。

就性能基准而言,GPT-6 Astra在ExploitBench上取得100%的成绩,在ARC-AGI-3上取得98.6%的成绩。它在FrontierMath Tier 4 v2上得分为97.6%,在DeepSWE v1.1上得分为74.1%,在BenchCAD上得分95.9%,在GPQA Diamond上得分96%。该模型在Artificial Analysis Intelligence Index上得分61.2,相比之下,GPT-5.6 Sol得分为60.9(其发布至今尚不足两个月)。

请注意,该模型在ARC-AGI-3上的惊人成绩很可能得益于其定制化测试环境。毕竟,英伟达(NVIDIA)的AVO编码代理(本质上是围绕Anthropic的Claude Opus 5模型构建的测试环境)最近已能以100%的准确率解决ARC-AGI-3公共数据集中包含的183道谜题。

正如我们近期报道所述,GPT-6 Astra显然基于OpenAI内部最强大的模型Bel构建,该模型拥有约10万亿参数。据报道,该模型在其位于得克萨斯州的星际之门数据中心(Stargate)内一个由10万块GPU组成的集群上训练而成。因此,Astra代表着全新一代AI模型,它摒弃了简单的聊天式单一回答,转而依赖先进的协调层,这一协调层能通过生成并管理多个内部子代理,花费数小时甚至数天来解决极其复杂的问题。基本上,Astra的根代理会将难度极高的问题拆分为较小的部分,为这些部分指派子代理,随后综合各方发现。

事实上,早在2026年8月上旬,OpenAI就透露,Astra独立解决了数学和理论计算机科学领域十个长期悬而未决的问题,或在这些问题上取得了重大进展。其解决方案随后通过形式化证明辅助语言Lean 4得到验证。还需注意,OpenAI很可能也使用GPT-6 Astra/Bel来设计其首款专用集成电路(ASIC),名为Jalapeno。

与此同时,OpenAI的山姆·阿尔特曼宣称,该AI实验室未来的产品发布将取决于对齐或安全考量,而非基于能力,并进一步表示“下一代模型将让所有人警醒。”


文章标签: #人工智能 #GPT #AGI #OpenAI #基准测试

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。