Cerebras推出全新CS-4解决方案,搭载其最新的WSE-3T芯片。这款晶圆级引擎芯片集成了4万亿个晶体管和90万个核心,单晶圆AI算力高达250 PFLOPS(稀疏计算),带宽提升至43.2 PB/s,配备44 GB片上SRAM.CS-4采用全新的Nexus平台架构,通过模块化“背包”设计实现电源转换、直接液冷、高速I/O和控制系统的紧凑集成,据称每瓦吞吐量较上代提升10倍。

cerebras-cs4-generates-in-one-second-while-gpu-rack-takes-thirty.jpeg

Cerebras CS-4由晶圆级芯片驱动,单晶圆算力达250 PFLOPS,带宽43.2 PB/s,配备44 GBSRAM。早在2024年,Cerebras便推出了第三代晶圆级引擎WSE-3,这款晶圆作为单芯片运行,提供了强大的计算能力。Cerebras自成立以来一直专注于晶圆级芯片的研发,而今天,该公司揭开了其晶圆级征程的新篇章。

Cerebras首席执行官兼联合创始人安德鲁·费尔德曼(Andrew Feldman)表示:“在AI领域,速度就是生产力。过去,快速推理意味着使用更小、能力更弱的模型。Cerebras CS-4在最大的前沿模型上提供了业界领先的速度,从根本上改变了这一范式。设计的每一个方面都针对最高速度和海量吞吐量进行了优化。有了CS-4,AI变得如此之快,从根本上重塑了产品体验。”

全新WSE-3T芯片作为WSE-3的后续产品,延续了“最大AI处理器”的定位,晶体管数和核心数与上代相同,分别为4万亿和90万个。整个芯片面积为46,225平方毫米,并配备44 GB直接集成在晶圆上的SRAM。

在部分高阶性能指标上,WSE-3T据称可提供双倍的AI计算能力,单晶圆算力达125 PFLOPs(稀疏计算下为250 PFLOPS),带宽提升至43.2 PB/s。片上互连提供53.5 PB/s的带宽,而片外I/O提供2.4 Tb/s的带宽。晶圆级引擎的更新还将延迟从5毫秒降低至2毫秒。

目前披露的芯片信息就这些,但如今的AI已大不相同。芯片固然是至关重要的组件,但AI客户追求的不是芯片本身,而是系统与一站式解决方案。因此,Cerebras将其最新的CS-4机架级解决方案搭载了WSE-3T芯片。

据Cerebras介绍,CS-4构建于其全新的Nexus平台架构之上,该架构以模块化概念为核心,包含三个层面:计算层、电源层和I/O层。每个机架采用可插拔的“背包”设计,计算子系统以“背包”形式置于机架后部,垂直连接至电源阵列。

每个自成一体的晶圆级“背包”将电源转换、直接液冷、高速I/O和控制系统集成于一个紧凑的封装中。新设计还通过将电源转换移近晶圆,几乎完全消除了功率损耗。由于损耗降低,更多功率可被输送至WSE芯片,为引擎提供2倍的电力,从而实现更高频率与更快计算。

该公司还声称在GPT-OSS 120B等模型中具备强大的计算吞吐能力。单个CS-4机架在此模型中每秒可生成超过4,400个词元。他们还对比了基于GPU的AI解决方案:CS-4生成内容仅需1秒,而GPU机架需要30秒。

总体而言,Cerebras声称CS-4相较于CS-3,每瓦吞吐量提升了10倍。每个CS-4机架将配备三颗WSE-3T芯片,提供750 PFLOPs的AI算力、7.2 Tb/s的I/O带宽和129.6 PB/s的SRAM带宽。借助新的互连方案,AI工厂可将CS-4扩展至大规模集群,以支持超过50万亿参数的模型。

首批搭载WSE-3T的CS-4预计将于本季度开始出货,英伟达(NVIDIA)是其意欲撼动的主要竞争对手之一。Cerebras还与AMD达成合作,将其晶圆级机架方案与Helios AI机架相结合,以提升AI吞吐量,这与NVIDIA利用Groq 3 LPX机架将KV缓存卸载至芯片上大容量SRAM的做法类似。


文章标签: #AI芯片 #晶圆级 #Cerebras #算力 #解决方案
菠萝老师先生

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。